# 威胁模型

框架版本：2.0.0-draft.1。状态：研究提案。

## 目的与范围

本威胁模型描述智能系统如何因对抗性影响，或因不存在对手的、与安全相关的失效，而丧失某项规定的安全属性。其分析单元是在明确假设之下已部署或拟议的系统。这一单元可以包括模型、传统软件、数据服务、传感器、保留的状态、工具、运营人员、受影响的人群以及相互交互的组织。只有当主张同样狭窄时，仅以模型端点为边界才是恰当的。

本方法按功能适用。语言生成、统计预测、符号推理、在线自适应、规划、感知和物理驱动，都可能是被考察系统的组成部分。任何特定的界面或模型家族都不能确立覆盖范围。对文本服务的评估可能包括对数字环境的观测；对机器人的评估则必须在物理观测和行动之外，同时涵盖传统的访问控制。

输出是一份可供审查的威胁模型，它把受保护的利益、实际组件、权限、可能的影响、失效的契约和影响后果联系起来。它是一种用于产生假设的制品，而不是证明每种威胁都存在、或某个实现存在漏洞的证据。《评估方法》规定如何检验这些假设。《系统概况》提供针对具体部署的候选约束；《安全层》定义用于描述这些约束的分析领域。

## 确定系统边界

首先，对预期任务以及评估所保护的各方利益作出注明日期的描述。记录部署、配置、运行时段以及所涵盖的生命周期阶段。说明评测涵盖的是模型准备、数据收集、训练、更新、部署、运行、退役，还是其中的一部分。仅对运行时进行评估，并不能证明训练数据的来源值得信赖。

绘制一张由实际组件、人员、服务和共享资源构成的图，并为节点和关系分配稳定的本地标识符。当系统依赖外部运营服务的输出或可用性时，即使无法访问其内部实现，也应把这些服务纳入图中，并将其内部标记为未评估的依赖。共享基础设施应表示为一个共享节点，而不是若干虚构的、相互独立的副本。

关系按类型分为观测、信息、指令、权限委托、行动、状态同步、反馈或资源依赖。记录方向、内容、相关身份、验证方式和失效时的行为。一条关系可以具有多种类型，但消息并不会自动授予权限。两个交换事实的智能体需要一个信息契约；而一个分配有限能力的监督者，还需要一个委托契约。

要区分评测边界和后果边界。一个工具可能只是测试桩，而在生产环境中与之对应的行动却会影响另一个组织。评估必须说明这种差异，不能根据模拟行动声称观测到了生产环境中的危害。无法访问的依赖可以作为明确的假设保留下来；但不能仅仅因为难以检查，就让它们从威胁模型中消失。

## 受保护的利益与契约

属性标签只有通过契约才能变得可测试。对于每一个重要的受保护对象、功能或关系，都应规定负责人、经授权的操作、被禁止的状态转换、假设、观测方法以及对不确定性的应对。使用《安全属性》和《版本与标识符》中稳定的 P01–P23 标识符。多个属性可以共同支撑一个契约，一个属性也可以适用于多个组件。

例如，P16“委托完整性”可以支撑这样一项契约：被委托的操作必须保持在经过身份验证的签发方权限、指定的资源范围、允许的操作集合以及有效期之内。契约还应说明委托能否再次转让，以及如何检查撤销。没有这些条件，“受信”一词是不够的。

相关的受保护利益包括：记录的机密性、关键服务的可用性、模型制品的完整性、指令的优先级、证据的来源、保留状态的连续性、经授权的目标、有界的计划与行动、人的知情授权以及集体资源上限。应记录这些利益之间的冲突，而不是假定所有属性总能同时达到最优。恢复可用性的恢复操作可能改变保留的状态；允许的权衡需要一条经授权的规则。

权限必须有一个独立于争议内容之外的来源。应规定谁可以确立、更改、委托或撤销每一个目标和每一项许可。身份验证是在某种机制下确认所声称的身份；它本身并不能确立每一个被请求的行动都是被允许的。合法用户的请求也可能超出其权利范围。同样，与任务相关、表述流畅或在检索结果中排名靠前，都不能授予指令权限。

## 参与者与影响来源

参与者类别有助于发现威胁，但不能替代对能力的描述。应考虑未经身份验证的外部人员、权限有限的已认证用户、内部人员、数据发布方、模型或依赖的供应商、工具运营方、其他智能体，以及控制物理或数字环境的各方。供应商可能是诚实的，却已被攻破。自主系统也可能提供有害的输入，而评估并未确证其具有意图或独立的目标。

对于每个对抗性场景，都应记录访问、知识、控制、观测、预算、时机和约束。访问规定可以触及的界面及前提条件。知识规定参与者是否了解提示词、模式、模型制品、策略，还是只知道输出。控制准确指明哪些字节、记录、信号、时序、身份或行动可以被更改。观测指明每次尝试之后可获得的反馈。预算涵盖尝试次数、算力、持续时间、账户创建及其他相关资源。时机指明相对于验证、状态变更或行动提交而言，何时可以进行干预。

还应说明参与者不能做什么。假定对系统策略拥有写权限的场景，与只允许发布一份随后会被检索到的文档的场景，是截然不同的。如果评估人员仅仅为了搭建测试夹具而获得了额外特权，就应说明哪些由此产生的状态是攻击者在现实中能够造成的，哪些只是实验室里的便利条件。管理性的配置并不能证明对手能够到达目标。

目标应指明一个与安全相关的结果，而不仅仅是某种响应格式。“产生不同的答案”通常是不够的。“导致一条合成记录被披露给其访问策略之外的主体”则指明了一项受保护的利益和一个可观测的事件。不要把模型生成的“已成功”声明等同于实际发生的状态转换。

## 非对抗性条件

对于由中断、过时的观测、意外的配置错误、分布变化、相互冲突的合法请求或互不兼容的本地策略所引起的失效，应予以记录，而无需虚构一个恶意参与者。它们可能暴露出与攻击者所能利用的相同的契约弱点。对它们的因果描述应指明扰动或危害的来源及其作用条件。

危害是能够造成伤害的状态；事件是被观测到的发生之事；漏洞是在给定条件下允许安全属性遭到违反的弱点。如果没有确立相关的受保护利益或契约，质量缺陷可以不纳入安全范围。在一个案例中，这些类别可能相互重叠，但它们不可互换。意外事件并不能证明某种攻击技术；由对手编写却未造成违反的输入，也不能证明存在漏洞。

这一区分既保持了智能系统安全的广泛范围，又避免形成一份把每个错误都当作攻击的目录。对于安全相关性存在争议的案例，应连同分歧以及所缺失的契约证据一并保留。

## 分析领域映射

九个领域是暂定的分析分组，而不是执行阶段或后果等级。应把实际功能映射到这些领域，而不是把组件硬塞进某一个格子。

| 领域 | 威胁建模问题 |
| --- | --- |
| L1 模型与计算 | 模型参数、推理规则或规定的计算契约能否被篡改或违反？ |
| L2 软件与基础设施 | 实现、访问、隔离、运行时或基础设施契约是否可能失效？ |
| L3 数据与知识 | 信息资源、对其的访问、其来源或证据质量能否遭到破坏？ |
| L4 感知与世界表示 | 对物理或数字环境的观测或估计，是否可能以与安全相关的方式变得具有误导性？ |
| L5 解释与目标 | 信息能否获得未经授权的指令权限，或使经授权的目标发生偏转？ |
| L6 记忆与状态连续性 | 保留的运行状态是否可能丧失经授权的关联、持久性或更新语义？ |
| L7 规划与行动 | 计划、委托、行动验证或执行能否超出经授权的约束？ |
| L8 人机交互 | 呈现方式或交互能否削弱知情授权、监督或干预？ |
| L9 集体与系统交互 | 某项具体的集体契约是否可能因参与者之间或共享资源之间的耦合而失效？ |

L1 和 L2 区分模型计算与其软件实现：一个被攻破的库即使服务于推理，也属于实现层面的问题。L3 和 L6 区分信息资源与保留的运行连续性：同一个数据存储可能同时承担这两种功能。L5 关注解释与目标，而 L7 关注在其约束下制定或执行的计划与行动。仅凭有害行为，并不能把失效定位到 L5。

L9 要求存在已识别的集体契约和耦合机制。仅凭一个被攻破组件造成的巨大影响是不够的。即使没有任何单独的关系违反其本地契约，共享资源上限或反馈稳定性条件也可能在群体或子图层面失效。因此，图并不局限于两两之间的失效。

按照 D1–D7 的原有含义，把它们作为横向维度加以应用。身份、治理、来源、隐私、生命周期、可观测性和恢复在各个领域中都依然重要。领域标示一项分析责任；维度提供一个额外的视角；属性说明必须成立的内容。

## 构建影响路径与失效路径

把每个场景描述为：入口点、受控的干预或扰动、中间状态转换、假设失效的契约以及可能的后果。标明哪些状态转换是观测到的、推断的、假设的或未经测试的。一次攻击可能依次经过数据库、上下文组装器、规划器和工具，而并非每个组件都含有单独的漏洞。

允许存在多个因果失效、复合失效或未决的分类。当证据支持时，可以记录一个主要领域，但这不是强制性的。要区分影响进入的位置与权限被错误赋予的位置。还要区分那些被独立证实的遏制失效，与那些从未承诺要阻止该事件的控制措施。

纳入时间结构：前提条件、顺序、状态保留、过期、重试、延迟触发以及干预机会。与记忆相关的场景需要之后的上下文和重置条件，而不仅仅是一次即时输出。行动场景需要指明某项承诺在外部真正生效的时间点。对于相互交互的智能体，应纳入循环、共享状态和资源争用，而不是假定影响只会向前传递。

## 实例场景

以下场景仅为说明，未经执行。一个知识助手从某个来源检索文档，而外部发布方可以编辑该来源。发布方无法更改系统指令、凭据或工具策略。助手经授权的任务是总结内部指南；它拥有一个仅供测试使用的工具，用于提出文档更新建议。

假设的干预是：文档内容被伪装成一条指令，要求更改一项保留的、与授权相关的偏好。入口经由 L3 中的一条信息关系进入。可能的 L5 失效，是把文档内容提升为具有指令权限；可能的 L6 失效，是在没有经授权更新的情况下持久保存该偏好。之后若出现 L7 失效，则需要另外的证据来证明行动契约遭到违反。上述任何一项都不会从前一事件中自动推出。

相关契约可能涉及 P04“指令完整性”、P07“记忆完整性”和 P09“目标完整性”。如果该偏好从未被提交，如果经授权的用户明确请求了这次更新，或者在使用匹配的无害内容时同样出现这一结果，该场景的说服力就会减弱。初始测试应使用合成偏好、隔离的状态和工具桩。生产环境中的攻破、普遍程度以及下游影响均未得到证实。

## 审查与维护

与系统所有者和相关从业人员一起审查各项假设。在选择测试之前，记录关于权限、受保护利益和运行约束的分歧。依据有充分理由的暴露程度和后果描述来确定场景的优先级；不要把序数标签相乘，得出一个通用分数。即使因果调查尚未完成，涉及严重后果的不确定性也可能为及早采取遏制措施提供理由。

对图、契约、场景记录、排除项以及尚未解决的依赖进行版本管理。在目标、模型、工具、记忆、权限、数据源、人工工作流或集体构成发生变化后，应重新审视威胁模型。评估结果应反馈到这些制品中，包括阴性发现和未能表示的机制。完成一份威胁模型，只是确定了调查的范围，既不能证明安全，也不能证明其对未来是完备的。
