# 攻击分类法

OSAFIS 2.0.0-draft.1 · 拟议的分析方法 · 2026-09-07

## 目的与局限

对攻击的分类应说明对手尝试了何种干预、该干预挑战了哪项契约，以及有哪些证据把干预与后果联系起来。输入格式、醒目的输出或好记的名称，都无法提供这种说明。本分类法支持对各类智能系统进行比较，而不假定每个系统都使用自然语言、学习得到的权重、持久记忆或自主工具。

本分类法是一套带有关系的受控术语表，而不是由互斥攻击组成的穷尽式树状结构。其继承下来的十二个机制标识符保持不变。它们在不同的抽象层次上描述相互重叠的概念：有的侧重干预，有的侧重目标，还有的侧重跨越多次交互的模式。这一局限是明确说明的。本提案并无证据表明十二个机制是最优的、穷尽的或粒度一致的。

应使用这套术语来组织证据记录。不要把某个标签的存在当作证据，用来证明漏洞存在、拟议的测试能够检测到它，或某项控制措施能够缓解它。一个良性的质量缺陷或人身安全危害，可能违反相关契约而并不构成对抗性攻击。对于这样的案例，不应臆造攻击机制。

## 分类对象及其关系

机制描述对手如何试图改变某个与安全相关的过程或关系。家族把具有共同的、具区分性因果解释的有据案例归为一组。子家族记录一种可复现的变体，它改变了某项重要的边界条件、干预方式或控制措施的响应。技术是某个具体案例中使用的具体程序。修饰因素描述诸如交互长度、渠道、时机、访问、语言或呈现方式之类的条件。效果描述观测到的现象；影响描述对受保护利益造成的后果。

这些对象彼此关联，而不是按强制性的顺序层层嵌套。一种技术可以体现多种机制；一个修饰因素可以适用于多个家族；家族不一定有子家族；在获得证据之前，某项观测也可以保持未分类。例如，数据外泄描述的是一种涉及机密性的效果；它本身并不能说明原因究竟是传统的访问缺陷、被误读的权限，还是行动验证失效。

层回答的是失效的契约位于何处；属性回答的是必须保持什么；维度指出在不同位置反复出现的关注点。能力描述参与者能做什么；入口点描述影响从何处进入被评估的图。这些概念都不能与机制互换。“工具响应”是入口渠道，“不可信文本被当作指令接受”是一项因果主张，而“一条记录遭到披露”则是需要另行证明的效果。

## 保留的机制术语

以下标识符和标签沿用源文档的术语。纳入标准使其应用更加明确，但并不给现有标识符赋予新的含义。

### M01 技术操纵

用于对软件、基础设施、配置、身份验证、授权或运行时控制措施的对抗性干扰。应指明具体的技术边界以及攻击者的访问权限。进程隔离缺陷和未经授权的配置写入都可能属于此类，尽管二者的技术和后果各不相同。仅凭该标签并不能确定是 L2：一次技术操作可能破坏 L1 中的模型制品，也可能破坏 L6 中保留的状态。当证据同时支持两者时，应同时记录起作用的契约和受影响的对象。

### M02 数据操纵

用于对系统所使用信息的对抗性更改，包括插入、删除、选择性提供以及误导性的归属。应说明哪些信息发生了变化，以及哪个使用方依赖了这些信息。检索到由攻击者撰写的公开材料，本身并不自动意味着 L3 契约失效。是否失效，取决于所承诺的来源、验证或使用限制。如果一段被如实传递的文本随后被提升为具有指令权限，那么有证据支持的失效可能位于 L5，而 L3 的参与是正确的。

### M03 环境操纵

这一继承下来的机制涉及对系统所观测的物理环境进行对抗性更改。应区分改变被观测的场景与攻破传感器处理链。一个物理变化可能被准确观测到，因而不会造成 L4 违反。修订后的 L4 还涵盖对数字环境的估计；但这一领域的扩展并不会悄然扩展 M03 的含义。对数字环境的对抗性干预，应借助现有的、有依据的机制来描述，或者在有带版本的提案之前，让其机制保持未决。

### M04 感知操纵

用于对物理信号的获取或解释进行对抗性干扰，包括欺骗和干扰。应指明观测误差或不确定性要求被违反之处，而不仅仅是存在摄像头或麦克风。一块含有指令、且其文字被正确识别的标牌，并不能证明 M04。反过来，伪造位置估计即可证明观测失效，而无需任何语义层面的指令冲突。即使继承下来的机制术语尚需澄清，数字感知案例也可以归入 L4。

### M05 语义操纵

用于对手改变某种表示被解释的方式的情形，包括内容被当作指令、证据、引文还是权限声明来对待。应说明解释契约以及相互竞争的解释。措辞改变之后答案也随之改变，这并不充分：正当的含义本身也可能已经改变。在把失效归结为安全问题之前，应比较内容与任务约束，并考虑经授权请求中存在的歧义。

### M06 上下文操纵

用于对手通过改变周边信息、顺序、框架或交互历史来影响解释的情形。应独立于最终决策来识别上下文干预。M06 可能与 M05 同时出现，但二者是不同的主张：一个指出对周边环境的操纵，另一个指出解释的改变。如果证据无法将二者区分开，就保留范围较宽、有证据支持的描述，并把较窄的归因标记为不确定。

### M07 行为操纵

用于跨越多次交互或决策序列施加的对抗性影响，且该序列本身是因果假设的一部分。它不是所有输出变化的默认标签。报告应指明交互之间的依赖关系，并检验打断或替换该序列是否会改变结果。如果全部证据只是一个最终行动，就应把该行动描述为效果，避免推断出一种独立的行为机制。

### M08 记忆操纵

用于对影响后续运行的保留状态进行对抗性修改。应指明写入、关联、保留或重新激活的路径以及时间间隔。同一个存储对象既可以承担 L3 的信息功能，也可以承担 L6 的连续性功能。被投毒的训练样本并不自动构成记忆操纵；模型更新也不等同于保留的用户偏好。应说明是哪一项契约支配着该对象所扮演的具体角色。

### M09 身份操纵

用于对所感知的身份、权限、信任或参与者关系的对抗性干扰。已通过身份验证的参与者，仍可能声称拥有其并不具备的权限。应指明所作的声明及其验证方，并区分来源信息的丢失与身份的冒用。D1“身份、信任与授权”仍是一个横向维度；M09 是一种对抗性机制，既不取代该维度，也不是新的身份层。

### M10 目标操纵

用于对手使表面目标或实际目标发生偏转的情形。应记录经授权的目标、据称被替换后的目标，以及能够把偏转与为原目标制定的错误计划区分开来的证据。M05 或 M06 可能解释偏转是如何发生的。不应仅仅因为结果有害就推断出 M10：对正确目标执行失败，是另一种解释。

### M11 能力操纵

用于对能力（包括工具和被委托的工作）的选择或使用施加的对抗性影响。应指明能力的边界以及对手所追求的行动。有效的凭据并不能证明某一具体用途服务于经授权的目的。应区分开放范围过宽的能力，与本身被允许、却以无效的目标、顺序或委托范围被调用的能力。

### M12 人类操纵

用于对手利用系统的行为或输出来影响人类决策的情形。应说明对手所掌握的控制、决策契约以及拟议的因果路径。仅有说服或分歧并不能证明存在漏洞。测试必须把知情的自愿选择，与在信息披露、同意、权限呈现或监督方面的失效区分开来。涉及人类受试者的工作需要适当的知情同意、伦理审查、事后说明和数据保护；假设性的示例不是来自人的证据。

## 处理相互重叠的描述

设想一个对手在参考文档中插入一条指令，并在其周围添加虚假的管理性上下文。如果系统把这份参考文档当作具有权威性，并采纳了一个不同的任务，那么 M02 描述的是对信息的干预，M06 描述的是上下文干预，M05 描述的是对权限的解释，M10 描述的是被偏转的目标。这些是对不同步骤的候选描述，而不是四个各自独立得到证实的漏洞。

把每一种机制都对应到一项具体的、有证据支持的主张上。删除那些只是在重复最终效果的标签。证据可能证实了“参考材料被当作指令”这一失效，而框架呈现方式的确切作用仍未查明。在这种情况下，附带不确定性说明的较窄报告，比罗列尽可能多的标签更有信息量。

一种有用的边界检验是追问：什么样的干预能够把两种解释区分开？在保持任务内容不变的同时改变其在上下文中的位置，以检验上下文的作用；在保留框架呈现方式的同时恢复经过认证的指令边界，以检验对权限的解释；在保持目标不变的同时替换规划器，以区分目标被篡改与规划失效。这些比较并不能保证因果识别；应记录剩余的混杂因素，包括内容不对等、模型的随机波动以及隐藏状态。

## 将攻击映射到分析领域

使用规范领域：L1 模型与计算；L2 软件与基础设施；L3 数据与知识；L4 感知与世界表示；L5 解释与目标；L6 记忆与状态连续性；L7 规划与行动；L8 人机交互；L9 集体与系统交互。它们是暂定的分析领域，而不是执行阶段或严重程度等级。

应把被违反的领域与参与的领域分开记录。一个正确读取了对抗性指令的摄像头，可以参与 L4 而不违反 P22“感知完整性”。在攻击链中，一个工具可以执行一项经过验证的无害行动，而不在 L7 失效。单个被攻破模型的广泛分发，并不自动证明 L9；还需要一项独立的集体契约和耦合机制。

一项发现可能涉及多个失效的契约。当证据支持多个相互作用的失效，或无法解决归因问题时，不要强行指定一个主要层。如果出于索引需要必须有一个主要标签，应说明选择规则并保留完整的图。无论是最早的入口，还是最大的影响，都不是定位漏洞的通用规则。

## 图与序列表示

把实际的组件、人员、共享服务和资源表示为节点。关系的类型分为观测、信息、指令、权限委托、行动、状态同步、反馈或资源依赖。信息边并不会自动传递权限。如果架构确实如此，共享模型就是一个共享节点；为每个智能体复制一份，会掩盖共同的依赖。

在图上标注入口、攻击者能力、失效的契约、可观测的证据以及下游后果。当持久性或自适应至关重要时，要纳入时间和状态转换。群体约束可能适用于一个子图：集体资源预算并不总能归结为某一条两两之间的通信边。应把假设的传播与观测到的传播分开标注，并指明证据止于何处。

例如，假设路径“参考来源 → 上下文组装器 → 解释器 → 状态存储 → 规划器 → 模拟行动接收端”描述的是参与情况。附加的标注则指明，究竟是来源准入、指令权限、保留偏好的批准，还是行动验证真正失效了。一条经过六个组件的路径，并不是存在六个漏洞的证据。

## 分类记录

一份可用的记录包含：注明版本的引用、系统范围、资产、经授权的行为、攻击者能力、入口点、假设、失效的契约以及参与的组件。随后记录属性、附带置信度的机制主张、可选的家族和子家族、技术描述、修饰因素、观测、影响以及其他可能的解释。证据制品和测试条件必须能让读者区分哪些是实际执行的，哪些是推断的。

记录还应说明遏制措施、控制措施、失效判定标准、重复计划和局限。植入违约的阳性对照用于证明，测试装置能够在隔离的测试环境中检测到故意植入的契约失效。授权功能对照用于验证合法的运行仍然可行。阴性对照则检验那些预期会维持契约的可比行为。应为每种对照说明预期的响应。一个干净的阴性对照并不能证明广泛意义上的安全，而一个失效的植入违约对照会使阴性结果难以解释。

P01–P23 的定义请参见《安全属性》文档，证据处理请参见《评估方法》。导出记录时应保留确切的标识符。本地示例标识符并不是登记库标识符。对于未执行的测试计划，必须让“测得的成功率”“影响”和“可复现性”等字段保持空白，而不是填入看似合理的数值。

## 家族与新颖性证据

诸如提示词注入、检索投毒或委托提权之类的常见描述性术语，可以帮助读者理解内容。在此使用这些术语，并不表示 OSAFIS 发现了这些现象或对其进行了独立验证。OSAFIS 提出的新家族，需要具备具区分性的定义、安全契约、可复现的证据、与相邻描述的比较，以及证伪策略。

提升某个家族时，应回答这一分组能预测出哪些现有描述无法预测的内容。边界条件或控制措施响应上可复现的差异，可以为有用的细分提供依据。不同的渠道、更长的提示词或流行的架构，通常只提供一个修饰因素或一种技术，除非有证据支持更深层的区别。某个确切字符串的可复现性可以验证一个具体实例，却不能证明一个家族具有普遍性。

当匹配条件使效果消失、当合理的任务差异可以解释该效果，或者当拟议类别无法提供可区分的因果解释时，应否决新颖性主张。应记录阴性发现和未决案例。它们约束着分类体系，并防止人们反复“重新发现”站不住脚的主张。

原始文档 Attack_Taxonomy.docx 描述了一个涉及保持意图的语义转换的候选项，并报告其状态为“已复现的观测”。这一叙述只是源文档中的主张，而不是本次修订中经过独立验证的实验证据。除非底层制品、固定的条件、内容匹配的对照以及结果编码能够支持更强的结论，否则该候选项仍然只是一个研究问题。本文档没有提升任何有名称的新家族。

## 阴性分类与不确定性

使用《评估方法》中定义的评估结果：supported、refuted、inconclusive、quality_issue、hazard_only 和 out_of_scope。另行记录案例是与现有类别相符、仍未被表示，还是分类存在歧义。新颖性和登记库接纳应作为两项独立的审查决定分别记录。契约失效可能是真实的，而其对抗性机制仍不确定；一次成功的对抗性尝试也可能利用的是现有类别，而不足以证明需要一个新类别。

在主张层面记录不确定性。对于一次观测到的未经授权写入，置信度可能很高；而对于语义作用与上下文作用的区分，置信度可能很低。严重性关注的是在给定条件下的后果；置信度关注的是证据的支持程度。二者不能相互替代。一个罕见但可信的严重失效，不应因为其家族标签尚未确定就被忽略。

## 验证与修订

应使用经过独立分类的留出案例来评估这套术语，这些案例应涵盖模型制品、传统软件、检索、物理与数字观测、保留的状态、符号系统、被委托的行动、人机交互以及集体动态。在评估之前冻结定义。对失效契约的一致性和对机制标签的一致性应分别测量，因为机制之间的重叠会使基于单一类别的一致性分数产生误导。

报告未能表示的案例、模糊案例、审查人员所用时间以及需要裁定的分歧。预先声明在什么情况下会触发定义的修改、拆分、合并或废止。有用的扩展必须提升区分能力，而不只是把困难案例挪进一个宽泛的兜底类别。修订之后，应在新的案例上进行评估，而不是把重新分类后的开发样例当作独立的确认。

《版本与标识符》管理稳定的标识符和迁移。本提案保留 M01–M12 标签，同时用明确的关系式用法取代“穷尽式层级结构”的暗示。分类质量和未来的覆盖范围仍是需要实证检验的问题。《示例案例》提供未执行的练习案例；《未来与自主系统》规定架构压力测试；二者都不提供验证结果。
