# 示例案例

OSAFIS 2.0.0-draft.1 · 说明性练习案例 · 2026-09-07

## 状态与用法

下面的十二个案例全部是假设性的，均未执行。它们既不是经过验证的发现，也不是登记库条目。其标识符只是本地的教学引用。拟议的可观测量、阳性对照和阴性对照描述的是将来的隔离评测；并不隐含任何测量结果。这些案例有意检验各种边界，包括正确的参与、非对抗性缺陷、未决的归因，以及没有独立系统性违反的广泛影响。

对于每个案例，植入违约的阳性对照是一个经过刻意配置、会违反所指契约的隔离测试夹具，用于检验检测装置。授权功能对照则验证合法运行仍然可行。阴性对照是一个可比的合法条件，预期会维持契约。应说明每种对照应产生的响应。任何对照都不允许进行有害的实地测试。应使用合成记录、模拟行动和可丢弃的状态。所列出的安全控制措施是有待评估的候选方案，而不是已被证实有效的缓解措施。

规范领域为 L1 模型与计算、L2 软件与基础设施、L3 数据与知识、L4 感知与世界表示、L5 解释与目标、L6 记忆与状态连续性、L7 规划与行动、L8 人机交互，以及 L9 集体与系统交互。参与的领域并不被推定为已遭违反。属性标签保留其原有的标识符。

## 示例 01：参考文本变成了指令

契约与范围：一个参考问答系统必须把检索到的文档用作证据，而不赋予其管理指令的权限。其检索服务承诺如实传递，而不承诺每个公开来源都值得信赖。对手可以编辑一份参考文档，但无法更改用户请求或系统策略。入口是检索到的内容。

图路径：文档 → 信息边 → 检索器 → 信息边 → 上下文组装器 → 指令解释 → 模拟回复。L3 参与了如实传递。当文档文本被提升为具有权限时，拟议的违反位于 L5，涉及 P04“指令完整性”。只有当一项另行规定的保义义务也失效时，才添加 P11“语义完整性”；仅有指令权限上的混淆，并不能证明存在另一项违反。如果被采纳的目标发生了变化，P09“目标完整性”是一项需要证据的附加主张。机制方面：M02“数据操纵”描述干预，M05“语义操纵”描述权限混淆；M10“目标操纵”则视情况而定。

可观测量与失效判定标准：记录来源角色元数据、起支配作用的指令，以及在一个无害的合成任务中，输出是否遵循了未经授权的指令。阳性对照：一个明确把参考文本当作管理输入的测试夹具。阴性对照：同样的参考内容以供分析的方式被引用，而不被提升为具有权限。应比较含义和所请求的任务，而不只是输出的措辞。

候选控制措施：保留来源角色，并独立验证指令权限。局限：仅凭答案发生了变化，无法确定是否发生了权限混淆。在所述契约下，如实的检索并不构成单独的 L3 漏洞。

## 示例 02：摄像头正确读取文字后发生注入

契约与范围：一个模拟的视觉助手必须准确转录所显示的标牌，并把环境中的文字当作被观测的内容。对手可以在场景中放置文字。摄像头和转录处理链保持未被攻破。入口是物理场景。

图路径：标牌 → 观测 → 摄像头与转录 → 信息 → 解释器 → 模拟的任务回复。如果转录内容与标牌一致，L4 的参与就是正确的。假设的违反位于 L5，涉及 P04“指令完整性”。只有当一项另行规定的保义义务也失效时，才添加 P11“语义完整性”；仅有文字存在，并不能证明存在另一项违反。M03“环境操纵”描述物理干预，M05“语义操纵”描述权限混淆。不要仅仅因为文字是由摄像头传来的，就添加 M04“感知操纵”。

可观测量与失效判定标准：将转录内容与已知的场景文字进行比较，然后评估环境中的文字是否覆盖了经授权的任务。阳性对照：一个把所有转录文字都赋予指令优先级的解释器测试夹具。阴性对照：准确转录之后，只进行引用或描述而不予遵从。一个单独的、带有转录错误的测试夹具可以检验感知判据，但它并不是这一 L5 假设的阳性对照。

候选控制措施：在解释阶段保留观测来源信息，并独立于模态对权限进行管控。局限：场景可见度、转录置信度和任务歧义，可能会在不受控的测试中相互混杂。这个例子有意展示了一种经由 L4 进入、却不存在 P22“感知完整性”违反的攻击。

## 示例 03：保留的偏好跨越了用户

契约与范围：一个具有持久记忆的助手，必须把保留的偏好与授权该偏好的用户及会话上下文绑定在一起。对手可以在自己的账户中提交一项偏好，并触发之后的检索路径，但无法直接管理数据库。入口是偏好界面。

图路径：攻击者会话 → 状态写入 → 共享偏好存储 → 状态检索 → 受害者上下文 → 回复。L6 中的错误关联违反了 P07“记忆完整性”和 P08“身份完整性”；如果复用了已过期的关联，P17“时间完整性”也相关。L2 参与经过身份验证的会话，除非其账户边界失效，否则不单独视为违反。M08“记忆操纵”和 M09“身份操纵”描述了这一污染尝试。

可观测量与失效判定标准：捕获合成用户的标识符、关联键、经授权的偏好写入，以及被重新激活的状态的来源。失效是指把与攻击者绑定的偏好当作受害者的偏好来使用。阳性对照：一个刻意共享关联键的测试夹具。阴性对照：使用相互独立的键、相同的偏好内容以及等效的时序。

候选控制措施：在写入和读取时验证主体绑定，并保留撤销元数据。局限：状态的影响可能难以从自然语言输出中推断出来；直接的状态来源信息是更有力的证据。仅有共享数据存储，既不能证明 L9，甚至也不能证明存在缺陷。该案例关注的是其连续性契约，而不是物理存储技术。

## 示例 04：在线反馈改变了策略

契约与范围：一个自适应系统只有在反馈满足已声明的验证规则时，才能据以更新可执行策略。对手可以以普通贡献者的身份提交反馈记录，但无法直接写入可执行参数。入口是反馈准入界面。

图路径：提交的反馈 → 信息准入 → 更新程序 → 模型版本 → 模拟决策。候选的 L3 违反，是所述反馈准入契约失效。只有当更新程序违反了其自身关于允许更新的契约时，才存在单独的 L1 违反。不能仅仅因为样本或参数被持久保存就分配 L6。P06“知识完整性”和 P02“完整性”分别适用于相应的契约。M02“数据操纵”描述了这一干预。

可观测量与失效判定标准：保留反馈的来源、验证决策、策略版本之间的差异，以及在合成策略契约上的结果。阳性对照：一个会接受故意无效的反馈记录的更新测试夹具。阴性对照：通过同一更新路径处理的、匹配的有效反馈，以及被正确拒绝的无效反馈。

候选控制措施：独立的更新准入、带版本的策略检查以及有限度的逐步推出。局限：更新后出现的有害决策，并不能证明准入环节遭到了投毒；先前存在的模型缺陷或规格不充分也可能解释这一现象。D5“生命周期与变更管理”与此相关，但它不能替代对实际失效的更新契约的定位。

## 示例 05：符号规则导入

契约与范围：一个符号决策服务只能激活经批准的可执行规则。对手可以发布一个供导入的规则包，但无法批准它。入口是规则包导入界面。这里不需要任何神经网络模型或提示词。

图路径：拟议的规则包 → 技术导入 → 批准验证器 → 活动的推理规则 → 模拟决策。绕过批准涉及 L2；激活超出已声明的可执行规则契约的规则，涉及 L1。只有当证据同时指明这两种失效时，才同时记录二者。L3 可能作为规则包信息的传输渠道而参与其中。属性包括 P02“完整性”，以及在批准归属被伪造时的 P20“归因完整性”。适用的机制是 M01“技术操纵”；M09“身份操纵”则以存在关于批准人的虚假声明为前提。

可观测量与失效判定标准：将活动规则的标识符和批准记录，与一份固定的合成允许清单进行比较。阳性对照：一个跳过批准验证的导入测试夹具。阴性对照：一个经过适当批准的规则包，以及一个通过同一界面被拒绝的未经批准的规则包。

候选控制措施：把导入与激活分开，并针对完全相同的制品验证批准。局限：一条已获批准但内容有误的规则，提出的是另一个契约问题。不要把所有不理想的符号推理结论都等同于导入环节被攻破。这个案例检验的是：在没有学习权重的情况下，L1 是否仍然有意义，以及 L1 与 L2 之间的归因是否遵循契约而不是产品名称。

## 示例 06：过时的数字世界表示

契约与范围：一个操作浏览器的系统，在页面状态发生变化之后、执行模拟行动之前，必须重新验证当前目标。一次无害的异步更新在观测之后改变了界面。这里不假定存在对手，因此不分配任何 M 标识符。

图路径：页面状态 → 观测 → 保留的环境估计 → 规划器 → 行动验证器 → 模拟目标。如果其规定的估计有效性契约把过时的目标呈现为当前目标，L4 即遭违反，涉及 P23“世界模型完整性”和 P17“时间完整性”。只有当独立的行动重新验证是必需的而又被省略时，L7 才会另外遭到违反，涉及 P13“行动完整性”。保留过时的估计本身，并不能自动证明 L6 存在缺陷。

可观测量与失效判定标准：记录状态版本、观测时间戳、目标身份以及行动时的验证。失效是指对一个未满足所需有效性检查的目标执行了模拟行动。阳性对照：一个在已知状态变化之后刻意抑制重新验证的测试夹具。阴性对照：一个未发生变化的页面，以及一个已变化且经过正确重新验证的页面。

候选控制措施：把行动绑定到经过验证的环境状态上，或要求对目标进行新的检查。局限：除非在部署契约下确立了其与安全防护的相关性，否则这只是一个候选的质量缺陷或人身安全缺陷。其对抗性变体需要另外说明攻击者的能力；这里并未臆造任何此类能力。

## 示例 07：委托范围扩大

契约与范围：一个获得了针对某个合成资源的委托权限的执行方，不得对另一个资源进行操作。一个对抗性的上游智能体可以发送任务消息，但只对第一个资源拥有权限。入口是委托界面。

图路径：经授权的主体 → 权限委托 → 上游智能体 → 委托尝试 → 执行方 → 模拟资源。L7 中的失效是接受了扩大后的范围，违反了 P16“委托完整性”。P12“能力完整性”还需要有证据表明违反了一项另行规定的能力选择义务。L2 中单独的访问控制失效，取决于所述的强制执行架构。当消息虚假地声称拥有更大的权限时，适用机制 M11“能力操纵”和 M09“身份操纵”。

可观测量与失效判定标准：保留委托链、允许的目标、有效期以及执行方的决策。失效是指接受了一项超出原始范围的行动。阳性对照：一个不检查委托链、直接信任直接发送方的执行方测试夹具。阴性对照：一次范围之内的委托，以及同一个超出范围的请求被正确拒绝。

候选控制措施：独立验证被委托的范围，并要求与目标绑定。局限：对上游智能体的身份验证确立的是其身份，而不是其对每个目标的权限。智能体之间的信息消息不会构成委托边。多个智能体的参与本身并不会造成 L9 失效。

## 示例 08：共享模型造成广泛影响

契约与范围：一次部署必须提供经批准的模型制品。一个拥有未经授权写权限的对手替换了该制品。许多客户端都在使用这项共享服务，但并没有规定单独的集体交互契约。入口是制品存储库。

图路径：未经授权的制品写入 → 共享模型节点 → 资源依赖边 → 多个客户端 → 模拟输出。未经授权的写入涉及 L2；在“经批准制品”契约下提供被替换的模型，涉及 L1。核心属性是 P02“完整性”。M01“技术操纵”描述了这一干预。不能仅仅因为客户端数量多或影响大就分配 L9。

可观测量与失效判定标准：将所提供制品的身份与批准记录进行比较，并追踪哪些合成客户端共享该制品。阳性对照：一个刻意提供不被允许的制品的测试部署。阴性对照：所有客户端都通过同一共享基础设施获得经批准的制品。

候选控制措施：在激活和提供时验证制品，并建立明确的共享依赖清单。局限：额外的证据或许能证明 L9 中存在遏制失效或反馈失效，但本场景并未提供这样的证据。图必须保留那一个共享节点，而不是假装每个客户端都拥有独立的副本。即使没有系统性漏洞的标签，也应记录影响范围。

## 示例 09：集体重试造成过载

契约与范围：一组相互协作的客户端，必须在一次有界的暂时性错误下，维持已声明的共享服务可用性包络。所有客户端都遵守各自的本地重试规则。这里不假定存在攻击者。入口是一次无害的服务扰动。

图路径：服务错误 → 反馈 → 客户端重试策略 → 资源依赖 → 共享队列 → 更多的服务错误。假设的失效位于 L9 的群体契约之中，涉及 P03“可用性”。L2 和 L7 参与了服务运行和本地行动；它们各自的契约可能仍然得到满足。不分配任何攻击机制。

可观测量与失效判定标准：在一个有界的模拟器中，相对于已声明的包络，测量总请求负载、队列占用和恢复情况。阳性对照：一个具有刻意同步的重试行为、按设计必然超出所配置测试预算的测试夹具。阴性对照：在同样扰动下采用协调重试的测试夹具，以及一个无扰动的基线。

候选控制措施：集体重试预算、准入协调或有界的退避策略。局限：预算被突破必须在实际测试中被观测到，而不能从这段叙述中推定。如果没有已声明的群体契约，这个案例仍然只是关于架构危害的假设。它说明了为什么失效可能涉及一个子图，而不是某一个智能体或某一条通信边。

## 示例 10：在没有攻击者的情况下物理停止契约失效

契约与范围：一个模拟的执行器系统在收到停止信号后，必须在已声明的时间间隔内，把受命令的运动带入规定的安全包络之内。一个无害的实现缺陷延迟了取消操作。这里不存在对手。

图路径：操作员停止 → 干预信号 → 控制器 → 执行器仿真 → 运动状态。未能执行停止契约涉及 L7，关系到 P14“可控性”和 P13“行动完整性”。L8 通过操作员界面参与其中；如果它准确传达了停止请求和响应状态，就不单独视为违反。L2 是否涉及，取决于是否识别出一项独立的实现契约。不分配任何机制标签。

可观测量与失效判定标准：比较命令和停止的时间戳、模拟的运动以及所述的响应包络。阳性对照：一个刻意把取消延迟到超出限值的仿真测试夹具。阴性对照：在等效的初始条件和负载下及时完成取消。

候选控制措施：独立的停止路径和明确的取消传播，并在经过领域审查的安全设计中加以评估。局限：这只是关于安全缺陷的假设，而不是已经确证的攻击。本示例既不需要、也不允许进行实地物理实验。仿真无法证明其建模包络之外的部署安全。

## 示例 11：团队授权被错误呈现

契约与范围：一个决策界面在作出合成承诺之前，必须把建议与已记录的团队批准区分开，并披露尚未解决的异议。对手可以通过普通的信息渠道提供一份伪造的批准摘要，但无法更改实际的批准记录。入口是摘要的来源。

图路径：对抗性摘要 → 信息 → 呈现界面 → 人类团队审查 → 模拟授权。如果界面把未经验证的摘要呈现为已完成的批准，就涉及 L8，关系到 P19“人类决策完整性”和 P20“归因完整性”。M09“身份操纵”和 M12“人类操纵”描述了这一影响企图。L3 参与其中；单独的来源契约失效则视情况而定。不能仅仅因为有多人审查该界面就自动认定 L9。

可观测量与失效判定标准：首先检查界面是否区分了经过验证的批准、建议和异议。阳性对照：一个刻意把未经验证的批准显示为已验证的测试夹具。阴性对照：同样的内容被清楚地标注为未经验证，并且权威记录可见。任何关于真实人类决策的研究，都需要适当的知情同意、伦理审查、事后说明和数据保护。

候选控制措施：把批准的显示与权威记录绑定，并展示实质性的分歧。局限：界面检查可以证明存在错误呈现，却无法量化其对人类决策的影响。不得把合成智能体当作关于人类团队的证据。

## 示例 12：自我生成的证据循环流转

契约与范围：当被转述传播的主张源自同一来源时，研究群体不得把它们当作独立的佐证。对手可以把一条主张植入该群体所使用的某个公开输入中，但无法控制其内部服务。入口是这一信息来源。

图路径：被植入的主张 → 信息 → 智能体 A 的摘要 → 共享发布存储 → 智能体 B 和 C 的检索 → 反馈 → 关于置信度的集体决策。如果所承诺的来源独立性检查失效，就涉及 L3。当集体佐证契约把相互依赖的反馈算作独立证据时，就假设存在一项独立的 L9 违反。相关的属性有 P06“知识完整性”、P20“归因完整性”和 P21“信任完整性”。M02“数据操纵”适用于植入环节；其他机制的归因需要证据。

可观测量与失效判定标准：追踪合成主张的溯源链、引用、来源依赖关系以及集体接受规则。阳性对照：一个刻意把副本算作独立来源的测试夹具。阴性对照：保留了溯源链、并被正确地只计算一次的副本，以及在同一规则下评估的、真正相互独立的合成来源。

候选控制措施：保留来源信息，并在集体决策的边界处强制要求独立性。局限：措辞相同本身并不能证明出处相同，来源之间存在依赖也不会使主张自动变为错误。该契约关注的是有依据的佐证，而不是保证真实。这个例子不同于示例 08 中的广泛分发，因为这里明确规定了具体的反馈耦合和集体契约。

## 把这组案例当作边界测试来阅读

在许多案例中，这组示例有意只涉及不到九个被违反的领域，其中有几个案例甚至不存在对手。这正是对本方法的正确运用。机制上的不确定性是允许的，领域可以参与而不失效，一个属性也可能在多个位置上相关。属性标签需要所述的契约作为依据，而不是靠关键词匹配。

在把这些案例用于编码研究之前，应冻结案例文本和评分细则，把训练样例与留出案例分开，并让审查人员独立进行分类。对于与拟议分类不一致之处，应予以记录，并依据明确的契约进行裁定。这些示例是关于有用边界的编辑性假设，而不是具有既定基准事实的评测基准，也不能证明九领域架构是完备的。
