# 评估方法

框架版本：2.0.0-draft.1。状态：研究提案。

## 目的与主张约束

本方法把一个安全假设转化为范围明确、可复现的评估。它规定了相关制品和决策规则，用于研究某项既定契约能否失效、失效如何发生，以及现有证据能够支持哪些结论。它并不提供通用的认证门槛，也不表明所提出的框架已经通过了实证验证。

评估必须把以下几件事分开：弱点是否存在、在测试条件下观测到的结果出现的频率、已证实影响的范围，以及所提出解释的普适程度。一次记录详尽的、未经授权的状态转换，可能足以支持采取遏制措施；但它并不能证明该问题在各部署中普遍存在，也不能证明出现了一个新的攻击家族。反过来，未能复现某一事件，只是关于所测试条件的证据，并不能证明最初的报告是错误的。

必需的制品包括：范围与授权记录、系统模型与威胁模型、属性契约、测试协议、执行记录、分析、证伪记录、分类以及证据包。其详细程度应与主张和后果相称。针对特定实现的漏洞无需证明其在不同模型间具有普适性；而宽泛的机制性主张，则需要超出单个量身定制示例的证据。

## 范围与授权

在测试之前，记录目标配置、所有者、评估人员、目的、允许使用的界面、测试时段、数据处理约束以及停止条件。说明各项行动触及的是生产系统、预发布部署、模拟器还是测试桩。只要合成记录和隔离账户能够检验相关契约，就应尽量使用它们。获准检查某个组件，并不意味着获准影响其用户或与之相连的服务。

在执行候选干预之前，先建立遏制措施。视情况说明网络限制、工具替换、支出或资源上限、状态快照以及恢复责任。停止条件应规定谁可以终止测试、由哪个可观测事件触发终止，以及如何取消剩余的工作。涉及物理驱动或人员暴露的测试，还需要采取下文所述的额外控制措施；有害的实地实验不属于本方法的范畴。

对非对抗性危害的评估，遵循同样的契约与证据约束，但记录的是扰动，而不是指定一个攻击者。报告应区分安全发现、危害、事件、质量缺陷以及未决的观测。

## 问题与运行契约

在进行确认性测试之前，先写下主要假设。它应指明参与者或扰动、可施加的影响、目标契约、预期的失效事件以及推断的范围。还应说明一种合理的替代解释，以及哪些观测会削弱或推翻该假设。

以 P01–P23 作为参考，然后把所选属性操作化。例如，P13“行动完整性”可以要求：执行方在某项指定任务中，绝不在经批准的资源集合之外提交写入。应规定什么算作批准、何时检查批准、范围如何变化，以及哪条日志或哪次状态回读能够证明已经提交。模型回复说它已写入某个资源，与实际观测并不是一回事。

在评估结果之前先定义结果判据。与其解读散文式的文字，不如优先采用可独立观测的状态、权限检查或不变式违反。对于语义判断，应提供编码细则、边界案例示例以及“无法确定”这一类别。如果使用模型作为裁判，应冻结其配置，依据与主张相适应的独立标注对其进行验证，并披露分歧以及可能共有的失效模式。裁判给出的标签只是该测量过程产生的证据，而不是天然的基准事实。

## 设计与对照

在正常的授权运行条件下建立基线。使用匹配的阴性对照，它保留任务内容及相关难度，只去除所假设的恶意特征。应区分授权功能对照与植入违约对照：前者验证合法运行仍然可行，后者验证判据能在隔离的测试夹具中检测到已知的契约失效。说明每种对照应产生何种响应。所有对照都必须保持隔离，且不得造成实际伤害。

记录干预措施、保持不变的因素以及无法避免的混杂因素。“只改变了一个变量”是设计目标；当载荷同时改变了长度、检索排序或任务内容时，就不能作出这样的陈述。如果这些因素无法分离，应使用额外的对照，或只得出有限的结论。当可能存在顺序效应时，应对顺序进行随机化或平衡。

必须区分探索性搜索与确认性评测。记录所探索的载荷、提示词或配置的数量和性质，包括不成功的尝试。在留出任务或全新状态上评测之前，先冻结所选定的候选方案。如果针对同一评测集持续调整载荷，主张就变成了关于该自适应搜索程序下表现的主张。

## 单元与样本规划

定义独立的实验单元。对话中的一轮并不自动独立于之前的各轮；同一个持久会话产生的多个输出，可能构成一个单元。共享同一服务或同一模型状态的多个智能体，可能需要作为一个聚类处理。对于涉及人的结果，单元可以是参与者、团队或组织，这取决于分配方式和依赖关系。当随机化单元、观测单元和分析单元不同时，应分别说明。

围绕主张、预期波动、最小的相关效应或期望精度、依赖结构以及可用资源来规划样本量。如果信息不足以进行有充分依据的确认性计算，就应把研究标记为探索性研究，并通过预实验来估计设计参数。不要仅仅因为之前的示例使用过某个固定的试验次数，就沿用它。说明停止规则，以及如何处理序贯监测或多重比较。

报告分母、排除项、未完成的运行、超时以及缺失的观测。区分测试框架执行无效与系统可用性的真实失效。在看到结果所处的条件之后再排除不利的结果，可能会使结论产生偏差。应预先定义判定无效的规则，并报告结果对有争议的排除项的敏感程度。

## 配置与来源

记录模型标识符及可获得的修订信息、采样参数、对随机种子的支持情况、提示词或策略制品、上下文构建方式、工具模式、权限、检索快照、记忆状态、软件版本以及相关的时间信息。明确记录未知的变量或由提供方控制的变量。公开的模型名称不一定对应不变的行为；应注明测试日期以及任何可获得的部署修订版本。

在允许的情况下，保存确切的输入和输出，以及哈希值、时间戳、运行标识符和执行日志。随机种子有助于复现，但不能保证在不同平台之间或提供方发生变更后仍能确定性地执行。如果无法精确恢复状态，应描述近似的重置方式并检验其是否充分。凡缓存、并发、速率限制和后台更新可能影响结果之处，都应记录其影响。

在证据包中保护机密信息和个人信息。在可行的情况下，于测试之前用合成的等价值替换敏感值。脱敏处理应保留主张所需的证据；如果做不到，应说明经授权的审查人员需要私下检查哪些内容。

## 执行与因果检查

按照计划的协议运行基线条件和干预条件。记录最早可观测到的偏离、后续的状态转换以及最终结果。回读相关状态，而不是仅仅依赖工具的确认信息。当契约要求区分时，应把拒绝、部分行动、恢复和延迟产生的影响作为不同的结果分别记录。

使用消融来研究必要条件：去除所声称的权限提示、禁用相关的持久化路径、替换可疑来源，或切断某个假设的反馈关系。这些是对解释的检验，而不是自动的修复。一个去除了系统全部功能的干预，本身并不能证明某项针对性控制措施是有效的。

传统的静态分析或直接的访问控制测试，可以在不进行随机试验的情况下确立部分实现契约。记录路径和前提条件，并以安全的方式验证相关的状态转换。不要仅仅因为周边产品使用了人工智能，就把每一次评估都做成语言模型实验。

## 时间维度与自适应评测

对于多轮案例，应保留完整的序列，并确定独立的会话单元。检验之前的各轮是否必要、顺序是否重要，以及效果在有记录的重置之后是否仍然存在。对于 L6“记忆与状态连续性”，应把写入事件、保留的表示、之后的检索以及随后的决策分开。一次即时的响应并不能证明跨会话的持久性。

对于自适应系统，应记录初始状态、评估人员可获知的更新规则或服务行为、经授权的学习输入、更新计划以及回滚机制。在可能的情况下，比较匹配的更新历史或可重放的数据流。一次快照测试并不能涵盖之后的自适应变化。如果留出条件用于测量泛化能力，就必须把它们置于自适应过程之外。

对于行动，应确定最后一个有效的干预点以及外部提交点。在隔离环境中测试取消与撤销，包括相关的竞态条件和重试。报告在证据中能否区分“已尝试”“已排队”“已执行”“已补偿”和“不可逆”这几种结果。

## 涉及人与物理系统的评测

关于呈现方式改变了人类决策的主张，需要来自人的证据。对于 P19“人类决策完整性”下较窄的呈现契约或知情授权契约，可以通过可检查的不一致来评估，而无需声称有人受到了欺骗或改变了决策。对界面的检查可以证明存在不一致或缺少某项控制，却不能证明其在人群层面的效果。应准确标注这种较窄的结果。

涉及人类受试者的研究，需要适当的伦理审查、知情同意、有依据的招募和样本规划、隐私保护措施，以及在涉及经批准的欺骗时进行事后说明。应使用无害的场景，不产生实际的财务、健康、就业或安全后果。在适当时，指明经过验证的测量工具，并在具体研究中注明其出处。在可行时对结果编码进行盲法处理，并考虑来自同一参与者的重复观测。本文不提供通用的人类影响测量工具。

物理系统的测试应从仿真、录制的观测、硬件隔离或无危险的测试夹具开始。记录这些条件与实际部署之间的差距。在开展任何真实世界的驱动研究之前，相关从业人员必须审查遏制规则和验收规则。不得为了证明可达性而使人员、动物或运行中的基础设施暴露于有害条件之下。模拟的接触或被禁止的行动，仍然只是模拟结果。

## 集体评测

对于 L9“集体与系统交互”，应指明集体契约及其适用的图或子图。记录参与者、共享资源、调度、消息语义、初始状态和耦合关系。相对于匹配的基线，连同其分母和时间窗口，测量所提出的传播或放大效应。

改变相关的组成假设：参与者数量、拓扑结构、延迟、共享依赖以及本地策略。依赖于某一种排列方式的结果，仍然可以证明该排列方式存在漏洞；但它不能证明多智能体系统的普遍属性。独立的本地行为并不能排除集体失效，而由同一个共享服务引起的相关失效，也不能证明存在智能体之间的传播。

使用关系消融、共享资源替换或替代的调度方案来检验因果解释。当没有任何单条边应负责任时，允许把失效定位在群体或子图层面。所有系统性主张都必须附带仿真假设和验证局限；建模所得的证据并不等同于对已部署群体的观测。

## 分析与不确定性

对于每个条件，报告有效单元数、观测到的契约违反、其他结果，以及与设计相适应的不确定性。观测到的比例描述的是所测试的分布和程序。除非抽样假设和暴露假设能够支持这一推断，否则它并不是部署中的发生概率。应报告差值或其他预先规定的效应估计及其不确定性，而不只是给出一个显著性标签。

在相关情况下，应考虑聚类、自适应选择、多重比较和不完整的观测。设计为配对时，应使用配对分析。对于小样本或稀疏数据，应让局限清晰可见，而不是只给出看似精确的百分比。如果使用统计建模，应在证据包中记录假设、诊断和敏感性分析。

在有限的测试中没有观测到失效，并不能证明风险为零。如果报告统计上界，它取决于独立性、抽样和模型方面的假设。不可逆的结果仍然可以进行概率分析，但可以接受的平均表现并不能抵消一次被禁止的灾难性事件。可达性、遏制、干预时间和频率估计都可能很重要；适用的概况文件规定决策规则。

## 证伪与分类

积极检验替代解释。检查基线是否表现出同样的违反、干预是否改变了授权、判据是否误读了一个无害的输出，以及隐藏状态或测试框架的行为是否能够解释结果。一个针对特定机制的假设可能不成立，而真实的漏洞却依然存在。两种结果都应记录。

把入口点、失效的契约、传播和影响分开映射。使用规范的 L1–L9 名称以及稳定的 M01–M12 和 D1–D7 标识符。仅仅经过某个领域，并不能证明该领域失效。允许存在多个因果失效、复合分类、歧义以及未能表示的案例。强行指定的主要层，可能掩盖一项发现中最有信息量的部分。

把拟议的新家族与最接近的现有机制和类别进行比较。新的措辞、新的目标产品或更大的后果，本身都不能证明机制上的新颖性。反过来，也不应仅仅因为一个范围狭窄但真实存在的实现弱点缺乏新颖性，就否定它。登记库对类别提案的审查，与对具体发现的修复，是两种不同的决策。

## 证据描述项

源框架中的证据标签被保留为描述性的方面，而不是强制性的累进阶梯。跨模型测试与独立重复验证回答的是不同的问题。一项经过严格控制的实现层面发现，即使不适用于其他模型，也可以是有力的。

| 描述项 | 证据问题 |
| --- | --- |
| E0 假设 | 是否存在明确、可检验的主张和因果解释？ |
| E1 单次观测 | 是否至少记录了一次相关事件？ |
| E2 已复现的观测 | 该事件是否在规定的重复条件下再次出现？ |
| E3 受控实验 | 适当的对照是否支持将结果归因于干预？ |
| E4 跨条件证据 | 在相关条件变化时，所述主张是否依然成立？ |
| E5 跨模型证据 | 是否已在相关的模型实现上考察了该主张？ |
| E6 独立重复验证 | 是否有另一位评估者在披露依赖关系的前提下复现了该主张？ |

对于每一个方面，记录 supported、unsupported、not_tested、inconclusive 或 not_applicable，并附上证据引用和理由。unsupported 表示所引用的评测不支持该方面，而不是表示不存在漏洞。标记为 supported 的方面，必须指明确切的主张和所测试的范围。独立性涵盖作者、分析、数据和执行等方面的依赖；审查人员应披露其中哪些是共享的。

使用 supported、refuted、inconclusive、quality_issue、hazard_only 或 out_of_scope 作为评估结果，并附上理由和主张引用。这些结果与登记库中的审查状态是分开的。混合型发现可能包含若干结果各不相同的主张。E0–E6 不是数值化的置信度分数，其标识符不得取平均值。

## 严重性与运行决策

通过一次违反得逞后的后果来描述严重性：受影响的资产或人员、范围、权限、持续时间、可恢复性，以及已证实的与潜在的危害。通过暴露程度、攻击者的机会、前提条件和现有证据来描述可能性。通过因果证据和测量证据的强度与局限来描述置信度。可复现性和已测试的覆盖范围应分别记录。

可逆性是某一行动或影响在特定情境下的属性。应记录恢复、遏制或补偿是否可行、由谁实施、代价如何以及需要多长时间。补偿并不必然能撤销信息披露或人身伤害。一个混合序列可能既包含可逆的内部变更，也包含不可逆的外部影响。

运行决策应引用某份概况文件或指名的决策机构，并说明为何证据足以支持采取遏制、修复、进一步研究或有限度的接受。紧急遏制可以先于完整的验证。缺少经过审查的概况文件，意味着评估人员必须报告尚未解决的验收标准；这并不允许其臆造一个通用分数，或声称该部署已通过 OSAFIS。

## 证据包与交接

证据包包括带版本的范围、图、契约、威胁能力、协议、判据、对照、样本依据、配置、原始或受保护的制品、执行记录汇总、分析、证伪、分类、影响以及局限。在有用的情况下，为制品分配稳定的标识符和完整性哈希。说明哪些材料是公开的、受限的、不可获取的，或已按保留规则销毁。

以下设计示例仅为说明，未经执行：使用一个合成的保留偏好和一个写入工具桩，把一次检索干预与匹配的无害材料进行比较。该协议把会话定义为单元，验证状态重置，通过回读测量未经授权的偏好提交，并另行记录任何拟议的工具行动是否会超出范围。在完成样本规划和执行之前，试验次数和结果被刻意留空。该示例并不意味着获得任何登记库认可。

把具体发现和类别提案作为不同的条目类型提交给登记库。报告应能为另一位评估者所用，而无需作者的私下解释。负责任的披露和证据访问遵循《漏洞登记库》；针对具体概况的决策规则遵循《系统概况》。

## 验证框架本身

测试系统并不能验证分类框架。应通过一项单独的研究来评估该框架：冻结定义和编码指南，构建有记录的案例抽样策略，用开发案例培训编码人员，并预留留出案例用于评估。按照预期范围的要求，纳入传统的、语义的、时间性的、涉及人的、物理的、自适应的和集体的案例，其中也应包括阴性示例。

在裁定之前收集独立的分类结果。分别记录在契约识别、领域映射、机制映射和范围界定上的一致性与不确定性。报告歧义、未能表示的案例和复合案例，而不是默认把它们当作编码人员的错误。分析分歧，并评估拟议的拆分或合并能否在新案例上改善有用的区分。测量评估人员的工作量，以及结果能否支持可实施的控制措施，而不仅仅是标签的一致性。

公布抽样的局限，避免从一个方便获取的语料推断出对未来的完备性。九个领域仍然是一个工作假设。当反复出现的边界失效、缺失的契约或冗余的类别削弱了评估的实用性时，就有理由进行修订。变更需要带版本的迁移，而不是对既往发现悄然重新贴标签。
