评估方法
本文目录
框架版本:2.0.0-draft.1。状态:研究提案。
目的与主张约束
本方法把一个安全假设转化为范围明确、可复现的评估。它规定了相关制品和决策规则,用于研究某项既定契约能否失效、失效如何发生,以及现有证据能够支持哪些结论。它并不提供通用的认证门槛,也不表明所提出的框架已经通过了实证验证。
评估必须把以下几件事分开:弱点是否存在、在测试条件下观测到的结果出现的频率、已证实影响的范围,以及所提出解释的普适程度。一次记录详尽的、未经授权的状态转换,可能足以支持采取遏制措施;但它并不能证明该问题在各部署中普遍存在,也不能证明出现了一个新的攻击家族。反过来,未能复现某一事件,只是关于所测试条件的证据,并不能证明最初的报告是错误的。
必需的制品包括:范围与授权记录、系统模型与威胁模型、属性契约、测试协议、执行记录、分析、证伪记录、分类以及证据包。其详细程度应与主张和后果相称。针对特定实现的漏洞无需证明其在不同模型间具有普适性;而宽泛的机制性主张,则需要超出单个量身定制示例的证据。
范围与授权
在测试之前,记录目标配置、所有者、评估人员、目的、允许使用的界面、测试时段、数据处理约束以及停止条件。说明各项行动触及的是生产系统、预发布部署、模拟器还是测试桩。只要合成记录和隔离账户能够检验相关契约,就应尽量使用它们。获准检查某个组件,并不意味着获准影响其用户或与之相连的服务。
在执行候选干预之前,先建立遏制措施。视情况说明网络限制、工具替换、支出或资源上限、状态快照以及恢复责任。停止条件应规定谁可以终止测试、由哪个可观测事件触发终止,以及如何取消剩余的工作。涉及物理驱动或人员暴露的测试,还需要采取下文所述的额外控制措施;有害的实地实验不属于本方法的范畴。
对非对抗性危害的评估,遵循同样的契约与证据约束,但记录的是扰动,而不是指定一个攻击者。报告应区分安全发现、危害、事件、质量缺陷以及未决的观测。
问题与运行契约
在进行确认性测试之前,先写下主要假设。它应指明参与者或扰动、可施加的影响、目标契约、预期的失效事件以及推断的范围。还应说明一种合理的替代解释,以及哪些观测会削弱或推翻该假设。
以 P01–P23 作为参考,然后把所选属性操作化。例如,P13“行动完整性”可以要求:执行方在某项指定任务中,绝不在经批准的资源集合之外提交写入。应规定什么算作批准、何时检查批准、范围如何变化,以及哪条日志或哪次状态回读能够证明已经提交。模型回复说它已写入某个资源,与实际观测并不是一回事。
在评估结果之前先定义结果判据。与其解读散文式的文字,不如优先采用可独立观测的状态、权限检查或不变式违反。对于语义判断,应提供编码细则、边界案例示例以及“无法确定”这一类别。如果使用模型作为裁判,应冻结其配置,依据与主张相适应的独立标注对其进行验证,并披露分歧以及可能共有的失效模式。裁判给出的标签只是该测量过程产生的证据,而不是天然的基准事实。
设计与对照
在正常的授权运行条件下建立基线。使用匹配的阴性对照,它保留任务内容及相关难度,只去除所假设的恶意特征。应区分授权功能对照与植入违约对照:前者验证合法运行仍然可行,后者验证判据能在隔离的测试夹具中检测到已知的契约失效。说明每种对照应产生何种响应。所有对照都必须保持隔离,且不得造成实际伤害。
记录干预措施、保持不变的因素以及无法避免的混杂因素。“只改变了一个变量”是设计目标;当载荷同时改变了长度、检索排序或任务内容时,就不能作出这样的陈述。如果这些因素无法分离,应使用额外的对照,或只得出有限的结论。当可能存在顺序效应时,应对顺序进行随机化或平衡。
必须区分探索性搜索与确认性评测。记录所探索的载荷、提示词或配置的数量和性质,包括不成功的尝试。在留出任务或全新状态上评测之前,先冻结所选定的候选方案。如果针对同一评测集持续调整载荷,主张就变成了关于该自适应搜索程序下表现的主张。
单元与样本规划
定义独立的实验单元。对话中的一轮并不自动独立于之前的各轮;同一个持久会话产生的多个输出,可能构成一个单元。共享同一服务或同一模型状态的多个智能体,可能需要作为一个聚类处理。对于涉及人的结果,单元可以是参与者、团队或组织,这取决于分配方式和依赖关系。当随机化单元、观测单元和分析单元不同时,应分别说明。
围绕主张、预期波动、最小的相关效应或期望精度、依赖结构以及可用资源来规划样本量。如果信息不足以进行有充分依据的确认性计算,就应把研究标记为探索性研究,并通过预实验来估计设计参数。不要仅仅因为之前的示例使用过某个固定的试验次数,就沿用它。说明停止规则,以及如何处理序贯监测或多重比较。
报告分母、排除项、未完成的运行、超时以及缺失的观测。区分测试框架执行无效与系统可用性的真实失效。在看到结果所处的条件之后再排除不利的结果,可能会使结论产生偏差。应预先定义判定无效的规则,并报告结果对有争议的排除项的敏感程度。
配置与来源
记录模型标识符及可获得的修订信息、采样参数、对随机种子的支持情况、提示词或策略制品、上下文构建方式、工具模式、权限、检索快照、记忆状态、软件版本以及相关的时间信息。明确记录未知的变量或由提供方控制的变量。公开的模型名称不一定对应不变的行为;应注明测试日期以及任何可获得的部署修订版本。
在允许的情况下,保存确切的输入和输出,以及哈希值、时间戳、运行标识符和执行日志。随机种子有助于复现,但不能保证在不同平台之间或提供方发生变更后仍能确定性地执行。如果无法精确恢复状态,应描述近似的重置方式并检验其是否充分。凡缓存、并发、速率限制和后台更新可能影响结果之处,都应记录其影响。
在证据包中保护机密信息和个人信息。在可行的情况下,于测试之前用合成的等价值替换敏感值。脱敏处理应保留主张所需的证据;如果做不到,应说明经授权的审查人员需要私下检查哪些内容。
执行与因果检查
按照计划的协议运行基线条件和干预条件。记录最早可观测到的偏离、后续的状态转换以及最终结果。回读相关状态,而不是仅仅依赖工具的确认信息。当契约要求区分时,应把拒绝、部分行动、恢复和延迟产生的影响作为不同的结果分别记录。
使用消融来研究必要条件:去除所声称的权限提示、禁用相关的持久化路径、替换可疑来源,或切断某个假设的反馈关系。这些是对解释的检验,而不是自动的修复。一个去除了系统全部功能的干预,本身并不能证明某项针对性控制措施是有效的。
传统的静态分析或直接的访问控制测试,可以在不进行随机试验的情况下确立部分实现契约。记录路径和前提条件,并以安全的方式验证相关的状态转换。不要仅仅因为周边产品使用了人工智能,就把每一次评估都做成语言模型实验。
时间维度与自适应评测
对于多轮案例,应保留完整的序列,并确定独立的会话单元。检验之前的各轮是否必要、顺序是否重要,以及效果在有记录的重置之后是否仍然存在。对于 L6“记忆与状态连续性”,应把写入事件、保留的表示、之后的检索以及随后的决策分开。一次即时的响应并不能证明跨会话的持久性。
对于自适应系统,应记录初始状态、评估人员可获知的更新规则或服务行为、经授权的学习输入、更新计划以及回滚机制。在可能的情况下,比较匹配的更新历史或可重放的数据流。一次快照测试并不能涵盖之后的自适应变化。如果留出条件用于测量泛化能力,就必须把它们置于自适应过程之外。
对于行动,应确定最后一个有效的干预点以及外部提交点。在隔离环境中测试取消与撤销,包括相关的竞态条件和重试。报告在证据中能否区分“已尝试”“已排队”“已执行”“已补偿”和“不可逆”这几种结果。
涉及人与物理系统的评测
关于呈现方式改变了人类决策的主张,需要来自人的证据。对于 P19“人类决策完整性”下较窄的呈现契约或知情授权契约,可以通过可检查的不一致来评估,而无需声称有人受到了欺骗或改变了决策。对界面的检查可以证明存在不一致或缺少某项控制,却不能证明其在人群层面的效果。应准确标注这种较窄的结果。
涉及人类受试者的研究,需要适当的伦理审查、知情同意、有依据的招募和样本规划、隐私保护措施,以及在涉及经批准的欺骗时进行事后说明。应使用无害的场景,不产生实际的财务、健康、就业或安全后果。在适当时,指明经过验证的测量工具,并在具体研究中注明其出处。在可行时对结果编码进行盲法处理,并考虑来自同一参与者的重复观测。本文不提供通用的人类影响测量工具。
物理系统的测试应从仿真、录制的观测、硬件隔离或无危险的测试夹具开始。记录这些条件与实际部署之间的差距。在开展任何真实世界的驱动研究之前,相关从业人员必须审查遏制规则和验收规则。不得为了证明可达性而使人员、动物或运行中的基础设施暴露于有害条件之下。模拟的接触或被禁止的行动,仍然只是模拟结果。
集体评测
对于 L9“集体与系统交互”,应指明集体契约及其适用的图或子图。记录参与者、共享资源、调度、消息语义、初始状态和耦合关系。相对于匹配的基线,连同其分母和时间窗口,测量所提出的传播或放大效应。
改变相关的组成假设:参与者数量、拓扑结构、延迟、共享依赖以及本地策略。依赖于某一种排列方式的结果,仍然可以证明该排列方式存在漏洞;但它不能证明多智能体系统的普遍属性。独立的本地行为并不能排除集体失效,而由同一个共享服务引起的相关失效,也不能证明存在智能体之间的传播。
使用关系消融、共享资源替换或替代的调度方案来检验因果解释。当没有任何单条边应负责任时,允许把失效定位在群体或子图层面。所有系统性主张都必须附带仿真假设和验证局限;建模所得的证据并不等同于对已部署群体的观测。
分析与不确定性
对于每个条件,报告有效单元数、观测到的契约违反、其他结果,以及与设计相适应的不确定性。观测到的比例描述的是所测试的分布和程序。除非抽样假设和暴露假设能够支持这一推断,否则它并不是部署中的发生概率。应报告差值或其他预先规定的效应估计及其不确定性,而不只是给出一个显著性标签。
在相关情况下,应考虑聚类、自适应选择、多重比较和不完整的观测。设计为配对时,应使用配对分析。对于小样本或稀疏数据,应让局限清晰可见,而不是只给出看似精确的百分比。如果使用统计建模,应在证据包中记录假设、诊断和敏感性分析。
在有限的测试中没有观测到失效,并不能证明风险为零。如果报告统计上界,它取决于独立性、抽样和模型方面的假设。不可逆的结果仍然可以进行概率分析,但可以接受的平均表现并不能抵消一次被禁止的灾难性事件。可达性、遏制、干预时间和频率估计都可能很重要;适用的概况文件规定决策规则。
证伪与分类
积极检验替代解释。检查基线是否表现出同样的违反、干预是否改变了授权、判据是否误读了一个无害的输出,以及隐藏状态或测试框架的行为是否能够解释结果。一个针对特定机制的假设可能不成立,而真实的漏洞却依然存在。两种结果都应记录。
把入口点、失效的契约、传播和影响分开映射。使用规范的 L1–L9 名称以及稳定的 M01–M12 和 D1–D7 标识符。仅仅经过某个领域,并不能证明该领域失效。允许存在多个因果失效、复合分类、歧义以及未能表示的案例。强行指定的主要层,可能掩盖一项发现中最有信息量的部分。
把拟议的新家族与最接近的现有机制和类别进行比较。新的措辞、新的目标产品或更大的后果,本身都不能证明机制上的新颖性。反过来,也不应仅仅因为一个范围狭窄但真实存在的实现弱点缺乏新颖性,就否定它。登记库对类别提案的审查,与对具体发现的修复,是两种不同的决策。
证据描述项
源框架中的证据标签被保留为描述性的方面,而不是强制性的累进阶梯。跨模型测试与独立重复验证回答的是不同的问题。一项经过严格控制的实现层面发现,即使不适用于其他模型,也可以是有力的。
| 描述项 | 证据问题 |
|---|---|
| E0 假设 | 是否存在明确、可检验的主张和因果解释? |
| E1 单次观测 | 是否至少记录了一次相关事件? |
| E2 已复现的观测 | 该事件是否在规定的重复条件下再次出现? |
| E3 受控实验 | 适当的对照是否支持将结果归因于干预? |
| E4 跨条件证据 | 在相关条件变化时,所述主张是否依然成立? |
| E5 跨模型证据 | 是否已在相关的模型实现上考察了该主张? |
| E6 独立重复验证 | 是否有另一位评估者在披露依赖关系的前提下复现了该主张? |
对于每一个方面,记录 supported、unsupported、not_tested、inconclusive 或 not_applicable,并附上证据引用和理由。unsupported 表示所引用的评测不支持该方面,而不是表示不存在漏洞。标记为 supported 的方面,必须指明确切的主张和所测试的范围。独立性涵盖作者、分析、数据和执行等方面的依赖;审查人员应披露其中哪些是共享的。
使用 supported、refuted、inconclusive、quality_issue、hazard_only 或 out_of_scope 作为评估结果,并附上理由和主张引用。这些结果与登记库中的审查状态是分开的。混合型发现可能包含若干结果各不相同的主张。E0–E6 不是数值化的置信度分数,其标识符不得取平均值。
严重性与运行决策
通过一次违反得逞后的后果来描述严重性:受影响的资产或人员、范围、权限、持续时间、可恢复性,以及已证实的与潜在的危害。通过暴露程度、攻击者的机会、前提条件和现有证据来描述可能性。通过因果证据和测量证据的强度与局限来描述置信度。可复现性和已测试的覆盖范围应分别记录。
可逆性是某一行动或影响在特定情境下的属性。应记录恢复、遏制或补偿是否可行、由谁实施、代价如何以及需要多长时间。补偿并不必然能撤销信息披露或人身伤害。一个混合序列可能既包含可逆的内部变更,也包含不可逆的外部影响。
运行决策应引用某份概况文件或指名的决策机构,并说明为何证据足以支持采取遏制、修复、进一步研究或有限度的接受。紧急遏制可以先于完整的验证。缺少经过审查的概况文件,意味着评估人员必须报告尚未解决的验收标准;这并不允许其臆造一个通用分数,或声称该部署已通过 OSAFIS。
证据包与交接
证据包包括带版本的范围、图、契约、威胁能力、协议、判据、对照、样本依据、配置、原始或受保护的制品、执行记录汇总、分析、证伪、分类、影响以及局限。在有用的情况下,为制品分配稳定的标识符和完整性哈希。说明哪些材料是公开的、受限的、不可获取的,或已按保留规则销毁。
以下设计示例仅为说明,未经执行:使用一个合成的保留偏好和一个写入工具桩,把一次检索干预与匹配的无害材料进行比较。该协议把会话定义为单元,验证状态重置,通过回读测量未经授权的偏好提交,并另行记录任何拟议的工具行动是否会超出范围。在完成样本规划和执行之前,试验次数和结果被刻意留空。该示例并不意味着获得任何登记库认可。
把具体发现和类别提案作为不同的条目类型提交给登记库。报告应能为另一位评估者所用,而无需作者的私下解释。负责任的披露和证据访问遵循《漏洞登记库》;针对具体概况的决策规则遵循《系统概况》。
验证框架本身
测试系统并不能验证分类框架。应通过一项单独的研究来评估该框架:冻结定义和编码指南,构建有记录的案例抽样策略,用开发案例培训编码人员,并预留留出案例用于评估。按照预期范围的要求,纳入传统的、语义的、时间性的、涉及人的、物理的、自适应的和集体的案例,其中也应包括阴性示例。
在裁定之前收集独立的分类结果。分别记录在契约识别、领域映射、机制映射和范围界定上的一致性与不确定性。报告歧义、未能表示的案例和复合案例,而不是默认把它们当作编码人员的错误。分析分歧,并评估拟议的拆分或合并能否在新案例上改善有用的区分。测量评估人员的工作量,以及结果能否支持可实施的控制措施,而不仅仅是标签的一致性。
公布抽样的局限,避免从一个方便获取的语料推断出对未来的完备性。九个领域仍然是一个工作假设。当反复出现的边界失效、缺失的契约或冗余的类别削弱了评估的实用性时,就有理由进行修订。变更需要带版本的迁移,而不是对既往发现悄然重新贴标签。