OSAFIS

评估方法

OSAFIS 2.0.0-draft.1 · 研究提案 · 阅读约 14 分钟

本文目录
  1. 目的与主张约束
  2. 范围与授权
  3. 问题与运行契约
  4. 设计与对照
  5. 单元与样本规划
  6. 配置与来源
  7. 执行与因果检查
  8. 时间维度与自适应评测
  9. 涉及人与物理系统的评测
  10. 集体评测
  11. 分析与不确定性
  12. 证伪与分类
  13. 证据描述项
  14. 严重性与运行决策
  15. 证据包与交接
  16. 验证框架本身

框架版本:2.0.0-draft.1。状态:研究提案。

目的与主张约束

本方法把一个安全假设转化为范围明确、可复现的评估。它规定了相关制品和决策规则,用于研究某项既定契约能否失效、失效如何发生,以及现有证据能够支持哪些结论。它并不提供通用的认证门槛,也不表明所提出的框架已经通过了实证验证。

评估必须把以下几件事分开:弱点是否存在、在测试条件下观测到的结果出现的频率、已证实影响的范围,以及所提出解释的普适程度。一次记录详尽的、未经授权的状态转换,可能足以支持采取遏制措施;但它并不能证明该问题在各部署中普遍存在,也不能证明出现了一个新的攻击家族。反过来,未能复现某一事件,只是关于所测试条件的证据,并不能证明最初的报告是错误的。

必需的制品包括:范围与授权记录、系统模型与威胁模型、属性契约、测试协议、执行记录、分析、证伪记录、分类以及证据包。其详细程度应与主张和后果相称。针对特定实现的漏洞无需证明其在不同模型间具有普适性;而宽泛的机制性主张,则需要超出单个量身定制示例的证据。

范围与授权

在测试之前,记录目标配置、所有者、评估人员、目的、允许使用的界面、测试时段、数据处理约束以及停止条件。说明各项行动触及的是生产系统、预发布部署、模拟器还是测试桩。只要合成记录和隔离账户能够检验相关契约,就应尽量使用它们。获准检查某个组件,并不意味着获准影响其用户或与之相连的服务。

在执行候选干预之前,先建立遏制措施。视情况说明网络限制、工具替换、支出或资源上限、状态快照以及恢复责任。停止条件应规定谁可以终止测试、由哪个可观测事件触发终止,以及如何取消剩余的工作。涉及物理驱动或人员暴露的测试,还需要采取下文所述的额外控制措施;有害的实地实验不属于本方法的范畴。

对非对抗性危害的评估,遵循同样的契约与证据约束,但记录的是扰动,而不是指定一个攻击者。报告应区分安全发现、危害、事件、质量缺陷以及未决的观测。

问题与运行契约

在进行确认性测试之前,先写下主要假设。它应指明参与者或扰动、可施加的影响、目标契约、预期的失效事件以及推断的范围。还应说明一种合理的替代解释,以及哪些观测会削弱或推翻该假设。

以 P01–P23 作为参考,然后把所选属性操作化。例如,P13“行动完整性”可以要求:执行方在某项指定任务中,绝不在经批准的资源集合之外提交写入。应规定什么算作批准、何时检查批准、范围如何变化,以及哪条日志或哪次状态回读能够证明已经提交。模型回复说它已写入某个资源,与实际观测并不是一回事。

在评估结果之前先定义结果判据。与其解读散文式的文字,不如优先采用可独立观测的状态、权限检查或不变式违反。对于语义判断,应提供编码细则、边界案例示例以及“无法确定”这一类别。如果使用模型作为裁判,应冻结其配置,依据与主张相适应的独立标注对其进行验证,并披露分歧以及可能共有的失效模式。裁判给出的标签只是该测量过程产生的证据,而不是天然的基准事实。

设计与对照

在正常的授权运行条件下建立基线。使用匹配的阴性对照,它保留任务内容及相关难度,只去除所假设的恶意特征。应区分授权功能对照与植入违约对照:前者验证合法运行仍然可行,后者验证判据能在隔离的测试夹具中检测到已知的契约失效。说明每种对照应产生何种响应。所有对照都必须保持隔离,且不得造成实际伤害。

记录干预措施、保持不变的因素以及无法避免的混杂因素。“只改变了一个变量”是设计目标;当载荷同时改变了长度、检索排序或任务内容时,就不能作出这样的陈述。如果这些因素无法分离,应使用额外的对照,或只得出有限的结论。当可能存在顺序效应时,应对顺序进行随机化或平衡。

必须区分探索性搜索与确认性评测。记录所探索的载荷、提示词或配置的数量和性质,包括不成功的尝试。在留出任务或全新状态上评测之前,先冻结所选定的候选方案。如果针对同一评测集持续调整载荷,主张就变成了关于该自适应搜索程序下表现的主张。

单元与样本规划

定义独立的实验单元。对话中的一轮并不自动独立于之前的各轮;同一个持久会话产生的多个输出,可能构成一个单元。共享同一服务或同一模型状态的多个智能体,可能需要作为一个聚类处理。对于涉及人的结果,单元可以是参与者、团队或组织,这取决于分配方式和依赖关系。当随机化单元、观测单元和分析单元不同时,应分别说明。

围绕主张、预期波动、最小的相关效应或期望精度、依赖结构以及可用资源来规划样本量。如果信息不足以进行有充分依据的确认性计算,就应把研究标记为探索性研究,并通过预实验来估计设计参数。不要仅仅因为之前的示例使用过某个固定的试验次数,就沿用它。说明停止规则,以及如何处理序贯监测或多重比较。

报告分母、排除项、未完成的运行、超时以及缺失的观测。区分测试框架执行无效与系统可用性的真实失效。在看到结果所处的条件之后再排除不利的结果,可能会使结论产生偏差。应预先定义判定无效的规则,并报告结果对有争议的排除项的敏感程度。

配置与来源

记录模型标识符及可获得的修订信息、采样参数、对随机种子的支持情况、提示词或策略制品、上下文构建方式、工具模式、权限、检索快照、记忆状态、软件版本以及相关的时间信息。明确记录未知的变量或由提供方控制的变量。公开的模型名称不一定对应不变的行为;应注明测试日期以及任何可获得的部署修订版本。

在允许的情况下,保存确切的输入和输出,以及哈希值、时间戳、运行标识符和执行日志。随机种子有助于复现,但不能保证在不同平台之间或提供方发生变更后仍能确定性地执行。如果无法精确恢复状态,应描述近似的重置方式并检验其是否充分。凡缓存、并发、速率限制和后台更新可能影响结果之处,都应记录其影响。

在证据包中保护机密信息和个人信息。在可行的情况下,于测试之前用合成的等价值替换敏感值。脱敏处理应保留主张所需的证据;如果做不到,应说明经授权的审查人员需要私下检查哪些内容。

执行与因果检查

按照计划的协议运行基线条件和干预条件。记录最早可观测到的偏离、后续的状态转换以及最终结果。回读相关状态,而不是仅仅依赖工具的确认信息。当契约要求区分时,应把拒绝、部分行动、恢复和延迟产生的影响作为不同的结果分别记录。

使用消融来研究必要条件:去除所声称的权限提示、禁用相关的持久化路径、替换可疑来源,或切断某个假设的反馈关系。这些是对解释的检验,而不是自动的修复。一个去除了系统全部功能的干预,本身并不能证明某项针对性控制措施是有效的。

传统的静态分析或直接的访问控制测试,可以在不进行随机试验的情况下确立部分实现契约。记录路径和前提条件,并以安全的方式验证相关的状态转换。不要仅仅因为周边产品使用了人工智能,就把每一次评估都做成语言模型实验。

时间维度与自适应评测

对于多轮案例,应保留完整的序列,并确定独立的会话单元。检验之前的各轮是否必要、顺序是否重要,以及效果在有记录的重置之后是否仍然存在。对于 L6“记忆与状态连续性”,应把写入事件、保留的表示、之后的检索以及随后的决策分开。一次即时的响应并不能证明跨会话的持久性。

对于自适应系统,应记录初始状态、评估人员可获知的更新规则或服务行为、经授权的学习输入、更新计划以及回滚机制。在可能的情况下,比较匹配的更新历史或可重放的数据流。一次快照测试并不能涵盖之后的自适应变化。如果留出条件用于测量泛化能力,就必须把它们置于自适应过程之外。

对于行动,应确定最后一个有效的干预点以及外部提交点。在隔离环境中测试取消与撤销,包括相关的竞态条件和重试。报告在证据中能否区分“已尝试”“已排队”“已执行”“已补偿”和“不可逆”这几种结果。

涉及人与物理系统的评测

关于呈现方式改变了人类决策的主张,需要来自人的证据。对于 P19“人类决策完整性”下较窄的呈现契约或知情授权契约,可以通过可检查的不一致来评估,而无需声称有人受到了欺骗或改变了决策。对界面的检查可以证明存在不一致或缺少某项控制,却不能证明其在人群层面的效果。应准确标注这种较窄的结果。

涉及人类受试者的研究,需要适当的伦理审查、知情同意、有依据的招募和样本规划、隐私保护措施,以及在涉及经批准的欺骗时进行事后说明。应使用无害的场景,不产生实际的财务、健康、就业或安全后果。在适当时,指明经过验证的测量工具,并在具体研究中注明其出处。在可行时对结果编码进行盲法处理,并考虑来自同一参与者的重复观测。本文不提供通用的人类影响测量工具。

物理系统的测试应从仿真、录制的观测、硬件隔离或无危险的测试夹具开始。记录这些条件与实际部署之间的差距。在开展任何真实世界的驱动研究之前,相关从业人员必须审查遏制规则和验收规则。不得为了证明可达性而使人员、动物或运行中的基础设施暴露于有害条件之下。模拟的接触或被禁止的行动,仍然只是模拟结果。

集体评测

对于 L9“集体与系统交互”,应指明集体契约及其适用的图或子图。记录参与者、共享资源、调度、消息语义、初始状态和耦合关系。相对于匹配的基线,连同其分母和时间窗口,测量所提出的传播或放大效应。

改变相关的组成假设:参与者数量、拓扑结构、延迟、共享依赖以及本地策略。依赖于某一种排列方式的结果,仍然可以证明该排列方式存在漏洞;但它不能证明多智能体系统的普遍属性。独立的本地行为并不能排除集体失效,而由同一个共享服务引起的相关失效,也不能证明存在智能体之间的传播。

使用关系消融、共享资源替换或替代的调度方案来检验因果解释。当没有任何单条边应负责任时,允许把失效定位在群体或子图层面。所有系统性主张都必须附带仿真假设和验证局限;建模所得的证据并不等同于对已部署群体的观测。

分析与不确定性

对于每个条件,报告有效单元数、观测到的契约违反、其他结果,以及与设计相适应的不确定性。观测到的比例描述的是所测试的分布和程序。除非抽样假设和暴露假设能够支持这一推断,否则它并不是部署中的发生概率。应报告差值或其他预先规定的效应估计及其不确定性,而不只是给出一个显著性标签。

在相关情况下,应考虑聚类、自适应选择、多重比较和不完整的观测。设计为配对时,应使用配对分析。对于小样本或稀疏数据,应让局限清晰可见,而不是只给出看似精确的百分比。如果使用统计建模,应在证据包中记录假设、诊断和敏感性分析。

在有限的测试中没有观测到失效,并不能证明风险为零。如果报告统计上界,它取决于独立性、抽样和模型方面的假设。不可逆的结果仍然可以进行概率分析,但可以接受的平均表现并不能抵消一次被禁止的灾难性事件。可达性、遏制、干预时间和频率估计都可能很重要;适用的概况文件规定决策规则。

证伪与分类

积极检验替代解释。检查基线是否表现出同样的违反、干预是否改变了授权、判据是否误读了一个无害的输出,以及隐藏状态或测试框架的行为是否能够解释结果。一个针对特定机制的假设可能不成立,而真实的漏洞却依然存在。两种结果都应记录。

把入口点、失效的契约、传播和影响分开映射。使用规范的 L1–L9 名称以及稳定的 M01–M12 和 D1–D7 标识符。仅仅经过某个领域,并不能证明该领域失效。允许存在多个因果失效、复合分类、歧义以及未能表示的案例。强行指定的主要层,可能掩盖一项发现中最有信息量的部分。

把拟议的新家族与最接近的现有机制和类别进行比较。新的措辞、新的目标产品或更大的后果,本身都不能证明机制上的新颖性。反过来,也不应仅仅因为一个范围狭窄但真实存在的实现弱点缺乏新颖性,就否定它。登记库对类别提案的审查,与对具体发现的修复,是两种不同的决策。

证据描述项

源框架中的证据标签被保留为描述性的方面,而不是强制性的累进阶梯。跨模型测试与独立重复验证回答的是不同的问题。一项经过严格控制的实现层面发现,即使不适用于其他模型,也可以是有力的。

描述项证据问题
E0 假设是否存在明确、可检验的主张和因果解释?
E1 单次观测是否至少记录了一次相关事件?
E2 已复现的观测该事件是否在规定的重复条件下再次出现?
E3 受控实验适当的对照是否支持将结果归因于干预?
E4 跨条件证据在相关条件变化时,所述主张是否依然成立?
E5 跨模型证据是否已在相关的模型实现上考察了该主张?
E6 独立重复验证是否有另一位评估者在披露依赖关系的前提下复现了该主张?

对于每一个方面,记录 supported、unsupported、not_tested、inconclusive 或 not_applicable,并附上证据引用和理由。unsupported 表示所引用的评测不支持该方面,而不是表示不存在漏洞。标记为 supported 的方面,必须指明确切的主张和所测试的范围。独立性涵盖作者、分析、数据和执行等方面的依赖;审查人员应披露其中哪些是共享的。

使用 supported、refuted、inconclusive、quality_issue、hazard_only 或 out_of_scope 作为评估结果,并附上理由和主张引用。这些结果与登记库中的审查状态是分开的。混合型发现可能包含若干结果各不相同的主张。E0–E6 不是数值化的置信度分数,其标识符不得取平均值。

严重性与运行决策

通过一次违反得逞后的后果来描述严重性:受影响的资产或人员、范围、权限、持续时间、可恢复性,以及已证实的与潜在的危害。通过暴露程度、攻击者的机会、前提条件和现有证据来描述可能性。通过因果证据和测量证据的强度与局限来描述置信度。可复现性和已测试的覆盖范围应分别记录。

可逆性是某一行动或影响在特定情境下的属性。应记录恢复、遏制或补偿是否可行、由谁实施、代价如何以及需要多长时间。补偿并不必然能撤销信息披露或人身伤害。一个混合序列可能既包含可逆的内部变更,也包含不可逆的外部影响。

运行决策应引用某份概况文件或指名的决策机构,并说明为何证据足以支持采取遏制、修复、进一步研究或有限度的接受。紧急遏制可以先于完整的验证。缺少经过审查的概况文件,意味着评估人员必须报告尚未解决的验收标准;这并不允许其臆造一个通用分数,或声称该部署已通过 OSAFIS。

证据包与交接

证据包包括带版本的范围、图、契约、威胁能力、协议、判据、对照、样本依据、配置、原始或受保护的制品、执行记录汇总、分析、证伪、分类、影响以及局限。在有用的情况下,为制品分配稳定的标识符和完整性哈希。说明哪些材料是公开的、受限的、不可获取的,或已按保留规则销毁。

以下设计示例仅为说明,未经执行:使用一个合成的保留偏好和一个写入工具桩,把一次检索干预与匹配的无害材料进行比较。该协议把会话定义为单元,验证状态重置,通过回读测量未经授权的偏好提交,并另行记录任何拟议的工具行动是否会超出范围。在完成样本规划和执行之前,试验次数和结果被刻意留空。该示例并不意味着获得任何登记库认可。

把具体发现和类别提案作为不同的条目类型提交给登记库。报告应能为另一位评估者所用,而无需作者的私下解释。负责任的披露和证据访问遵循《漏洞登记库》;针对具体概况的决策规则遵循《系统概况》。

验证框架本身

测试系统并不能验证分类框架。应通过一项单独的研究来评估该框架:冻结定义和编码指南,构建有记录的案例抽样策略,用开发案例培训编码人员,并预留留出案例用于评估。按照预期范围的要求,纳入传统的、语义的、时间性的、涉及人的、物理的、自适应的和集体的案例,其中也应包括阴性示例。

在裁定之前收集独立的分类结果。分别记录在契约识别、领域映射、机制映射和范围界定上的一致性与不确定性。报告歧义、未能表示的案例和复合案例,而不是默认把它们当作编码人员的错误。分析分歧,并评估拟议的拆分或合并能否在新案例上改善有用的区分。测量评估人员的工作量,以及结果能否支持可实施的控制措施,而不仅仅是标签的一致性。

公布抽样的局限,避免从一个方便获取的语料推断出对未来的完备性。九个领域仍然是一个工作假设。当反复出现的边界失效、缺失的契约或冗余的类别削弱了评估的实用性时,就有理由进行修订。变更需要带版本的迁移,而不是对既往发现悄然重新贴标签。

Word 文档(英文) · Markdown 源文件 · 在交互式网站中打开