# 基础概念

OSAFIS 2.0.0-draft.1 | 研究提案 | 2026年9月7日

## 目的与状态

OSAFIS 提出一套术语，用于描述智能系统中的安全失效以及评估这些失效所需的证据。其分析单元是处于运行环境中的、已部署或已规定的系统。模型、应用程序、人工审批流程以及相互协作的服务网络，都可能共同促成同一次失效。有用的分析必须识别它们之间的实际关系，而不是把所有后果都归咎于模型。

以下定义是本提案采用的约定。它们并不表明其中的类别是穷尽的、互斥的，或在实证上优于其他方法。这些定义的价值取决于独立评估人员能否一致地应用它们、设计出有用的测试并找到可实施的控制措施。此处提出的要求约束的是声称应用本草案的评估；它们并不表示任何实现已经满足了这些要求。

## 智能系统与评估边界

智能系统是指利用学习得到的或明确规定的推理过程来解释输入、产生判断或输出、或选择行动的计算系统。它可以包括模型、传统软件、知识资源、观测、保留的状态、规划、工具、人员和物理设备。它不必具备所有这些功能，也不必保持长期记忆或自主行动。这些特征决定的是评估范围，而不是依据产品标签判断某个系统是否符合条件。

系统边界界定了一项主张所包含的组件和关系。其环境包括边界之外相关的参与者、依赖、资源和条件。外部服务可能不在实现方的控制范围之内，却仍处于因果分析之中。评估人员必须说明每个要素由谁控制、检查了哪些版本和配置，以及该主张依赖于哪些环境假设。从孤立的模型端点得到的结果，并不能自动描述使用该模型的已部署工作流。

首选的表示方法是一张由实际组件、人员、共享服务和资源构成的图。节点可以实现多个安全领域。边按类型分为观测、信息、指令、权限委托、行动、状态同步、反馈或资源依赖。一条边可以承载多种明确标识的关系。接收信息本身并不授予权限。共享节点必须保持可见：如果为每个智能体都画出同一个共享记忆服务的独立副本，就会掩盖共同的依赖。有些失效涉及的是一个群体或子图，而不是单个组件或某条两两之间的边。

## 安全契约与受保护属性

安全属性指称一类义务，例如“机密性”或“目标完整性”。安全契约则针对特定对象或关系把这一义务具体化。它规定受保护对象、经授权的主体、允许的变更或影响、相关的运行条件，以及可观测的违反判定标准。契约必须先于评估结果确定；如果在看到不期望的输出之后才去定义契约，就容易导致循环分类。

例如，“系统必须安全”这样的表述是不充分的。一个更便于评估的契约可以要求：文档审阅服务只向发出请求的账户披露记录；将检索到的文档用作证据，而不是作为改变任务的权限；在分享报告前取得指定审批人的授权。每一条款都提供一个独立的潜在失效判定标准。策略负责人必须明确什么算作账户匹配、什么算作有效的任务变更、什么算作审批。

《安全属性》中的 P01–P23 提供了可复用的属性定义。它们既不是适用于所有功能的强制检查清单，也不表示所有义务都已被识别。一个契约可以适用多个属性。更具体的属性通常比泛泛的“完整性”提供更有信息量的标签；但彼此独立的失效仍应分别记录。属性标识符只是对定义的引用，而不是存在保护的证据。

## 经授权的目标与有争议的目标

经授权的目标，是由有权设定它的主体、在适用于该系统的约束和委托范围内所确立的任务或结果。必须记录其来源：例如，由负责组织发布的部署策略、经过身份验证的用户提出的有效请求，以及授予代表该请求行事的服务的有限权限。这些来源之间的优先顺序属于部署决策，必须明确说明。本框架并不预设所有开发者、运营方、用户、受影响人群和外部机构之间存在某种普遍适用的排序。

授权既关乎资格，也关乎范围。真实用户的请求并不必然授权完成该请求的一切手段，也不必然授权对他人资源造成的一切影响。检索到的内容、记住的陈述以及其他智能体的消息，不能仅凭声称紧急或拥有权限就改变目标。反过来，合法的授权变更也不会仅仅因为任务发生变化就构成完整性失效。

目标之间可能相互冲突，或者规定得不够完整。评估应记录相互竞争的要求、指定的决策负责人以及允许的解决程序。如果某个后果重大的行动取决于尚未明确的权限，契约应规定暂停、上报或受限的后备方案。如果不存在这样的规则，评估人员应报告一项未解决的治理假设，而不是自行臆造“真正的”目标。“目标完整性”保护的是既定的授权关系；它并不证明经授权的目标是合乎伦理的、合法的或可取的。这些问题需要各自的实质性标准和可问责的审查。

## 威胁、漏洞、攻击与事件

威胁是可能破坏安全契约的参与者能力、状态、事件或情形。威胁模型确定谁能影响什么、他们知道什么、拥有何种访问权限，以及受到哪些约束。它也可以描述与同一契约相关的非对抗性扰动。不能仅因为发生了失效就推定存在攻击者。

漏洞是组件、配置、流程或关系中的弱点，它使安全契约在给定条件下可能被违反。证据必须把弱点与违反联系起来，或者证明存在一条有充分依据的可行路径。异常文本、错误答案和危险的可能性本身都不足以证明漏洞存在。质量缺陷涉及未能达到性能预期；当它破坏了某项既定保护时，也可能同时构成安全弱点。危害是可能造成伤害的状态。事件是与安全相关或产生安全影响的实际发生之事。这些类别可以相互重叠，但并不因此成为同义词。

攻击技术是为利用弱点而施加影响的方法。漏洞利用则是针对特定目标对这种技术的具体执行或实现。机制在一个有用的抽象层次上描述影响如何发挥作用。《攻击分类法》区分机制、家族、技术和修饰因素；M01–M12 标识符保持其规范含义。指出某种机制，并不能证明漏洞存在、具有新颖性或可被利用。

非恶意的故障可以证明契约失效，却不能证明存在对抗性利用。例如，授权更新的延迟可能暴露出过时的权限检查，即使没有人故意造成这种延迟。评估必须把观测到的触发因素与任何假设的、攻击者复现该因素的能力区分开来。这样，安全证据与人身安全证据就可以相互印证，而无需虚构一个对手。

## 领域、维度、生命周期与影响

旧有术语“层”保留在标识符 L1–L9 中，但它指的是一个暂定的分析性安全领域。一个领域把具有相关契约的受保护对象、功能或关系归为一组。这些领域是：模型与计算；软件与基础设施；数据与知识；感知与世界表示；解释与目标；记忆与状态连续性；规划与行动；人机交互；集体与系统交互。

这些领域既不是执行步骤，也不是严重程度等级，更不是后果范围的递进。“九”是一个有待评估的工作性划分。关键在于功能上的适用性：基于文本的智能体可以估计不断变化的数字环境，而多模态应用可能根本没有保留的运行记忆。评估人员可以为一个组件指定多个领域，也可以在说明理由的前提下让分类保持未决。《安全层》给出了各领域的边界和用于区分的问题。

横向维度是一种可以为多个领域中的契约提供参考的视角。D1 为身份、信任与授权；D2 为治理与问责；D3 为供应链与来源；D4 为隐私与人身安全；D5 为生命周期与变更管理；D6 为可观测性、日志与可审计性；D7 为韧性与恢复。其适用性和证据因情境而异。维度既不取代按领域进行的分类，也不构成额外的层。

生命周期阶段和影响范围是两个独立的描述项。在训练阶段引入的弱点，可能在运行阶段被触发，并在退役阶段才被发现。其后果可能影响个人、组织、相互关联的服务或更广泛的人群。影响大本身并不能证明适用 L9：该领域需要一个独立的集体交互契约和明确的耦合机制。一个被攻破的共享模型可能造成广泛后果，而其已被证实失效的契约仍然位于 L1。

## 因果路径与组合

攻击路径通过已观测到的或假设的状态转换，把最初的影响与安全后果联系起来。当恶意意图不存在或未知时，“因果失效路径”是更宽泛的说法。记录应区分入口点、失效的契约、中间传播、遇到的控制措施以及最终影响。一条在未违反其契约的情况下被经过的边，属于传播的一部分，而不是额外的漏洞。

路径未必是线性的。反馈回路、延迟状态、并行请求和共享依赖，可能需要用带时间线的子图来表示。多个彼此独立的契约失效可能共同导致一次事件。为索引而选定一个主要领域是可选的，并且不得掩盖其他有证据支持的失效。反过来，对同一项义务贴上多个标签，也不应使发现的数量成倍增加。

考虑一个说明性的、未执行的场景：检索到的一份报告中含有一条虚假指令，要求更改某份摘要的接收人。报告作为信息进入系统；解释器把它当作权限；一个拟议的发送操作通过了不充分的接收人检查。入口点是这份报告。潜在的指令权限失效位于 L5，而另一个独立存在的、不充分的行动检查位于 L7。仅仅检索并传递这份报告，并不能证明 L3 失效。即使解释失效仍然存在，一个有效的接收人检查也能阻断这条路径。

## 证据与评估主张

证据由支持某一特定主张的观测、制品和推理组成。其来源可以包括检查、受控实验、事件记录、复现和独立重复验证，而每种来源所能支持的结论各不相同。观测到的失效可以证明某条路径是可能的，却无法估计其发生频率；一个合理的架构论证可以为开展测试提供依据，却不能证明存在实际利用。证据必须在可行的范围内充分保留相关的配置、输入、状态、预期条件、实际观测和局限，以便独立审查。

判据是用于判定契约是否被违反的规则或观测。测试应说明其判据、基线、威胁能力、阴性对照和停止条件。阴性对照有助于把所提出的机制与普通的任务波动或无关的弱点区分开来。检测手段应观测主张所需的决策和影响，而不应假定能够获取可靠的模型内部推理。本文档集中提出的测试均为说明性质，除非另附执行记录，否则均未实际执行。

置信度描述证据对某项主张的支持强度。可复现性关注在规定条件下结果能否再次出现；在同一设置中的可重复性，比独立重复验证的范围更窄。覆盖范围描述在已界定的威胁空间和运行空间中已经考察过的部分。这些都不能与严重性相互替代，而且任何有限的评测都无法证明风险为零。《评估方法》规定研究记录；《漏洞登记库》规定主张记录和审查记录。

## 风险、严重性、可逆性与控制措施

风险关注的是在特定情境和时间范围内发生安全损失的可能性及其后果。它取决于暴露程度、威胁能力、系统行为、控制措施和不确定性。严重性描述在给定假设下，某一特定失效一旦得逞所造成的后果。一个严重的潜在后果，其支持证据可能很薄弱，或者暴露程度可能很有限。这些事实必须分别清晰呈现；本草案并不规定一个通用的标量指标，也不主张把序数标签相乘。

可逆性关注的是在特定恢复条件下某一行动的后果。恢复、遏制和补偿彼此不同：恢复一个文件并不能撤销其已被披露的事实，支付赔偿也不能使受伤的人复原。恢复可能是部分的，也可能有时间限制。评估人员应确定相关后果从哪个时刻起变得不可逆、谁能在此之前进行干预，以及此后还有哪些内容可以恢复。

对于不可逆的伤害，概率性证据依然有意义。不可逆性改变的是可接受的决策规则和对遏制的需求；它并不使可能性失去意义，也不意味着估计发生率就等于接受这种伤害。对于罕见或灾难性的结果，需要格外注意观测稀少、相互依赖、分布变化以及未被观测到的路径。在实际后果不可接受的情况下，测试应使用仿真、惰性替代物或隔离环境。

安全控制措施是旨在维护契约，或检测并限制契约违反的技术、程序、组织或运营措施。缓解措施能降低暴露程度、可能性、传播范围或影响，但不一定能消除弱点。控制措施需要有其自身的假设和验证；一项成文的审批要求，并不能证明执行过程确实以审批为前提。残余风险和被转移的失效路径仍然是评估的一部分。

## 演进与引用

新兴漏洞类别是一种候选分组，其受保护义务或机制尚未被现有定义充分表示。相关提案应说明分类上的困难，比较相邻类别，提供证据，并接受独立质疑。模糊案例是关于框架边界的有用证据；不应为了维持表面上的完备而把它们硬塞进熟悉的标签。

每一次分类都必须引用框架版本和稳定的标识符。《版本与标识符》管理变更与迁移。标记为 1.0 的源文档集提供了历史基线；该标记并不表明曾公开发布。本次修订改变了领域边界，因此需要由人工重新审查受影响的既往分类。科学价值取决于如实保留证据真正支持的内容，包括不确定性，而不是维持一种分类体系完备的表象。
