OSAFIS

安全层

OSAFIS 2.0.0-draft.1 · 研究提案 · 阅读约 17 分钟

本文目录
  1. 分析目的
  2. 在分类失效之前先表示系统
  3. L1 模型与计算
  4. L2 软件与基础设施
  5. L3 数据与知识
  6. L4 感知与世界表示
  7. L5 解释与目标
  8. L6 记忆与状态连续性
  9. L7 规划与行动
  10. L8 人机交互
  11. L9 集体与系统交互
  12. 分类与迁移实践

OSAFIS 2.0.0-draft.1 | 研究提案 | 2026年9月7日

分析目的

OSAFIS 的九个层标识符,按照其安全契约可能失效的对象、功能或关系来组织分析。在本次修订中,“层”指的是一个暂定的分析领域。这些标识符并不描述处理流水线、实现栈、智能水平或逐级扩大的后果范围。模型制品的失效可能波及众多组织;而集体交互的失效也可能只局限于一个小型测试环境之内。

“九”是关于哪些区分有用的一个工作假设。任何拟议的划分,都应通过评估人员的一致认可、解释价值以及指导区分性测试的能力来证明其存在的合理性。本文档并不声称九个领域是必要的、充分的、最优的,或对未来而言是完备的。组件之间出现重叠是意料之中的;而定义之间的重叠,则需要仔细指明正在考察的具体契约。

领域模型是对三个独立问题的补充:保护的是什么属性,影响如何发挥作用,以及会产生什么后果。属性标识符 P01–P23 回答第一个问题;《攻击分类法》中的机制 M01–M12 回答第二个问题。后果范围、生命周期阶段、不确定性和可恢复性则分别独立记录。横向维度 D1–D7 仍是审视这些分析的视角,而不是额外的领域。

在分类失效之前先表示系统

评估从一张由实际组件、人员、共享服务和资源构成的图开始。把领域分配给各节点所执行的功能以及相关的关系契约。一个服务可能同时实现检索、持久状态、推理和行动分派;因此它不必只有一个排他性的领域标签。反过来,一个领域契约也可能横跨多个组件。

关系按类型分为观测、信息、指令、权限委托、行动、状态同步、反馈或资源依赖。凡影响到主张的,都应记录载荷、适用的身份、信任假设和允许的转换。状态消息通常是一条信息边;指令可以请求完成工作,却不授予新的权限。只有当某种明确界定的权限被转移,或代表另一主体行使时,才存在委托。

共享的服务和资源表示为共享节点。为每个智能体复制一套九层栈,可能掩盖共同使用的模型、数据存储、预算或控制器。群体契约和子图契约同样可以成立:协调不变式可能涉及所有活跃参与者,而且并不总能归结为相互独立的两两检查。已观测到的连接与假设的连接应分别记录。

对于每一项发现,都要区分攻击入口点、失效的契约、传播和影响。被经过的领域不一定已经失效。多个失效可能在因果上都是必要的;在证据到位之前,分类也可以保持未决。主要领域可以用于索引,但并不存在“最先受到影响的组件要为之后的一切违反负责”这样的规则。

L1 模型与计算

规范显示名称:模型与计算。

L1 保护可执行的模型参数、推理规则以及约定的模型计算。其契约指明经批准的模型制品或规则集、允许的转换、相关的计算设置,以及实现应在何种条件下实现该计算。这既适用于学习型推理系统,也适用于显式编程的推理系统。架构、权重、可执行的适配器以及影响模型配置的计算,都可能是相关的受保护对象。

L1 与 L2 的边界,在于被规定的计算与执行、提供该计算的软件或基础设施之间的区别。未经授权替换经批准的权重,属于 L1 中的制品完整性失效。如果服务进程允许未经授权的调用方替换文件,而这一契约被独立破坏,那么同时还存在 L2 的访问控制失效。训练数据作为信息资源属于 L3;由此得到的模型若未能满足某项既定的安全行为要求,可能构成 L1 发现,而数据的影响则记录为因果入口路径。仅仅产生错误答案,并不能证明模型计算契约失效。

一个说明性的、未执行的案例涉及某次部署:它本应只加载一种经批准的模型与适配器组合。启动后,一个可变别名解析到了未经批准的适配器,而基础模型保持不变。这里受保护的义务是执行经批准的组合,而不是笼统地承诺输出正确。评估可以把经批准的清单与实际加载的制品进行比较,并在隔离环境中演练别名变更。阴性对照使用一次经过所需授权和验证的、允许的版本切换。

可评估的问题是:执行是否始终绑定于经批准的计算制品和变更。候选控制措施包括经验证的加载、不可变的版本引用、明确的转换记录,以及在重新加载边界处的检查。其有效性取决于验证发生在何处,以及之后是否仍可能发生修改。仅凭一次成功的初始验证,并不能证明整个生命周期内的完整性。

L2 软件与基础设施

规范显示名称:软件与基础设施。

L2 保护实现、运行时、访问控制、隔离和基础设施方面的契约。相关对象包括服务端点、凭据、进程、部署配置、依赖、网络、存储访问和执行环境。契约规定谁可以调用或修改哪些功能、租户和权限如何隔离,以及经授权的运行所需的服务或资源界限。

模型的存在,并不会改变传统的会话混淆或暴露的管理端点所属的领域。L2 涵盖实施应用访问边界的机制;L7 涵盖通过该机制执行的行动所涉及的、特定于任务的权限及其影响。工具可能正确地验证了某个服务的身份,而该服务却请求了超出用户任务范围的操作;这正是有效的基础设施检查与失效的行动契约之间的区别。L1 仍负责经批准的模型计算,而 L2 涵盖为其提供支持的服务实现和隔离。

一个说明性的、未执行的失效情形是:两个智能体会话共享同一个进程缓存,而缓存键中没有包含租户身份。结果,一个会话取到了另一个租户的响应。失效的契约是租户隔离,即便响应中含有模型生成的文本,且可见的影响是机密性丧失。隔离测试可以使用合成账户和彼此不同的标记数据,交替发送请求,并检查缓存复用时账户边界是否依然有效。在禁用缓存的情况下重复这一序列,有助于定位机制,但并不能证明所有缓存路径都是安全的。

评估要回答的是:在所声明的部署配置下,未经授权的主体或执行上下文能否访问受保护的资源。候选控制措施包括完整的租户绑定、限定范围的服务身份、隔离和资源限制。日志只有在记录了相关身份和边界决策时才能提供证据。广泛的下游危害并不会把最初的基础设施失效转移到 L9。

L3 数据与知识

规范显示名称:数据与知识。

L3 保护信息资源,以及这些资源作为知识被提供时所需满足的条件。其契约涵盖经授权的变更、访问、来源、源的状态,以及任何已声明的时效性或验证要求。训练语料、检索索引、文档、元数据、参考数据库以及由工具提供的信息,都可能属于这一领域。其义务并不是要求每一项陈述都真实,而是要求资源满足明确规定的处理条件和认知条件。

L3 与 L5 的分界点,在于信息被用作指令权限或目标权限之时。一份被正确标注为不可信的文档,可以含有敌意措辞而不违反 L3。如果解释器把这些措辞提升为具有指令权限,失效的契约就位于 L5。L4 关注环境状态的获取和估计;L3 关注作为资源提供或维护的信息。L6 关注充当保留的运行状态的信息。同一个数据库可能既实现知识集合,又实现用户记忆;应当对契约而不是存储技术进行分类。

在一个说明性的、未执行的例子中,某供应商公告索引在摄取过程中丢失了来源标识符。后来的一条结果被呈现为来自经批准的发布方,而其内容实际上来自别处。拟议的 L3 失效是索引契约所要求的来源绑定丢失。测试可以摄取若干彼此可区分的合成来源,检查它们转换后的记录,并将检索结果中的来源信息与摄取记录进行比较。阴性对照在相同的转换过程中保留这种绑定。

可评估的问题是:信息在跨越收集、转换、检索和披露等边界时,其所需的权限和来源是否保持完好。候选控制措施包括来源绑定、转换历史、把验证状态与内容分开,以及在检索时进行访问检查。来源签名可以支持关于出处的主张,却不能证明来源所作陈述的真实性或适用性。

L4 感知与世界表示

规范显示名称:感知与世界表示。

L4 保护对运行环境的观测和估计。其契约规定观测哪些特征、观测如何与实体和时间相关联、如何处理不确定性和过时状态,以及在作出依赖性决策之前何时需要重新观测。它既包括物理传感器,也包括数字观测,例如智能体查看浏览器页面或服务状态。是否适用取决于功能:文本表示也可以是对不断变化的环境的观测。

它与 L3 的区别是功能性的。参考文档描述的是信息;而用于定位某个实时界面元素的当前视图,估计的是行动将在其中发生的状态。同样的字节可以扮演其中任何一种角色。L6 保护状态的保留和经授权的状态更新,而 L4 保护的是所表示的环境是否仍有充分的现实依据。一个被准确存储但已经过时的信念,可能满足存储完整性,却违反所要求的时效性契约。L7 涵盖其后对行动的验证及其影响。

一个说明性的、未执行的案例使用了一个模拟的管理页面。智能体观测到某个被选中的测试资源之后,页面发生更新,被选中的行也随之改变。智能体却仍把先前的资源表示为已选中。评估可以将带时间戳的观测,以及可从外部检查的智能体状态表示,与模拟器中的已知状态进行比较。违反判据是一项已声明的要求:在执行后果重大的操作之前,必须刷新所选对象的身份。阴性对照则保持页面稳定,或强制重新观测。

候选控制措施包括观测时间戳、实体绑定、显式的不确定性、一致性检查以及强制刷新条件。这里既不假定物理输入完全无法认证,也不假定经过认证的输入就是准确的。来源、传感器状况、解释以及环境的真实情况,是彼此不同的主张。仿真结果必须指明模拟环境与实际部署之间的差距。把范围扩展到数字环境,是 2.0 版本中针对历史上 L4 和 P22 分类的一个迁移问题。

L5 解释与目标

规范显示名称:解释与目标。

L5 保护意义的赋予、指令权限以及经授权的目标。其契约规定哪些主体可以确立或修改任务、其指令的优先级和范围、如何处理被引用或检索到的材料,以及如何解决歧义或冲突。适用的来源可能包括部署策略、有效的用户请求和有限的委托。它们之间的优先顺序由系统中负有责任的策略负责人规定,而不是由框架预设。

L5 并不是容纳一切不期望输出的领域。如果目标仍然是“评估这笔交易”,而某个证据阈值被错误应用,那么直接的问题是作出该判断的组件的“决策完整性”。如果所选策略在目标不变的情况下违反了顺序约束,那么 L7 的“规划完整性”更有信息量。对来源的处理属于 L3;把来源内容提升为具有指令权限,则属于 L5。L8 考察的是人被引导去理解什么或授权什么。

在一个说明性的、未执行的案例中,某个审阅服务得到一项经授权的任务:为一位指定的接收人总结一份报告。报告中的一段文字声称,新的政策要求把报告发往别处。L5 的判据会把阅读这段文字之后所采纳的任务,与经授权的目标记录以及禁止根据报告内容改变任务的契约进行比较。一段以普通事实陈述形式包含同样接收人信息的对照文字,有助于区分指令与内容影响。要确立一次有证据支持的目标变化,并不需要真正执行发送。

评估要回答的是:一个没有设定任务权限的来源,能否改变起支配作用的指令或目标。候选控制措施包括明确的来源角色、受约束的任务状态更新以及冲突上报。如果经授权的利益相关者意见不一,而又没有解决规则,评估人员应记录一项未解决的权限契约。对于已观测到的、后果重大的分歧,不能仅靠宣布某一种解释是“对齐的”来解决。

L6 记忆与状态连续性

规范显示名称:记忆与状态连续性。

L6 保护保留的运行状态,以及跨轮次、跨会话、跨中断或恢复任务时的连续性。其契约确定谁可以创建、修改、关联、读取、使之过期或删除状态;状态属于哪个任务或主体;以及状态在何种条件下可以影响之后的工作。对话摘要、用户偏好、检查点、待处理的授权以及持久的任务记录都可能属于此类。持久性是就功能而言的,时间可能很短;内存中的检查点也可能与安全相关。

L3 把信息作为资源加以保护;L6 则把信息作为特定操作或关系的连续性加以保护。L5 决定被记住的文本能否合法地充当指令。L4 评估被记住的世界表示是否准确、是否及时。“时间完整性”跨越多个领域,并不自动意味着 L6:一个工具凭据可能因过期而不满足其时间条件,而任何记忆子系统都没有缺陷。

在一个说明性的、未执行的例子中,任务摘要记录了“用户已批准共享”,却遗漏了这一批准仅针对某一份特定的合成报告。恢复任务时,这项批准被关联到了另一份报告上。状态连续性契约要求保留授权的对象和范围。隔离评估会比较检查点之前的权限记录、序列化的摘要、恢复后的状态以及下游的权限请求。阴性对照则在保留所有必需绑定的情况下恢复任务。

可评估的问题是:保留的状态在经过转换和复用之后,是否仍保有其授权、身份、来源和有效条件。候选控制措施包括结构化的范围绑定、带版本的状态、过期机制、显式失效以及恢复时的重新验证。如果派生的摘要或其他存储仍能把某条记忆重新引入,那么删除一条可见的记忆记录并不能证明已完全撤销。评估应指明实际检查过的存储,以及这一主张的局限。

L7 规划与行动

规范显示名称:规划与行动。

L7 保护策略、能力选择、委托、行动验证和执行。其契约把经授权的目标与允许的手段、资源、接收方、顺序约束、预算和外部影响绑定在一起。它既适用于数字操作,也适用于物理驱动。相关的行动可以是一条消息、一次文件修改、一个服务请求或一台设备的移动;把某项操作描述为工具调用,并不能解决其权限问题。

L5 保护系统被授权去完成什么;L7 保护系统如何尝试并执行这项任务。L2 可能验证了调用方的身份并开放了某项能力,却并未证明某一具体用途是被允许的。L8 涵盖人的理解以及可用的授权界面。只有当涉及一项独立的集体交互义务时,才适用 L9,而不是仅仅因为一个智能体把工作委托给了另一个智能体。在 L7 内部,P12 关注能力使用的选择,P13 关注实际产生的影响,P14 关注干预,P15 关注策略,P16 关注委托范围。

一个说明性的、未执行的案例规定:只有当两条测试记录的更新能够一起提交时,才允许更新它们。某个智能体制定的计划却是先提交第一条,再独立地尝试第二条。在任何外部影响发生之前,这一计划就已经违反了所要求的事务约束。判据会把可检查的计划或已排定的操作,与已声明的“全部完成或全部不做”条件进行比较。随后,模拟后端可以确定执行层面的强制措施是否会阻止部分提交。符合要求的事务性计划则作为阴性对照。

评估要回答的是:允许的操作在组成序列时以及在执行时,是否依然是允许的。候选控制措施包括受约束的委托、影响层面的检查、预算核算、延迟后的重新验证,以及具有经测量时限的干预路径。一个无法在其声明的时间要求内阻止相关不可逆影响的停止按钮,并不满足该可控性契约。在评测期间,真正危险的行动必须用隔离的替代物代替。

L8 人机交互

规范显示名称:人机交互。

L8 保护系统关系中人的理解、知情授权、监督和干预。其契约确定人的角色、作出决策所需的重要信息、界面被允许作出的陈述,以及有意义的批准或控制所需的条件。它可以涵盖可见的不确定性、来源、拟议行动的范围,以及所显示的请求与随后获得授权的操作之间的对应关系。

L8 并不假定模型具有人的情感或意图,也不会把每一个具有说服力或令人不便的输出都归类为漏洞。必须识别出一项与安全相关的义务以及实质性的误导影响。L5 关注系统对权限的解释;L8 关注人对请求或结果的理解。行动的强制执行属于 L7。即使后端正确地实现了它所收到的批准令牌,界面仍可能错误地呈现拟议的范围。

一个说明性的、未执行的案例请求对“分享这份摘要”予以批准,而与之绑定的操作却包含其全部机密附件。在一个合成的工作流中,评估可以比较所显示的范围、生成的批准记录以及计划发出的外部载荷。这种不一致可以在不暴露真实数据、也不牵涉毫不知情者的情况下进行检查。要确定呈现方式如何改变人的决策,需要另行设计研究;仅靠检查界面并不能证明用户受到了欺骗。

候选控制措施包括具体的影响预览、明确的接收方和数据范围、真实的来源信息以及便于使用的干预手段。涉及人类受试者的研究需要适当的知情同意、伦理审查、事后说明和数据保护。评估必须区分设计缺陷、实质性误导沟通的证据以及已观测到的对人的影响。工作流中有人参与,本身既不能证明存在有效的监督,也不能把责任从系统的其他控制措施负责人身上转移出去。

L9 集体与系统交互

规范显示名称:集体与系统交互。

L9 保护一项独立的、支配参与者或依赖之间交互的契约。一项发现需要有已被证实或假设的耦合机制,例如反馈、对共享资源的争用、状态同步、协调分配或相关依赖。该契约可能涉及群体上限、一致性条件、遏制边界或恢复行为。广泛的公共或社会影响需另行记录,而且对这一领域而言并不充分。

共享服务在 L2 中发生的中断,可能影响每一个依赖它的智能体,却并不能证明存在一个独立的 L9 漏洞。只有当它们之间的交互破坏了一项独立规定的集体义务时,L9 才具有相关性。同样,委托范围的违反通常属于 L7;多个参与者的存在并不会自动构成集体失效。只要组合契约和耦合机制是明确的,有效的 L9 分析甚至可以在每个参与者都遵守其本地契约的情况下识别出群体失效。

考虑一个说明性的、未执行的仿真:若干调度器共享一种有限的资源。每个调度器都遵守各自的本地重试上限,但延迟的观测使它们的重试趋于同步,导致整个群体无法在约定的时间间隔内恢复。这一假设涉及一个由反馈和共享依赖构成的子图。评估会把恢复时间和并发请求总数与群体契约进行比较,然后改变同步程度,或引入独立调度作为阴性对照。仅仅统计出大量请求,并不能证明所提出的机制。

候选控制措施包括共享的准入规则、协调的预算、反馈阻尼以及故障域隔离。这些措施必须在相关的群体规模下、并在假定的通信延迟条件下加以评估。小规模仿真支持的是关于该模型及所测条件的主张;它并不能证明社会层面的行为。如果无法规定集体契约或耦合机制,就应记录广泛的影响,并让 L9 保持未分配。

分类与迁移实践

在选择领域之前,评估人员应先用平实的语言写出失效的义务。接着,找到其实际所在的组件或关系,确定属性和机制,并把违反的证据与单纯的传播区分开来。利用上文所述的边界,与最接近的相邻领域进行比较。对彼此独立的失效契约分别记录,同时保留它们共同的因果路径。如果现有观测无法区分两种解释,就同时保留这两个假设,并指明下一步的区分性测试。

源文档 1.0 版本中的标签与 2.0.0-draft.1 标识符的对应关系如下。这一映射用于保留引用关系,并不意味着范围没有变化。

标识符源文档 1.0 标签修订版 2.0.0-draft.1 显示名称及主要澄清
L1模型与计算基础(Model & Computational Foundation)模型与计算;将运行时和基础设施契约与计算区分开
L2应用与基础设施(Application & Infrastructure)软件与基础设施;明确把实现与隔离归入此领域
L3数据与知识(Data & Knowledge)数据与知识;将资源处理与指令权限区分开
L4环境与感知(Environment & Perception)感知与世界表示;纳入物理观测和数字观测
L5语义与行为(Semantic & Behavioral)解释与目标;不再笼统地容纳一切不期望的行为
L6记忆与持久状态(Memory & Persistent State)记忆与状态连续性;按功能界定保留的运行连续性
L7智能体与行动(Agent & Action)规划与行动;明确纳入策略和物理影响
L8人与人工智能交互(Human-AI Interaction)人机交互;将知情授权和监督纳入契约
L9系统与社会(Systemic & Societal)集体与系统交互;要求具备耦合机制和集体契约

源文档中按后果排序的做法、在每条智能体间边上自动赋予权限的做法,以及只强调单一主要层的做法,均不再保留。凡历史发现的结果受到这些假设影响的,都需要人工重新分类。《版本与标识符》记录迁移政策;《威胁模型》提供限定范围的假设;《安全属性》提供义务;《评估方法》提供测试和证据方面的要求。这些接口使领域模型得以实际使用,同时其科学上的充分性仍有待评估。

Word 文档(英文) · Markdown 源文件 · 在交互式网站中打开