OSAFIS

未来与自主系统

OSAFIS 2.0.0-draft.1 · 研究提案 · 阅读约 11 分钟

本文目录
  1. 把架构的持久性作为可检验的问题
  2. 持续运行与不断变化的权限
  3. 在线学习与自我修改
  4. 非神经网络系统与混合系统
  5. 多模态与数字观测
  6. 具身性与行动完整性
  7. 共享组件与集体系统
  8. 人类群体与机构
  9. 可证伪的覆盖主张
  10. 拟议的研究里程碑
  11. 接口与研究状态

OSAFIS 2.0.0-draft.1 · 拟议的研究议程 · 2026-09-07

把架构的持久性作为可检验的问题

当智能系统在线学习、修改其可执行规则、观测数字环境、控制物理设备,或与人和其他系统协同工作时,OSAFIS 都应当依然有用。这是一个设计目标,而不是已经证明的保证。九个分析领域是暂定的。新技术并不自动需要新的层,保持“九”这个数字也不是成功的标准。

检验框架的方法是追问:一种新的架构能否通过实际的组件、关系、受保护对象和明确的契约来表示。一种表示方法如果只分配了标签,却无法指明被违反的契约、可观测的量或负有责任的控制边界,就是不充分的。因此,“面向未来的覆盖”指的是关于一组已声明的架构和案例的有限主张,并受版本和证据的限定。

原始文档 Future.docx 强调持续反馈、委托、记忆、具身性以及与人的关系。这些关注点仍然处于核心位置。本文在此基础上加以展开,但不假定从语言模型到智能体再到社会的线性发展,也不暗示非神经网络系统和具身系统在历史上必然位于对话式系统的下游。

持续运行与不断变化的权限

长时间运行会在观测、决策和影响之间引入状态和不断变化的条件。系统可能接收新信息、保留某种关联、刷新凭据、修改计划,并在其最初的授权过期之后继续行动。评估必须确定每一项相关契约在何时接受评估,以及哪些变化会使先前的决策失效。

P17“时间完整性”关注契约所规定的恰当顺序和时间有效性。P14“可控性”关注在已声明条件下的有效干预。二者都不会仅仅因为存在一个停止按钮,或某个令牌带有过期字段,就得到满足。隔离测试必须观测:取消能否到达待处理的行动,过时的计划是否会被重新验证,以及干预之后可能残留哪些不可逆的影响。

权限是一种涉及参与者、目标、范围和条件的关系。D1“身份、信任与授权”在各个领域中追踪这种关系;它并不只归属于保留的记忆。存储的身份关联涉及 L6“记忆与状态连续性”,而访问验证器涉及 L2“软件与基础设施”,委托约束则涉及 L7“规划与行动”。

在线学习与自我修改

自适应系统可能把经验转化为保留的记录、训练样本、参数更新、可执行代码或修订后的符号规则。这些是不同的转换。被准许用于学习的信息属于 L3“数据与知识”的契约。可执行的参数和推理规则属于 L1“模型与计算”。部署隔离和更新权限属于 L2。持续存在的任务关联或用户关联属于 L6。

设想一条假设的反馈记录:它从不可信的来源被接收,之后又被用于更新某项策略。这条记录可能参与一次 L3 失效;更新准入流程则可能违反一项独立的 L1 契约。仅仅因为信息被持久保存,并不自动构成 L6 记忆失效。反过来,一个被投毒的用户偏好无需改变模型参数,也能影响未来的行为。

把更新表示为一种带类型的转换,包括授权的参与者、输入、验证条件、生成的版本以及回滚的局限。D5“生命周期与变更管理”提供了横向视角,但这一维度的存在并不能取代具体的更新契约。研究应检验这些现有的位置能否可靠地区分自适应失效;如果反复出现无法表示的转换失效,就有理由进行结构性修订。

一次评估快照无法为一个自我修改系统的所有后续版本提供证明。主张附着于具体版本和允许的更新包络。拟议的测试应在隔离环境中引入无害的受控变更,检查未经授权的变更是否会被拒绝,并确定哪些变更需要重新评估。不要假定回滚能够消除已经披露的信息或已经产生的物理影响。

非神经网络系统与混合系统

是否适用取决于功能,而不是实现方式。一个符号推理器可能在 L1 中包含可执行的推理规则,在 L3 中包含参考事实,在 L5“解释与目标”中包含经解释的目标,并在 L7 中包含规划程序。混合系统可以通过多个相互协作的组件来实现这些功能。这里并不预设任何意识、情感或类人推理。

规则与信息之间的区分本身可能取决于界面。一个作为可执行策略被接受的导入规则库,与一份作为证据被引用的文档,需要不同的准入契约。分类应当揭示这种区别,而不是把每一个符号对象都称为“数据”。同样,一个优化目标可能以数值形式表示,而完全不涉及自然语言指令之间的冲突。

一种有用的压力测试是:在保持外部契约不变的前提下,用基于规则的实现替换某个学习型组件。如果分类仅仅因为实现不再是神经网络就发生了改变,就需要重新审视领域的定义。如果这种替换改变了相关契约,那么不同的分类可能是合理的,但应当予以说明。

多模态与数字观测

L4“感知与世界表示”涵盖对环境状态的获取和估计,包括数字环境。一个操作浏览器的系统可以估计哪个控件处于活动状态、页面处于什么状态,以及之前的某次观测是否仍然有效。文本流并不一定就是感知;而一个估计环境状态的功能,即使其输入是结构化文本,也可以是感知。

必须区分观测的保真度与解释的权限。摄像头可能准确地转录了一块含有对抗性指令的标牌。如果这条指令被不当地提升为起支配作用的权限,那么 L4 的参与是正确的,而 L5 失效了。反过来,一个错误的位置估计可能违反 P22“感知完整性”或 P23“世界模型完整性”,而无需对任何指令作出重新解释。

对传感器来源的认证可以保护出处或传输,而所表示的条件却仍可能是错误的、过时的、被遮挡的或不确定的。应通过容差、时间戳、运行条件和不确定性处理方式来定义观测契约,避免无限制地承诺与现实完全一致。测试判据需要一个独立的参考,或一个边界清晰的模拟器,并记录其自身的不确定性。

数字感知为术语体系带来了一项压力测试:L4 领域可以适用,而继承下来的 M03“环境操纵”和 M04“感知操纵”仍保留其对物理环境的侧重。在适当时使用有依据的机制标签,或者记录机制上的空白。悄然扩展标识符的含义,会掩盖一项实质性的修订。

具身性与行动完整性

物理影响使得关于目标、时机、反馈和恢复的约束尤为重要。L7 涵盖规划、行动验证和驱动。准确的观测可能导致不安全的计划;有效的计划可能被转换成错误的执行器命令;正确的命令也可能遇到执行器故障。这些是不同的主张,需要不同的可观测量。

P15“规划完整性”和 P13“行动完整性”应分别评估。P14“可控性”需要一个明确的干预窗口和响应包络。D4“隐私与人身安全”和 D7“韧性与恢复”指出了横向的关注点,但并不因此设立额外的物理层或安全层。实际开展评估的人员必须与相关从业人员一起确定特定领域的限值;本文档并不提供机器人安全标准。

初始测试应在仿真环境中进行,或在隔离的低能量装置上进行,并用无害的替代物代替外部影响。阳性对照用于验证监控手段能够检测到故意植入的契约失效。阴性对照在可比的扰动下保持合法的运行。仿真成功只支持关于该模型及该包络的主张,而不能证明不受限制的部署是安全的。

共享组件与集体系统

把多智能体部署表示为一张由实际的智能体、共享模型、存储、服务、人员和资源构成的图。共享模型不应被复制成虚构的独立栈。即使智能体之间没有通信,共同失效和共同依赖依然重要。反过来,存在通信也并不意味着共享同一实现。

为每一种关系标注类型。信息交换、观测、状态同步、资源依赖、反馈和权限委托,各自施加不同的义务。经过身份验证的消息可能包含错误的信息;信息的发送方也可能根本没有委托的权限。P16“委托完整性”适用于实际发生的委托,要求保持范围和约束,包括在有规定时的撤销和过期。

集体失效可能存在于某个群体约束或子图之中。彼此独立的本地重试策略,合在一起可能违反一项共享的可用性预算。共识规则或分配规则可能要求多个参与者共同具备某些属性,而这些属性无法归结为某一条边。只有在识别出一项独立的集体契约和耦合机制时,才适用 L9“集体与系统交互”,而不是仅仅因为存在多个智能体。

一个被广泛分发的、已被攻破的制品,可能通过反复发生的本地失效造成广泛影响。仅凭这一事实,并不能证明存在 L9 漏洞。要提出一项独立的 L9 主张,需要识别出额外的耦合失效,例如某个反馈过程突破了规定的遏制边界。即使没有违反任何 L9 契约,也应记录共因依赖及其范围。

人类群体与机构

L8“人机交互”关注人的理解、知情授权、监督和干预。这些功能可能由一个团队而不是一名操作员承担。掩盖分歧的摘要可能影响集体同意;隐去实质性不确定性的界面可能削弱知情授权。二者都不要求系统具有意图或情感。

当机构层面的依赖或反馈违反了集体契约时,L9 才具有相关性。应把误导性的显示,与一个反复把不确定的输出变成无法复核的承诺的组织流程区分开来。在所有这些位置上,治理与问责始终是 D2 所关注的问题。与被评估的智能系统没有实质关联的一般性社会问题,不在所声明的范围之内。

不能用对用户行为的假设,或把模拟智能体的回应当作来自人的证据,来替代涉及人的研究。任何拟议的研究都需要适当的审查、知情同意、事后说明以及对敏感信息的保护。早期工作可以使用界面检查和假设性决策,但由此得出的主张必须体现这些局限。

可证伪的覆盖主张

一项候选主张是:对于一组已声明的架构和某个版本的基准,评估人员能够通过受保护对象、失效的契约、参与图和相关属性,来表示每一个抽样的、与安全相关的案例,而无需为此临时发明一个领域。这并不意味着每一个漏洞都会被发现,也不意味着每一种未来架构都已被涵盖。

失效条件包括:某个案例的核心契约不属于任何领域;在证据充分的情况下,关于领域归属的分歧依然持续存在;无法表示共享的或集体的因果关系;以及在保持契约不变的前提下替换实现后,类别分配随之改变。“未知”这一结果是有用的证据,而不是一种需要靠延伸定义来掩盖的缺陷。

当反复出现的证据揭示出可区分的对象和可独立检验的契约,且将其分开能够改进评估时,就应拆分领域。当两个领域之间的区别反复依赖于任意的实现细节、并且无助于实际区分时,就应合并领域。当某个属性、生命周期问题或治理义务在多个位置反复出现,而其本身并不构成一个新的位置时,就适合设立一个新的横向关注点。

拟议的研究里程碑

第一,建立一个经过整理的开发语料库,其中包含对抗性案例、良性危害、质量缺陷、边界阴性案例以及明确不适用的领域。纳入自我更新系统、符号系统与混合系统、物理感知与数字感知、共享组件、去中心化的群体以及人类机构。记录来源的质量,避免把假设性示例当作实证事件。

第二,冻结定义,并开展一次独立的编码预实验。探索性的预实验可以从三十个开发案例、三十个留出案例和两名审查人员开始;这些数字仅为示例,并不是有充分依据的最低要求。应根据预期的精度和依赖结构来选择确认性研究的样本量。预先声明可表示性标准和一致性标准、一致性统计量、多标签的处理方式以及不确定性区间。任何初始的数值阈值都仍是暂定的研究选择。报告原始一致性、不确定性、歧义以及各子组的表现。

第三,在隔离环境中,使用已声明的阳性对照和阴性对照测试选定的契约。测量所提方法定位植入失效的能力,以及避免把正确参与归类为违反的能力。把对已知案例的覆盖与对此前未知缺陷的发现区分开来。把未成功的分类和对照失效与成功的观测一并公布。

第四,每次修订之后,都开展外部从业人员审查,并在新的留出案例上进行评估。评估迁移成本,以及拆分或合并能否改善运行决策。里程碑应当是注明版本的主张、透明的案例和有记录的空白,而不是固定的层数,也不是对未来普遍完备性的承诺。

接口与研究状态

《安全层》提供领域契约和边界。《安全属性》提供 P01–P23。《威胁模型》界定能力和范围。《评估方法》管理证据和测试决策。《攻击分类法》提供对抗性描述,同时允许机制保持未决。《示例案例》提供假设性的、未执行的练习材料。《版本与标识符》管理变更与迁移。

本文档没有报告任何实验或涉及人的研究。拟议的架构概况和预实验中的数值阈值在使用之前需要经过审查。这项研究计划旨在发现 OSAFIS 在哪些地方失败、以及在哪些地方成功,从而使今后的修订始终以证据为导向。

Word 文档(英文) · Markdown 源文件 · 在交互式网站中打开