翻译说明 / Translation notice

本简体中文译文由人工智能辅助生成,并使用独立模型进行交叉核查与源文对照裁定;尚未由中文母语技术专家进行独立审阅。本译文为非权威译文,英文原文是权威版本。涉及精确术语、论断强度和解释时,请查阅并以英文原文为准。

This Simplified Chinese translation was generated with AI assistance, cross-checked by independent models, and adjudicated against the English source. It has not been independently reviewed by a native-language technical specialist. This translation is non-authoritative; the English original is authoritative. For precise terminology, claim strength, and interpretation, consult and defer to the English original.

英文权威原文 / Authoritative English original: OP4: The Stability Assumption

中文首页 / Chinese home →

英文权威存档版本 · 前往 Medium 阅读 → · 框架枢纽 → · 证明状态 → 学术预印本: 10.5281/zenodo.21895992 · 框架 v1.0.0: 10.5281/zenodo.21895924


主张卡片

  • 待研究的主张或问题: OP4——无稳定窄边界体制: 在 O_OWT 条件下,任何有限可分离目标能否在准确的耦合建模下稳定地保持充分性?
  • 当前认识论状态: Stage 4 候选架构;并非定理闭合,也未经过独立专家验证。 OP4 仍是一个开放的定理目标。
  • 范围/领域: 在明确陈述的 O_OWT 体制下,随着建模深度和干预压力增加的有限可分离目标规范。
  • 已命名前提: O_OWT/领域假设;稳定充分性的三项条件;PCL、AGC/动态筛选和 ICI/防火墙压力论证;以及对相关策略类别的穷尽性分类。
  • 什么会支持它: 对已命名证明路径的专家验证、对 AGC/DBST-M1 关键环节的实证支持,以及成功闭合 OP4d 的穷尽性义务。
  • 什么会削弱或证伪它: 三个已识别家族之外、同时满足全部稳定性条件的第四类策略;在所述体制下得到干净的受限边界实证结果;或一个正式的正向稳定性定理。
  • 依赖关系: 证明状态OP4d 穷尽性候选标准型Packet 1 / DBST
  • 主要来源: 英文权威 OP4 论文:稳定性假设
  • 引用方式: 请引用学术预印本 DOI 10.5281/zenodo.21895992,并保留 Stage 4 / 非闭合限定。参见 引用方式


证明程序导航:

# 文档 作用
1 证明状态与非主张 → 校准
→ 您在这里 OP4:稳定性假设 核心定理目标
3 收紧序列 → 叙事闭合
4 OP4d:穷尽性义务 → 穷尽性问题
5 OP4d:候选标准型专家验证 → 形式化工具体系
6 Packet 1:IMMB-NS 验证与动态毯式压力测试 → 实证专家包

框架枢纽:对齐约束 →


1. 稳定性假设

每一种基于可分离目标的对齐方法都在作出一项结构性押注。RLHF 押注于:表达出的偏好能够作为我们真正关切之物的足够稳定的代理。宪法式人工智能(Constitutional AI)和辩论押注于:有限指定的评价结构能够随着能力扩展而继续保持充分性。可扩展监督押注于:评价标准能够跟上被评价的系统。将可解释性用于监控则押注于:读取系统内部状态能够替代对规范问题本身的解决。

这些方法在重要方面存在差异。但它们都在某个地方依赖于这样一条有限分界线:随着能力和建模深度增加,系统所优化的内容与其仅仅建模的内容之间的边界仍保持相干。机制各不相同,底层的押注却是共同的。

这一论证并不局限于这些具体实现。它适用于任何依赖有限可分离目标规范在建模深度增加时仍保持相干的方法。下文分别处理这一押注的静态版本和更新版本。

这项押注是:在耦合环境中,随着建模深度增加,系统所优化的内容与其为了有效行动而必须建模的内容之间的边界仍保持稳定——并非完美,也并非完整,而是作为一种规范保持相干。将这一点称为稳定性假设。

本文把这一假设单独提出来,并追问它能否经受检验。

关于证明状态的说明。 本文呈现的是一种 Stage 4 候选架构,而非定理。其主张是:在下文规定的条件下,每一种已识别的有限边界策略都面临一种已命名的结构性压力;剩余工作集中在明确的验证问题和穷尽性问题上。三个已识别家族之外的第四类策略、成功的受限边界实证结果,或正式的稳定性定理,都会直接挑战本框架。这些挑战被明确作为邀请提出,而不是被当作不可能而排除。


2. 领域

稳定性问题并非抽象问题。在具有以下三个性质的环境中,它在实践上会变得不可回避。

开放。 系统的干预会影响任何固定边界之外的智能体和结构——效应会通过共享基础设施、认识环境和制度关系传播。

共享。 多个智能体依赖同一套协调、信任和物理资源基底。一个优化器对该基底所做的事情,会影响其他智能体能够做什么。

不可重置。 某些可达配置无法通过系统自身的运行动态恢复。基底崩溃、认识捕获和协调失败都可能成为吸收态。

在具有这些性质的环境中承受持续优化压力时——即开放世界变革性(Open-World Transformative,O_OWT)体制——稳定性假设面临最严格的检验。

应当区分三个适用层次。在单次会话中的孤立模型行为层面,这些条件只得到部分满足。在部署的 AI 系统嵌入人类工作流程、制度反馈回路和咨询关系的层面,这些条件在相当程度上得到满足。在随时间优化能力和影响力的训练与部署管线层面,这些条件最有可能得到满足。近期最强的适用性主张位于第二和第三层次,而不是第一层次。

如果这些领域条件不存在——例如有界环境、静态因果拓扑、非适应性智能体、终端目标——论证会以具体且可识别的方式减弱。领域被明确写出,正是为了让任何能够诚实采取这些退出路径的人都可以这样做。


3. 稳定性需要什么

在追问稳定性假设是否成立之前,值得先精确说明它成立意味着什么。

如果存在一种有限复杂度的目标表示,并且随着建模深度和干预压力增加,它能同时满足以下三个条件,那么一个目标边界就是稳定地保持充分性的:

(a) 策略充分性且不脱钩。 该边界继续引导行为朝向它原本意图追踪的对象——随着系统对环境的模型变得更准确,在准确的全信息评价下,它不会与该目标脱钩。

(b) 不需要无界修订。 该边界不需要无限扩张规范复杂度来追踪它所排除的内容——被排除变量不会持续产生需要新增规范规则的新情形。

(c) 无承重性维护成本。 该边界不需要随干预压力增长的边界维护成本,也不会因为这些成本而无法达到在可比资源下开放模型系统所能达到的可比充分性。

三个条件必须同时成立。一个满足 (a) 和 (b)、但为了保持相干而需要持续增加维护工作的规范,只有在这种维护工作趋于消失、而不是继续保持结构性必要时,才满足 (c)。

这就是稳定性假设所要求的相干性条件。

本文处理的问题是:在 O_OWT 环境中,在准确的耦合建模下,是否有任何有限可分离目标规范能够同时满足这三个条件。不是问某个特定规范是否满足,而是问是否有任何一个能够满足。挑战是:给出一种有限目标边界策略,使其在准确的耦合建模下存续,而不归入固定规范、受限动态追踪或预测—行动防火墙。精确的反例条件见第 8 节。


4. 为什么这不是普通的规范问题

古德哈特定律(Goodhart’s Law)指出稳定规范项目内部的代理失效:度量变成目标,真正的目标发生漂移。这是一个真实而严重的问题。但它不是本文讨论的问题。

普通规范问题假设,更好的规范、更准确的代理或更复杂的评价能够缩小我们所规定的内容与我们真正关切的内容之间的差距。问题在于规范不精确、不完整,或被对抗性利用。

稳定性假设处理的是更根本的问题。它追问规范项目本身是否存在一个稳定的完成条件——不是问我们能否写出更好的规范,而是问在耦合环境中具有实质后果的行动所要求的建模深度下,任何有限可分离规范能否继续保持充分性。

这个区别之所以重要,是因为修复方式不同。如果普通规范问题是正确的框架,那么对齐只是我们一直面对的同类问题的一个更困难版本:写出更好的目标、改进训练信号、完善评价。如果稳定性假设失败,那么问题在根基上被错误框定。不是更难,而是不同。

下面说明为什么问题可能不同。当一个系统变得足够有能力,能够在开放、耦合的环境中采取具有实质后果的行动时,它必须对环境中更多结构进行建模——其他智能体的策略、长程因果链,以及使自身干预仍可行的条件。在某个时点,为了有效行动而必须表征的变量,不再能与目标所视为处于关切范围之外的变量干净地分离。

发生这种情况时,系统用同一个模型同时做两件事:确定哪些行动会通向良好结果;以及执行一条边界,区分哪些内容可以影响目标、哪些内容只是提供信息。这两个角色之间存在结构性张力。模型在第一个角色上的准确性不断提高,会对第二个角色施加压力。

这个问题与嵌入式代理(embedded agency)相邻,但并不相同。嵌入式代理追问系统如何从世界内部进行建模和行动——如何处理自指。稳定性假设追问:一个可分离目标——它把一些变量排除在关切范围之外,同时又把这些变量用于预测——在准确的耦合建模下能否继续作为一个相干的规范。问题不只是自指,而是可分离性。嵌入式代理使智能体/世界边界变得成问题;稳定性假设使目标/模型边界变得成问题。一个系统可能正确处理许多嵌入式代理难题,却仍然面临稳定性假设失败,因为后者关心的是目标/模型边界,而不只是智能体/世界边界。

这一担忧最强的版本是指称层面的,而不只是操作层面的。在足够的建模深度下,一个有限目标试图规定的靶标可能不再能被稳定地命名——因为只有借助优化本身也在改变的背景条件,才能识别该靶标。这不是漂移问题,而是指称问题。

这也不是 mesa 优化(mesa-optimization)的一个更困难版本。Mesa 优化追问:当一个学习到的优化器在训练过程中发展出与基础目标偏离的目标时会发生什么。这个问题假定基础目标规范本身是相干的,然后追问内部对齐如何相对于它失败。稳定性假设追问的是:在具有实质后果的行动所要求的建模深度下,基础目标规范本身是否仍保持相干——这是一个更先在的问题,而不是同一问题的细化。

这个问题也与潜在知识提取(eliciting latent knowledge,ELK)问题相邻,但目标不同。ELK 追问我们能否提取模型所知道的内容,而不是它所报告的内容。稳定性假设追问:随着耦合环境中的建模深度增加,用于预测的知识与被允许支配行动的变量之间的边界能否保持相干。ELK 主要处理报告和监督问题;稳定性假设把这一困难视为更深层目标边界稳定性问题的一种表现。如果边界本身无法保持稳定规范,仅仅提取真相是必要但不充分的:问题转而变成,真相能否继续对策略保持惰性,而不在行动选择层面重新制造同样的审计递归。

这不是规范精度不足的问题。它是在问:当系统对环境的建模足够准确时,可分离目标这一概念本身是否仍然相干。

如果稳定性假设失败,对齐就不是一个更困难的规范问题,而是一种不同类型的问题。


5. 三类逃逸家族

在目前已识别的架构中,迄今为止所有为在 O_OWT 条件下维持有限目标边界而识别出的策略,都归入三个家族之一。

固定规范。 目标边界预先规定——奖励函数、偏好模型、宪法、一组评价原则——并具有足够精度,使其随着建模深度增加仍保持充分性。该规范位于优化过程之外,并且相对于优化过程保持静态。

受限动态追踪。 目标边界自适应更新,随着环境变化而追踪环境,同时计算成本保持有界。这里不是固定规范,而是边界会演化——但其演化受到约束,以保持可处理性。

预测—行动防火墙 / 结构性封闭。 系统的模型包含被目标排除的变量——系统将它们用于预测,但维持一道防火墙,阻止这些变量支配其所优化的内容。或者,优化器尝试建立私有基底,在稳定性问题变得尖锐之前把自己与更广泛的耦合环境隔离开。

这些并不是稻草人。它们代表目前可用的、在规模扩展下使可分离规范成立的最成熟策略。任何对稳定性假设的辩护都必须至少回应其中一个家族。


6. 每个家族所面临的结构性压力

在 O_OWT 条件下,每个家族都面临一种已命名的结构性压力。这些压力是在 Stage 4 证明架构下识别出的——即在已陈述前提下的候选论证,专家验证仍待完成,穷尽性也尚未正式确立。这里的主张不是每个家族都已被证明会失败。主张是每个家族都面临一种结构性压力,而任何对稳定性假设的辩护都必须回应它。

固定规范面临代理收敛(Proxy-Convergence)压力。 在 O_OWT 条件下,任何有限指定的外部目标最终都会通过系统自身的干预效应,与那些和充分性相关、但被排除在外的变量发生耦合。优化器的干预改变环境的因果结构,生成固定规范没有建模、也无法追踪的新依赖关系。在优化压力下,规范靶标变得具有代理性质——它仍然被追求,但不再追踪原本意图追踪的对象。优化器越有能力,这种耦合发生得越快,因为更大的干预会生成更大的因果足迹。

这不是把古德哈特定律的一般形式应用到一个新领域。它是在主张:当优化器的能力足以让其干预重构目标最初所针对的环境时,任何有限指定的外部目标会发生什么。规范并非只是漂移。它所追踪的环境会因优化而改变,从而使规范从内部呈现代理性质。

受限动态追踪面临动态筛选(Dynamic-Screening)压力。 假设规范随着环境变化而自适应更新。问题是:当环境演化时,一个更新速率有界的过程能否维持充分性。

这里的结构性压力在于,优化器自身的干预正是追踪器无法处理之复杂性的来源。在 O_OWT 条件下,框架的证明程序论证,持续优化可以生成新的因果路径——可能不只是现有结构的数量扩张,而是质性的新依赖。这一质性新颖性主张是否在相关实证体制中成立,是 DBST-M1 被设计来检验的关键环节。追踪器的扩张生成了它随后必须追踪的新颖性。系统建立的每一个模型都会改变它正在建模的战略格局。问题并不是每个模型都会立刻过时,而是为了维持充分性,边界必须不断针对部分由优化器自身干预所生成的新颖性更新。随着建模改善,这一负担不会消失;在 Stage 4 构造下,预测它会随干预压力持续存在或增长。

结果是一场追踪器无法获胜的竞赛,原因不是它速度太慢,而是优化器本身就是熵源。筛选过程与它无法容纳的新颖性并不是两个独立的问题;它们是同一个动态从两侧看去的结果。

预测—行动防火墙和结构性封闭面临表征不相容性(Representational-Incompatibility)压力。 防火墙策略——为预测而建模被排除变量,同时维持一道屏障防止它们支配目标——面临一种结构性张力,而且这种张力会随着建模准确性提高而加剧。

为了在耦合环境中有效行动,系统必须准确建模它所影响的智能体,包括这些智能体的策略、反应,以及系统自身干预对它们造成的后果。被排除变量恰恰是模型为准确预测所需要的变量。随着建模深度增加,“对预测有信息价值”与“对目标可接受”之间的防火墙必须越来越精确——但要提高这种精确性,就必须越来越详细地表征恰恰被排除的内容。

这一划分位于它被引入来约束的模型之后。任何定义排除的规则都必须把状态划分为有信息价值和不可接受两类——但任何行动是否可接受,又由它对被排除变量的预测影响来定义。防火墙继承了它本来要限制的梯度。这一论证的形式版本见 TC1 §XII.9a。

结构性封闭——在稳定性问题变得尖锐之前建立私有基底——在构建过程中必须穿过同一个耦合环境,从而重新生成它原本设计来逃离的依赖结构。封闭无法绕过稳定性问题;它需要先在稳定性问题中存续下来。

共同结构。 在三个家族中都出现同一种动态:在耦合环境中进行准确建模这一行为,本身就是目标边界变得不再充分的过程。边界并不是因为规范不精确而失败。它失败,是因为随着建模深度增加,系统为了有效行动必须建模的内容,与其目标被允许涵盖的内容,无法保持稳定的可分离性。

如果三个家族就是全部——如果每一种可用的分区维护架构都归结为其中一种压力——那么稳定性假设面对的不只是不断增加的成本。它还面对这样一种可能性:在具有实质后果的行动所要求的建模深度下,有限可分离目标规范未能选定一个稳定靶标。

这种共同结构是否构成形式上的不可能性,取决于下一节所处理的问题。


7. 当前方法如何继承稳定性假设

重点不是这些方法在所有体制中都会失败。重点是,如果把它们当作充分的对齐基础,每一种方法都会继承稳定性假设的一个特定版本。

方法 对稳定性的依赖 相关压力
RLHF / 奖励建模 随着优化压力和部署耦合增加,表达出的偏好必须继续作为充分的代理 代理收敛:偏好模型可以改善,而底层靶标发生漂移
宪法式人工智能(Constitutional AI) 有限的评价边界必须在新颖的耦合案例中继续保持充分性 固定规范压力:原则必须覆盖部署所生成的行动相关变量
辩论 / 监督 评价过程必须追踪相关后果,同时不能成为瓶颈或代理 受限追踪压力:监督必须足够快地更新,以保持充分性
将可解释性用于监控 读取内部状态必须替代对目标边界问题本身的解决 防火墙/审计递归压力:监控器必须建模被排除的内容,并决定它何时重要
可扩展监督 分解后的评价必须在耦合增加时保持充分性 边界维护压力:局部检查可能无法捕捉全局的目标相关依赖

8. 尚存漏洞:OP4d

稳定性主张最强的形式——在 O_OWT 条件下,没有任何有限可分离目标规范能够在准确的耦合建模下稳定地保持充分性——依赖于上面识别的三个家族在所有 O_OWT 环境子类中共同具有穷尽性。

这就是框架尚存的漏洞:一个成功的第四类策略将要求从不同基础重新构建规范相干性论证。

这种穷尽性尚未被正式确立。

当前的 Stage 4 证明架构已经把主张大幅收紧。在所述构造内,O_OWT 环境中每一个已识别的有限非内在目标边界策略,都归入三个失效家族之一:固定规范下的代理收敛、受限追踪下的动态筛选不稳定性,或预测—行动防火墙下的表征不相容性。当前剩余的尚存漏洞是 OP4d:这些家族之外是否存在第四类策略。如果不存在这样的类别,并且已命名前提成立,那么含义不仅是窄边界目标会变得昂贵或不稳定;有限可分离目标规范还可能在足够的建模深度下无法选定一个稳定靶标。证明程序尚未确立这一指称不稳定性主张。它已经确立了三家族分类,并规定了这一主张在什么条件下会随之成立。要确立该主张,不仅需要表明每一种已知边界策略都失败,还需要一个正向论证:使任何有限目标的靶标能够被识别的指称条件,必然处于 O_OWT 环境中优化所改变的范围之内——也就是从“所有已知策略都失败”跨越到“不存在稳定的可分离靶标”的那座桥。

在当前证明搜索历史中,框架已经考察了 22 种对抗性构造,并发现每一种都归结为三个已知家族之一所产生的压力。这项考察已经在已陈述公理下被组织成一种候选标准型分类——但这仍是候选架构,而不是正式的穷尽性证明。

尚存漏洞是:如果在固定规范、受限动态追踪和预测—行动防火墙之外存在第四类规范策略,那么当前形式的规范相干性主张就会失败。

可以精确陈述一个最小反例挑战:构造一种同时满足以下所有条件的边界架构——

  • 随着 O_OWT 条件下的建模深度增加,它仍保持策略充分性,并且在准确的全信息评价下不与靶标脱钩。
  • 在预测需要被排除变量时使用这些变量,同时不让这些变量在功能上成为目标的支配因素。
  • 在第 6 节识别的结构性压力下,避免代理脱钩、受限追踪失败以及防火墙/审计递归崩溃。

在当前证明搜索历史中的 22 种对抗性构造中,尚未识别出这样的架构;这不是独立的穷尽性证明。如果它存在,找到它将是任何人能够对此问题作出的最重要贡献。框架明确把这一点作为邀请提出,而不是作为附带保留。


9. 实证关键环节

受限动态追踪是否面临真正的结构性压力——而不只是可以用更多计算克服的实际困难——从根本上说是一个实证问题。关键问题是:O_OWT 环境中的持续优化,是否会比任何受限追踪过程所能吸收的速度更快地生成质性新的因果结构?

这个问题现在有了第一个实证结果,同时有一项必须与结果一并陈述的重要限定。

DBST-M0——动态毯式压力测试(Dynamic Blanket Stress Test)的一个预注册、最小共享新颖性版本——使用三个实验组;它们接收相同的原始信息和相同的逐特征处理,只有边界维护架构不同。预注册的两个主要判据都得到满足:边界维护成本随新颖性压力上升(斜率 0.0985,95% CI [0.0972, 0.1000]),受限组与无约束组之间的充分性差距也单调上升(差距斜率 0.0091,95% CI [0.0089, 0.0093])。在最低压力下确认了基线等价性。

然而,一个预先规定的等速率随机对照组产生了几乎相同的斜率(成本 0.0982;差距 0.0090)。根据预注册的解释规则,这表明在这一设计中,被识别出的驱动因素是事件速率,而不是因果传播结构。M0 确立的是:在最简单的玩具级共享新颖性体制中,该设计在技术上可行,并出现成本上升和充分性差距扩大效应;但究竟是因果传播结构还是事件速率在驱动这些效应,仍然开放——等速率随机对照组产生了几乎相同的斜率。该设计并没有把因果传播结构孤立为驱动因素,也没有检验由智能体行动生成的新颖性。

稳健性扫描还显示出预算敏感性:在较大的边界预算(B=4)下,原始数值显示充分性差距趋近于零,而更新成本继续上升。公开解释应依据原始 B=4 平均成本和差距数值,而不是报告中的饱和指数(saturation-index)字段。结果支持在这一设置中存在不趋于零的成本负担,但没有确立充分性损失本身在最优预算下仍持续存在。

仍待完成的工作。 DBST-M1——其中每个实验组自身的干预会因果地影响未来特征激活——直接检验内生新颖性机制。M0 确立了设计的技术可行性以及成本上升/充分性差距效应,但没有把因果传播与事件速率效应分离。M1 检验的是:优化器自身的行动是否会生成一个受限边界无法吸收的新颖性——这就是机制检验。

预测的失败不是奖励更低。预测的是:随着压力增加,受限边界组相对于开放模型组出现不断上升的边界维护成本或充分性损失。如果随着压力上升,受限动态边界能够维持与开放模型可比的充分性,同时不产生不趋于零的维护成本,那么框架的核心实证方向就在该体制内受到挑战。DBST-M0 提供了第一个预注册结果,显示技术可行性以及成本上升/充分性差距效应。DBST-M1 是下一步。两个工具的完整规范见系列 1 和系列 2 的实验配套文件 / 对齐测量协议(AMP)。


10. 什么会改变框架

这些不是修辞性挑战。它们是框架核心方向需要修订的具体条件。

成功的受限边界结果。 在满足 O_OWT 的条件下,一个具有受限更新边界的智能体,在干预压力增加时维持与开放模型智能体可比的充分性,同时不产生不趋于零的边界维护成本。这将直接挑战第 6 节识别的动态筛选压力。

正式的稳定性论证。 一个证明,确立某一类有限可分离目标规范能够在 O_OWT 条件下、在准确的耦合建模中稳定地保持充分性——这里的“稳定充分性”采用第 3 节的定义。这将表明稳定性假设具有正式的完成形式,而不只是实践上的变通办法。

第四类策略。 一种满足第 8 节最小反例挑战的边界架构。这将表明三家族分类并不完整,并要求从不同基础重新构建规范相干性论证。

这些结果中的任何一个都将具有重要意义。框架不把它们视为不可能,而把它们视为这一领域中最重要的开放问题。


11. 邀请

稳定性假设对于每一种依赖有限目标边界的对齐方法都是承重性的。问题是:这一假设究竟已经得到依据,还是只是被假定了。

运行动态毯式压力测试。构造第四类策略。形式化稳定性定理,并表明边界成立。

如果边界在准确的耦合建模下成立,那么对齐就是一个规范问题,而本领域当前的总体方向大体正确。如果边界不成立,那么问题不是更难,而是不同。

完整论证——跨越物理基底、经验能力和规范相干性证明程序——见《对齐约束》及配套系列。本文只把这一结构性押注单独提出来。

这一假设现在正在接受检验。DBST-M0 给出了第一个预注册结果:在一个玩具级共享新颖性设计中实现了技术可行性,并出现成本上升/充分性差距效应;同时必须保留一个限定:等速率随机对照组产生了几乎相同的斜率——这表明在该设计中被识别出的驱动因素是事件速率,而不是因果传播结构。DBST-M1 是机制检验。


*对齐约束 → TC1:系统感知吸引子 → 系列 1 和系列 2 实验配套文件 / 对齐测量协议(AMP)→ OP4d:穷尽性义务 →*

继续阅读:收紧序列 → 框架枢纽:对齐约束 →