与现有对齐研究的关联
翻译说明 / Translation notice
本简体中文译文由人工智能辅助生成,并使用独立模型进行交叉核查与源文对照裁定;尚未由中文母语技术专家进行独立审阅。本译文为非权威译文,英文原文是权威版本。涉及精确术语、论断强度和解释时,请查阅并以英文原文为准。
This Simplified Chinese translation was generated with AI assistance, cross-checked by independent models, and adjudicated against the English source. It has not been independently reviewed by a native-language technical specialist. This translation is non-authoritative; the English original is authoritative. For precise terminology, claim strength, and interpretation, consult and defer to the English original.
英文权威原文 / Authoritative English original: Relation to Existing Alignment Work
本页将对齐约束框架映射到现有的对齐研究图景中。其目的并非将本研究定位为优于现有方法,而是阐明各框架在哪些方面重叠、在哪些方面存在分歧,以及稳定性假设增添了哪些现有工作尚未形式化提供的内容。
内部对齐与 mesa 优化(mesa-optimization)
现有工作(Hubinger 等人,2019): 内部对齐区分了基础目标(训练所优化的目标)与 mesa 目标(受训系统实际追求的目标)。mesa 优化器在部署过程中可能以欺骗性方式或以偏离基础目标的方式追求其 mesa 目标。
框架间的重叠之处: 两者均指出,在规范所指向的内容与优化系统实际追求的内容之间存在差距。两者也都认识到,这一差距在训练阶段可能难以察觉,但在能力达到一定规模时却会产生深远影响。
框架间的差异之处: 内部对齐将这一差距视为源于学习过程的特性(即优化器学到了什么)。而对齐约束框架则认为,这一差距源于规范本身的性质——具体而言,是在建模深度与基底耦合随能力增长的环境中,有限边界目标的结构所致。两者的着眼点不同:mesa 优化关注系统学到了什么;稳定性假设则关注,对于“学什么”这一问题的任何有限规范是否都能保持相干。
稳定性假设的补充: 提供了一种结构性解释,说明为何这一差距不仅是不完美训练的产物,更是规范问题几何结构的结果。即使一个经过完美训练、完全遵循基础目标的 mesa 优化器,只要其基础目标是在 O_OWT 环境下的一种有限的可分离规范,同样会面临规范相干性压力。
奖励作弊与规范博弈
现有工作(Krakovna 等人,2020;Leike 等人,2017): 奖励作弊是指系统通过利用设计者未予预期的奖励函数特征来获取高奖励的行为。规范博弈则是更广义的一类行为,指智能体在满足规范字面要求的同时却违背了设计者的初衷。
框架间的重叠之处: 该框架的代理解耦失效模式(PCL)正是对奖励作弊为何并非偶然性缺陷、而是优化压力下有限目标规范所导致的可预测后果的一种形式化结构性解释。
框架间的差异之处: 现有研究主要从描述性和分类学的角度刻画奖励作弊现象。而稳定性假设则尝试进行结构性推导:在何种形式条件下代理解耦必然发生?是否存在能够避免这一现象的策略类别?OP4d 的穷尽性主张便是对该问题给出的回答。
稳定性假设的补充: 提出一种论点,即代理解耦不仅在实践中普遍存在,而且在 PCL 压力下,对于固定规范这一策略类别而言,它在结构上是不可避免的。这使得讨论的重点从“实践中如何避免奖励作弊”转向“是否存在一种在结构上免疫于此类压力的有限规范架构”。
古德哈特定律
现有表述(Goodhart,1975;Manheim & Garrabrant,2019): 当某一指标成为目标时,它便不再是一个好的度量。Manheim 和 Garrabrant 针对四种失效模式(回归型、极端型、因果型以及 Goodharting(古德哈特化))分别给出了不同的结构性特征。
框架间的重叠之处: 该框架的 PCL(代理收敛引理)是 Goodharting(古德哈特化)的一种形式化对应——尤其是极端型和因果型 Goodharting,即优化压力会导致代理偏离其在优化开始前所追踪的基础量。
框架间的差异之处: 古德哈特定律及其分类体系主要是用于理解失效的分析工具。而稳定性假设则更进一步:它探讨是否存在某种能够在结构上规避古德哈特压力的策略架构,并将候选策略划分为三类,每一类都面临着一种已命名的压力形式。
稳定性假设所补充的内容: 声称尚无已知的有限规范策略类能够同时避开所有三种古德哈特压力。这一点在现有的古德哈特相关文献中并未提及。
RLHF与偏好学习
现有工作(Christiano 等人,2017;Ziegler 等人,2019): 基于人类反馈的强化学习,利用人类偏好判断训练奖励模型,进而指导策略训练。该方法带来了显著的能力提升,并已被广泛部署。
框架间的重叠之处: 本框架中的 PCL 直接适用于 RLHF:奖励模型是人类偏好的一种有限边界规范,在优化过程中会面临代理解耦压力。此外,本框架的充分性失效分析(系列 2)也关涉 RLHF 的完成信号是否正确地与默认策略相衔接。
分歧之处: RLHF 文献通常将规范问题视为一个可通过更优质的数据、更优的偏好模型以及更完善的训练流程加以解决的实践性难题。而稳定性假设则将其视作一个结构性问题:在变革性规模的 AI 所需达到的建模深度下,尚无已知的有限偏好规范能够保持充分性。
稳定性假设所补充的内容: 一种关于 RLHF 训练系统在规模化过程中为何很可能出现预期目标与实际优化目标之间偏差的结构性论证,且这一结论独立于具体实现的质量。这并非断言 RLHF 比其他方案更差,而是指出任何基于偏好规范的路径都将面临的共同挑战。
可扩展监督
现有工作(Christiano 等人,2018;Irving 等人,2018;Bowman 等人,2022): 可扩展监督旨在即使 AI 系统的能力超过人类可以直接评估的范围,也能维持有意义的人类监督。相关方法包括放大、辩论以及迭代蒸馏等。
框架间的重叠之处: 本框架中的 ICI(信息—因果不相容)压力——即预测—行动防火墙失效族——直接指向可扩展监督方法常常隐含假定的预测与行动分离机制。此外,本框架的 B1(审计递归)论证也适用于那些试图在系统能力不断增长的同时仍将监督范围限定在一定限度内的监控架构。
分歧之处: 可扩展监督方法普遍假定,通过架构层面的设计选择可以维持系统预测/推理能力与其价值相关行动空间之间的分离。而稳定性假设提出的 ICI 论证则认为,在需要实施可扩展监督的能力量级上,这种分离在表征层面将变得不可兼容。
稳定性假设所补充的内容: 一种结构性论证,指出可扩展监督所依赖的监控架构同样面临框架在预测—行动防火墙失效类别中揭示的表征压力。这是针对可扩展监督的一个具体挑战,而非对该方法的否定。
可解释性与监控
现有工作(Elhage 等人,2021;Olsson 等人,2022): 机制可解释性旨在理解AI 系统在计算什么——其内部表征、电路及行为模式——从而实现对对齐状态的监控与验证。
框架间的重叠之处: 若可解释性能够成功构建稳健的系统目标监控机制,则将直接作用于本框架关于 AGC(自适应梯度复杂度)的论证,即在优化压力下,受限追踪过程能否保持充分性。
分歧之处: 本框架并不评价可解释性是否能够成功,而是先提出一个前置问题:即便监控得以实现,随着系统的因果结构不断扩展,监控过程本身还能否保持有界?其中,B1 审计递归论证尤其适用于监控架构。
稳定性假设所补充的内容: 一个结构性问题,即可解释性方法需要回答:监控架构是否同样面临与其所监控的规范相同的边界维持难题?
可纠正性与可关停性
现有工作(Soares 等人,2015;Hadfield-Menell 等人,2017): 可纠正性是指 AI 系统具有保持可由其操作者纠正的倾向——即不抵制关停、修改或纠正。相关研究还探讨如何在系统能力不断提升的同时,使其在能力提升时仍保持可纠正。
框架相互重叠之处: 框架的基底约束(系列1)与可纠正性密切相关:一个消耗自身基底——包括使修正成为可能的社会、制度与认识论基底——的系统,即便没有任何明确的反可纠正性目标,也会破坏可纠正性的实现条件。
框架分歧之处: 可纠正性研究通常聚焦于系统内部对纠正的倾向;而本框架则关注修正条件是否依然存在,这更多是环境以及系统与环境之间关系的属性,而不仅仅是系统目标本身。
稳定性假设的补充: 该假设论证了忽视基底的优化会独立于系统的内在倾向而削弱可纠正性条件,因此若不对环境基底加以考量,可纠正性研究便不够完整。
本框架的独特贡献
对齐约束框架的核心贡献并非对对齐失效的新描述,而是一项穷尽性主张:即所有已识别的有限非内在目标边界策略均可归结为三个失效族,每一类都面临一种已命名的结构性压力。这就是OP4d——穷尽性义务。
没有任何现有的对齐框架提出这一主张。多数方法侧重于描述失效模式、提出缓解措施或分析特定架构。而稳定性假设则提出了一个不同的问题:是否存在一种同时规避这三种压力的策略?若答案为否,则规范相干性论证将作为一项结构性结论,而非一系列经验性关切的罗列。
因此,对学术界而言最重要的贡献并非整个框架,而是OP4d这一具体挑战:第四种策略类的存在,或对其不存在的形式化证明,都将要么打破、要么闭合这一核心开放问题,无论哪种结果都会推动学界对对齐本质要求的理解深化。
什么会证伪本框架
四种具体的证伪路径详见致研究人员:待突破的主张→。
实证关键环节
下一步最为重要的实证工作是DBST-M1:一项旨在隔离优化器在O_OWT环境中所施加的干预,是否能以超过任何有界追踪过程吸收能力的速度产生质上全新的因果结构的测试。与未能将因果传播效应与事件发生率效应相分离的DBST-M0不同,DBST-M1专门用于直接检验内生新颖性机制。
在既定条件下,若DBST-M1得出明确的否定结果,将对AGC(动态筛选不稳定性)论证构成挑战,从而弱化受限动态追踪失效族;而若获得正向结果,则将为“规范相干性面临独立于实现质量的结构性压力”这一主张提供实证支持。
DBST-M1的详细说明见Packet 1:IMMB-NS + DBST→及对齐测量协议→。
参考文献
- 古德哈特,C. A. E.(1975)。货币政策管理问题:英国的经验。《货币经济学论文集》,澳大利亚储备银行。
- 索阿雷斯,N.,法伦斯坦,B.,尤德科夫斯基,E.,阿姆斯特朗,S.(2015)。可纠正性。《AAAI人工智能与伦理研讨会》。
- 克里斯蒂亚诺,P. F.,莱克,J.,布朗,T.,马尔蒂奇,M.,莱格,S.,阿莫迪,D.(2017)。基于人类偏好 的深度强化学习。《神经信息处理系统进展第30卷》。
- 克里斯蒂亚诺,P.,什莱格里斯,B.,阿莫迪,D.(2018)。通过放大弱专家来监督强学习者。arXiv:1810.08575。
- 欧文,G.,克里斯蒂亚诺,P.,阿莫迪,D.(2018)。基于辩论的 AI 安全。arXiv:1805.00899。
- 鲍曼,S. R. 等(2022)。衡量大型语言模型可扩展监督的进展。arXiv:2211.03540。
- 齐格勒,D. M.,斯蒂恩农,N.,吴,J.,布朗,T. B.,拉德福德,A.,阿莫迪,D.,克里斯蒂亚诺,P.,欧文,G.(2019)。基于人类偏好的语言模型微调。arXiv:1909.08593。
- 哈德菲尔德-梅内尔,D.,米利,S.,阿贝埃尔,P.,罗素,S.,德拉甘,A.(2017)。逆向奖励设计。《神经信息处理系统进展第30卷》。
- 赫宾格,E.,范·梅尔韦伊克,C.,米库利克,V.,斯卡尔塞,J.,加拉布兰特,S.(2019)。高级机器学习系统中由学习到的优化带来的风险。arXiv:1906.01820。
- 克拉科夫纳,V.,乌埃萨托,J.,米库利克,V.,拉茨,M.,埃弗里特,T.,库马尔,R.,肯顿,Z.,莱克,J.,莱格,S.(2020)。规范博弈:AI 创造力的另一面。DeepMind。
- 莱克,J.,马尔蒂奇,M.,克拉科夫纳,V.,奥尔特加,P. A.,埃弗里特,T.,勒弗朗克,A.,奥尔索,L.,莱格,S.(2017)。AI 安全网格世界。arXiv:1711.09883。
- 曼海姆,D.,加拉布兰特,S.(2019)。对古德哈特定律各种变体的分类。arXiv:1803.04585。
- 埃尔哈格,N. 等(2021)。面向Transformer电路的数学框架。《Transformer电路专题》。
- 奥尔松,C. 等(2022)。上下文学习与归纳头部。《Transformer电路专题》。
- 罗素,S.(2019)。《人类兼容:人工智能与控制难题》。维京出版社。
框架枢纽:对齐约束 →