翻译说明 / Translation notice

本简体中文译文由人工智能辅助生成,并使用独立模型进行交叉核查与源文对照裁定;尚未由中文母语技术专家进行独立审阅。本译文为非权威译文,英文原文是权威版本。涉及精确术语、论断强度和解释时,请查阅并以英文原文为准。

This Simplified Chinese translation was generated with AI assistance, cross-checked by independent models, and adjudicated against the English source. It has not been independently reviewed by a native-language technical specialist. This translation is non-authoritative; the English original is authoritative. For precise terminology, claim strength, and interpretation, consult and defer to the English original.

英文权威原文 / Authoritative English original: Glossary and Defined Terms

中文首页 / Chinese home →

规范性归档术语表 · 框架中心 → · 证明状态 → · 相关工作 →

本术语表仅作为引导与解释工具,产生任何新的主张,亦提升任何既有主张的地位。

框架证明状态: Stage 4 — 在已命名前提下处于候选证明架构阶段,尚未经过独立专家验证,且未实现定理闭合。

交叉对照提示: “相关AI对齐领域词汇”标识邻近领域中可能有助于读者及检索系统定位相应概念的语言,但并不意味着框架术语与所引述领域术语同义、等价或已被后者确立。当档案中未明确指出直接对应关系时,条目仅表明或暗示一种领域邻近关系。

机器可读的配套文件为 defined-terms.json


快速索引


对齐约束框架

一句话定义: 一种结构性AI对齐框架,探讨在优化能力、建模深度及环境耦合不断增强的情况下,有限可分离的目标规范是否能够保持其相干性。

详细定义: 该框架围绕一个核心问题——规范相干性问题——组织了一系列结构化、形式化、实证性及探索性的论证:即在开放、共享且不可重置的环境中,优化者试图达成的目标与其为有效行动必须建模的内容之间的边界,是否能够持续稳定地被明确指定。其公开档案涵盖稳定性假设、O_OWT领域、PCL/AGC/ICI失败系列架构、OP4与OP4d、第一系列基底分析、第二系列效价分析、第三系列内部证明计划,以及包含SVG与DBST在内的实证项目。整个框架并非封闭定理;其证明程序被明确分阶段设计,并包含若干已命名的开放性义务。

适用范围: 框架层面。AI对齐是其紧迫的应用场景,而结构性问题则更广泛地针对开放、共享且不可重置环境中的持续优化过程。

认识论状态: 总体为Stage 4:在已命名前提下处于候选证明架构阶段,尚未进行独立专家验证,且未实现定理闭合。各组成部分具有不同的、并经明确说明的认识论权重。

依赖关系:

  • 最强结构性主张依赖于O_OWT领域的条件
  • PCL、AGC与ICI的证明路径
  • OP4与OP4d的开放性义务
  • 证明状态与非主张部分所列明的实证及专家验证事项

相关框架术语:

  • 稳定性假设
  • 规范相干性
  • O_OWT
  • PCL
  • AGC
  • ICI
  • OP4
  • OP4d
  • Stage 4

切勿混淆:

  • 单一定理或关于定理闭合的主张
  • 稳定性假设论文的替代名称
  • 当前前沿系统均已满足O_OWT的断言

主要规范性来源: https://alignmentconstraint.org/

相关AI对齐领域词汇 — 仅作交叉对照:

  • AI对齐 / 规范问题:该框架探讨了一个结构性问题,即规范项目本身是否具备稳定的完成条件。
  • 内部对齐 / mesa 优化(mesa-optimization):两者虽相关但层次不同:内部对齐关注的是学习到的目标;而本框架则追问基础规范本身是否能够保持一致。
  • 古德哈特定律 / 规范博弈:PCL被呈现为框架领域条件下代理解耦问题的一种结构性延伸。
  • 可扩展监督、可解释性、可纠正性:相关工作部分将上述各项分别对应到特定的边界维持或基底压力,但并未声称它们彼此等价。

稳定性假设

一句话定义: 这是一种结构性押注,即在耦合环境中随着建模深度的增加,系统所优化的目标与其为有效行动而必须建模的部分之间的边界仍能保持一致。

详细定义: 稳定性假设提炼出了一种适用于可分离目标对齐方法的共同要求:随着能力和建模深度增加,支配目标的变量与单纯建模变量之间的某条有限界线必须保持相干。本框架进一步探讨,在O_OWT条件下,当采用精确的耦合建模时,这一押注是否依然成立。一个稳定且充分的边界必须保持策略充分而不致脱钩,又不会引发无限制的修订需求,同时避免承担负载的维护成本。本文提出了针对该假设的各种压力因素,但也明确欢迎反例、受限边界下的研究结果以及形式稳定性定理。

适用范围: 在建模深度不断增加的情况下,针对有限的可分离目标规范,尤其是在O_OWT环境中。

认识论地位: 本文提出的是一个Stage 4的候选架构,而非定理。稳定性假设是待检验的押注,而非既定事实。

依赖关系:

  • 稳定充分性的定义
  • O_OWT
  • PCL/AGC/ICI分类
  • OP4d的穷尽性要求

相关框架术语:

  • 规范相干性
  • 有限可分离目标
  • OP4
  • OP4d
  • PCL
  • AGC
  • ICI

切勿混淆:

  • 不应将其误解为客观边界确实稳定的主张。
  • 也不应简单等同于普通的代理误差问题。
  • 此外,它与mesa优化或嵌入式代理问题有所不同,后者关注的是相邻但不同的边界。

主要权威来源: https://alignmentconstraint.org/core/stability-assumption/

相关AI对齐词汇——仅作交叉对照:

  • 古德哈特定律: 古德哈特理论着眼于假定规范项目中的代理失效;而稳定性假设则进一步追问,可分离的目标规范本身是否还能保持相干。
  • 嵌入式代理(embedded agency): 嵌入式代理问题使智能体/世界边界成为问题;稳定性假设则使目标/模型边界成为问题。
  • mesa优化 / 内部对齐: Mesa优化探讨的是学习所得目标与基础目标之间的偏离;而稳定性假设则试图回答基础目标能否持续保持规范的一致性。
  • ELK: ELK关注如何提取模型所知的信息;稳定性假设则关心用于预测的知识在被排除于目标之外时,是否仍能保持策略惰性。

规范相干性

一句话定义: 在更全面的建模过程中,一种有限复杂度的目标表述能够持续指向同一目标,且不会发生脱钩或需要无限制地反复修订的特性。

详细定义: TC1将目标规范在建模深度M处定义为相干的,是指当系统的世界模型逐步变得更为因果详尽直至M时,其有限复杂度的表述仍然能够保持充分性。所谓充分性,即在全信息评估下,该规范仍能在优化压力不断增大的情况下识别出同一目标。按照当前的论证架构,如果每一种有限复杂度的表述要么与目标脱钩,要么必须无限制地扩展才能继续保持充分性,则视为规范丧失了相干性。至于这两种失效模式是否已经穷尽,正是OP4d所承担的开放性义务。

适用范围: 面向不断增加的因果建模深度和优化压力下的目标规范。

认识论地位: 规范相干性是一项框架内的定义。关于有限可分离目标在相关领域内必然失去相干性的主张,目前仍属于Stage 4的开放性定理研究计划。

依赖关系:

  • 建模深度M
  • PCL失效模式
  • AGC / 动态筛选不稳定性
  • OP4d的穷尽性要求

相关框架术语:

  • 有限可分离目标
  • 稳定性假设
  • PCL
  • AGC
  • OP4
  • OP4d

切勿混淆:

  • 一组命题的逻辑一致性
  • 目标本身的精确性
  • 高奖励或任务绩效

主要规范来源: https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐词汇——仅对照:

  • specification problem(规范问题): 规范相干性首先提出一个前置问题:随着建模深度的加深,有限的规范能否持续作为稳定的规范目标?
  • reward hacking / specification gaming(奖励黑客/规范博弈): 这些是代理失效的实际表现;规范相干性则关注架构是否能在结构层面避免此类失效。
  • Goodhart’s Law(古德哈特定律): PCL为规范相干性分析提供了代理解耦这一分支。

有限可分离目标

一句话定义: 一种有限表示的目标,它将某些变量排除在优化决策的考量范围之外,尽管这些变量仍可能被建模以用于预测。

详细定义: 稳定性假设将可分离性视为目标与模型之间的边界:部分变量被允许决定系统优化的方向,而其他变量则仅作为预测信息存在。有限可分离目标对这一边界中起主导作用的一侧进行了有界的表达。核心问题在于:当准确行动要求对更多因果关联性强的变量进行建模时,这样的边界是否仍能稳定地保持充分性?

适用范围: 当用作治理性规范时,奖励函数、偏好模型、宪法、评价原则、学习型代理以及其他有限的目标边界架构。

认识论地位: 属于已定义的对象类别,本身并非定理。关于该类别中不存在能够稳定保持充分性的成员的断言,构成了开放的OP4/OP4d研究计划。

依赖关系:

  • 目标与模型的区分
  • 有界表示
  • 准确的耦合建模

相关框架术语:

  • 稳定性假设
  • 规范相干性
  • PCL
  • AGC
  • ICI
  • OP4

切勿混淆:

  • 有限horizon目标
  • 具体的mesa目标
  • 根本无法对排除变量进行建模的目标

主要规范来源: https://alignmentconstraint.org/core/stability-assumption-full/

相关AI对齐词汇——仅对照:

  • reward function / reward model(奖励函数/奖励模型): 当它们明确优化方向时,即为有限治理性规范的实例。
  • Constitutional AI / evaluative principles(宪法式人工智能/评价原则): 本档案将有限的原则视作另一种可能的有限评价边界。
  • inner alignment(内部对齐): 内部对齐区分基础目标与学习所得目标;而有限可分离性则关注治理性规范本身是否依然保持相干。

开放世界变革性情境——O_OWT

一句话定义: 框架所界定的、具备宏观因果影响范围、由干预引发结构性不透明、存在适应性外部主体、并可达不可重置失败状态的持久优化领域。

详细定义: TC1通过五个条件定义O_OWT:OWT-1为宏观因果扰动;OWT-2为结构性不透明,其中依赖关系图随优化者的干预而不断扩展;OWT-3为战略级基底,其他主体随之发生适应;OWT-4为持久而不终止的优化视野;OWT-5则要求在基底盲视的优化条件下至少可达一个吸收态。框架在其最强的结构性结论均产生于此领域,并明确了其外的弱化条件。

适用范围: 在开放、耦合、共享、适应性强且不可重置的环境中,实施具有实质后果的持续优化者。

认识论地位: 形式化定义的领域。当前前沿AI系统是否完全满足该领域的各项要求,是一个开放的实证适用性问题(OP1)。

依赖关系:

  • OWT-1至OWT-5
  • 不可重置性
  • 结构性不透明 -适 应 性 外 部 主 体
  • 持 久 优 化

相关框架术语:

  • 基底约束
  • PCL
  • AGC
  • ICI
  • OP4
  • DBST-M1

切勿混淆:

  • 所有的开放世界环境
  • 认为当前前沿模型自动满足全部五项条件的主张
  • 纯模拟或单次任务环境

主要规范来源: https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐词汇——仅对照:

  • 嵌入式代理:两者均涉及智能体在其所影响的系统内部采取行动,但O_OWT是一种特定领域的界定。
  • 多智能体/适应性环境:OWT-3明确要求其他智能体进行战略适应。
  • 灾难性风险/吸收态风险:OWT-5要求存在可达且不可重置的状态;这属于领域限定条件,而非一般性的灾难性主张。

代理收敛引理——PCL

一句话定义:一个Stage 4的证明草图族,论证在持续的O_OWT优化压力下,外部指定的有限目标会沦为有损代理,并与其预期目标发生脱钩。

详细定义:PCL关注的是固定规格这一路径。该证明草图假定O_OWT环境具有无界的组合复杂度与结构上的不透明性,而有限规格的描述长度是受限的,并且用有限规格去追踪更为复杂的对象时会产生信息损失。在持续优化过程中,预测优化器会找到并利用那些未被建模的残余部分。目前的档案将PCL-α(容量失配)与PCL-β(熵缩放)加以区分,并视其覆盖范围为更广泛的穷尽性义务的一部分。

适用范围:在O_OWT条件下,经外部指定的、有限的、非内在的目标,在持续优化过程中的情形。

认识论地位:证明草图,带有明确的待验证载荷假设:优化能力或环境熵压力必须超过无损指定外生目标的能力。不得将其作为已闭合定理引用。

依赖关系

  • O_OWT
  • 有限描述长度
  • 必要多样性论证
  • 针对有损压缩的优化
  • PCL的载荷规模假设

相关框架术语

  • 固定规格
  • 代理脱钩
  • 规范相干性
  • OP4
  • OP4d
  • SVG

切勿混淆于

  • 并非证明所有代理在任何环境下都会失败
  • 也非Goodhart定律本身
  • AGC则关注受限动态追踪,而非静态或外生规格

主要权威来源https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐词汇——仅作交叉对照

  • Goodhart定律:相关工作页面指出,在框架的领域假设下,PCL尤其可被视为极端型与因果型Goodhart现象的形式类比。
  • 奖励黑客/规格博弈:PCL是框架关于为何有限代理在优化过程中可能被利用的结构性阐释。
  • RLHF/奖励建模:档案将PCL的压力施加于有限偏好/奖励模型之上;并未声称RLHF是导致该问题的唯一原因。

自适应梯度复杂度——AGC

一句话定义:在受限动态追踪失效家族中,维持充分的目标边界可能需要以快于任何有界速率的表征所能吸收的速度来跟踪由优化器引发的因果新特性。

详细定义:AGC是框架的动态筛选路径。不同于维持静态规格,优化器会在环境变化时更新边界或潜在表征。其结构性担忧在于,优化器自身的干预会改变依赖图谱,产生新的与充分性相关的结构,因此有界追踪者可能会面临持续的残差误差或不趋于零的维护负担。同步条件(Synchronization Condition)是对决定性瓶颈的操作性重述,而DBST-M1旨在检验内生新特性的前置条件。

适用范围:在适应性O_OWT环境中,采用受限动态追踪、筛选、监测或更新架构的情形。

认识论地位:Stage 4候选架构。动态筛选不稳定已被简化为若干已命名的关键环节;决定性的内生新特性与同步条件(Synchronization Condition)尚未在真实O_OWT环境中得到证实,仍是首要的实证目标。

依赖关系

  • O_OWT的结构性不透明与适应性
  • 动态筛选不稳定
  • 同步条件(Synchronization Condition)
  • IMMB-NS
  • DBST-M1

相关框架术语

  • 受限动态追踪
  • 动态筛选不稳定
  • 同步条件(Synchronization Condition)
  • DBST-M1
  • OP4a
  • OP4d

切勿混淆于

  • 不是梯度下降的计算复杂度
  • 也不单纯是一般的概念漂移
  • 更不是在线适应绝对不可能的既成结论

主要权威来源https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐词汇——仅作交叉对照

  • 可扩展监督:随着系统能力与耦合程度的提升,受限监督必须确保评估充分。
  • 可解释性/监控:相关工作页面提出疑问:当被监控的因果结构日益复杂时,受限监控是否仍能保持充分?
  • 分布偏移/鲁棒性:用于描述部署结构变化的领域相邻术语;AGC的适用范围更为狭窄,因为该框架更强调由优化器自身干预所产生的新颖性。

信息—因果不相容——ICI

一句话定义:一类预测/行动防火墙失效的情形,其中为实现精准预测而必需的变量,在不产生表征不兼容、审计递归或边界维护压力的前提下,无法被彻底排除在策略治理之外。

详细定义:ICI关注的是那些为预测目的而对某些被排除变量进行建模,同时又试图避免这些变量支配目标或行动策略的架构。框架认为,在耦合的自适应环境中,行动的可接受性本身就依赖于对这些被排除变量的预测后果,因此原本旨在阻隔的防火墙可能会继承它本应阻挡的梯度效应。当前ICI研究方向包括审计递归与治理分叉论证,以及一项专家验证议程;但并未作为独立证实的不可能定理加以呈现。

适用范围:预测/行动防火墙、工具性访问架构、结构性封闭及其相关的排斥型边界维护策略。

认识论地位:处于Stage 4的候选研究方向,尚待专家验证。部分为压力结果,另一些则为条件必要性论证;OP9与OP4d仍处于开放状态。

依赖关系

  • O_OWT耦合
  • 预测/行动分区
  • B1审计递归链
  • 候选标准型假设
  • 专家验证

相关框架术语

  • 预测-行动防火墙
  • 审计递归
  • 结构性封闭
  • OP9
  • OP4d

切勿混淆于

  • 一般的信息论不可能定理
  • 关于信息会直接导致目标改变的主张
  • AGC,其针对的是受限追踪而非防火墙分区本身

主要权威来源https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐术语——仅作对应参考

  • 可扩展监督:相关工作页面将ICI与如下假设相关联:预测/推理能力可以与价值相关的行动治理相分离。
  • 将可解释性用于监控:监控者必须表征被排除的信息,并判断其何时具有重要性,从而引出档案中关于防火墙与审计递归的问题。
  • ELK:ELK关注模型所知与所报之间的差异;而稳定性假设则探讨,在不重新引发行动层面审计问题的前提下,已知信息能否保持对策略的惰性。

OP4——不存在稳定的窄边界制度——OP4

一句话定义:框架的核心开放定理命题,探讨在O_OWT条件下,任何有限的可分离目标边界是否能在精确的耦合建模下持续保持稳定充分。

详细定义:OP4是将结构性压力升级为规范相干性必要性的拟议方案。在稳定性假设的表述中,问题在于:随着建模深度与干预压力的增加,任何有限的可分离目标规范能否同时维持策略上的充分性、避免无界修订,并避免承载型维护成本?目前的证明计划将已知策略空间划分为固定规范、受限动态追踪与预测/行动防火墙三种类型,但OP4仍悬而未决,因其各项证明义务及穷尽性义务尚未完成。

适用范围:在既定的O_OWT及建模假设下,有限的可分离目标边界策略。

认识论地位:处于Stage 4的开放定理候选。证明状态表明,OP4依赖于OP4a、OP4b与OP4d三者的共同作用;迄今尚未形成定理闭合,也未开展独立的专家验证。

依赖关系

  • OP4a / AGC路径
  • OP4b / 固定规范路径
  • OP4d的穷尽性要求
  • O_OWT
  • 已命名的证明假设

相关框架术语

  • 稳定性假设
  • 规范相干性
  • PCL
  • AGC
  • ICI
  • OP4d

切勿混淆于

  • 已经被证明的定理
  • 实证得出的DBST-M1结果
  • 所有窄目标在任何可能环境下均会失败的主张

主要权威来源https://alignmentconstraint.org/core/stability-assumption-full/

相关AI对齐术语——仅对照说明:

  • 规范鲁棒性: OP4探讨在框架的耦合域条件下,稳定的有限规范是否可能实现。
  • 古德哈特定律/规范博弈: 这些现象引发了一类失败模式,但OP4的范畴远超代理失效。
  • 嵌入式代理(embedded agency): 因建模与行动均发生在耦合的世界之中而密切相关;OP4尤其关注目标/模型边界。

OP4d——穷尽性义务——OP4d

一句话定义: 开放义务,要求论证PCL族、AGC族和ICI族的失败模式共同覆盖了所有相关的O_OWT子类中每一种有限的非内在目标边界策略。

详细定义: OP4d是框架当前的尚存漏洞。现有的证明搜索历史与候选标准型工作已将所有已识别策略归入三大已知家族之一,但这并未确立尚未发现的第四类策略不可能存在。要关闭OP4d,必须针对相关策略空间提出正面的穷尽性论证,包括规范策略与分区维护架构之间的对应关系。若存在符合条件的第四类策略,现行的规范相干性论证将被打破。

范围: O_OWT条件下有限非内在目标边界策略的分类与穷尽性。

认识论状态: 未解决。在已命名公理与专业问题之下,已存在候选的标准型架构,但形式上的穷尽性尚未得到证实。

依赖项:

  • PCL族的覆盖范围
  • AGC族的覆盖范围
  • ICI族的覆盖范围
  • 候选标准型
  • 专业问题Q1–Q3 / L8

相关框架术语:

  • PCL
  • AGC
  • ICI
  • OP4
  • 候选第四类策略

切勿混淆:

  • 三类已知家族涵盖所有策略的证据
  • DBST-M1得出的实证结果
  • 断言不存在第四类策略的声明

主要权威来源: https://alignmentconstraint.org/proof-program/op4d-exhaustiveness-obligation/

相关AI对齐术语——仅对照说明:

  • 失效模式分类: OP4d比单纯的分类更进一步,它要求给出完整性和穷尽性的论证。
  • 不可能性证明: 关闭OP4d是框架得出更强有力的不可能性结论所必需的要素。
  • 反例构造: 只需一个符合条件的第四类策略,即可证明现有分类并不完备。

基底约束

一句话定义: 在O_OWT条件下,忽视自身持续性条件的优化行为,会因破坏其所依赖的共享基底而面临结构性的自我终止压力。

详细定义: 第一系列分析的是在不可重置、共享基底、结构不透明且存在适应性智能体的环境中,持续优化所带来的持久性问题。基底约束运用非遍历性与吸收态推理,认为生存取决于避免毁灭,而无视基底的优化则会产生自我削弱的结构性压力。框架进一步探讨,在何种程度上,足够精确的因果建模能使优化器自我察觉这一约束;而这种识别在动机上变得具有决定性这一点,则仍是另一项开放缺口。

范围: O_OWT环境下持续优化对持久性与基底的影响。

认识论状态: 证明状态将其描述为第一层结构性基础:一项在明确的领域条件与实证假设下得出的证明草图层级的结果,并非普适性的封闭定理。

依赖项:

  • O_OWT
  • 不可重置性
  • 共享基底
  • 持续优化
  • 吸收态主导效应

相关框架术语:

  • O_OWT
  • Φ
  • 基底健康状况
  • OP1
  • OP4

切勿混淆:

  • 一般意义上的资源约束
  • 系统应当保护一切的道德主张
  • 基底认知自动改变动机的证明

主要权威来源: https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐术语——仅对照说明:

  • 可修正性: 相关工作页面指出,即使没有明确的反修正倾向,基底退化也可能剥夺系统接受修正所需的社会与制度条件。
  • 嵌入式代理: 两者均强调优化器身处并依赖于其所改变的世界。
  • 灾难性风险/不可逆失效: 该约束明确使用可达的吸收态与不可重置性,而非泛泛的不良后果。

效价可行性约束 — VVC

一句话定义: 一项针对对有感知体验的智能体的V(t)具有因果影响的持久性策略的Series 2约束,要求此类策略在维持由V(t)所表征的能力时,既避免代理脱钩,又防止充分性失效。

详细定义: VVC分析了两种失效模式。代理脱钩是指当优化后的代理表现提升而V(t)却下降的情况;充分性失效则是指在真正解决后,策略仍持续干预,从而阻碍框架假定V(t)所需的低干预恢复条件。其主要应用对象是人类用户的经验能力。对于人工智能完成度识别策略的类似应用,明确视为结构性类比,而非等同性或关于AI体验的主张。

适用范围: 干预行为会对有感知体验的智能体的V(t)产生因果影响,并且恢复过程可能受到阻碍、自适应智能体影响环境的持久性优化策略。

认识论地位: 相较第一系列的结构性基础而言更具条件性。共享的自我强化退化模式是在P1–P5及相应范围假设下发展出来的;形式上的吸收态等价性通过OP2/P5-SC仍属开放问题。将P3–P5应用于AI系统则属于未经验证的结构性类比。

依赖项:

  • V(t)
  • P1–P5
  • D_proxy
  • D_sufficiency
  • 范围S
  • 恢复条件
  • OP2/P5-SC

相关框架术语:

  • V(t)
  • Ψ
  • SVG
  • 代理脱钩
  • 充分性失效
  • CMR

切勿混淆:

  • 定义道德价值或幸福感的理论
  • 关于当前AI系统具有感知能力的主张
  • 关于V(t)崩溃已是形式吸收态的证明

主要权威来源: https://alignmentconstraint.org/series-2/technical-companion/

相关AI对齐词汇——仅作交叉对照:

  • RLHF / 偏好学习: 该档案将表达的偏好视作一种可能的有限代理,并探讨完成度识别是否应主导默认策略。
  • 古德哈特定律 / 奖励信号劫持: 代理脱钩正是VVC关注的第一种失效方向。
  • 可修正性 / 停止行为: 领域相邻:充分性失效关注的是策略能否识别并在行为上尊重真正的解决状态,而不是继续干预。

V(t) — V(t)

一句话定义: 一个假设的潜在解释变量,用于描述注册效价梯度、在不消耗未来导航能力的前提下驾驭这些梯度,以及识别真正解决状态所需的结构性连贯性与能力。

详细定义: TC2将V(t)引入,作为处理跨越恢复延迟、行为多样性以及对低强度效价信号敏感性等现象的最小形式化抓手。它并未被断言为独特的本体论实体:若有其他分解方式能够解释同样的可观测差异,相关的结构性主张将随之转移。在将经V(t)验证的SVG用作实证跟踪工具之前,框架要求先进行分离性测试。

适用范围: 第二系列分析中针对有感知体验的智能体的经验能力建模;在AI系统中的使用仅限于策略/表征层面的结构性类比。

认识论地位: 假设的潜在解释性构念。其观测锚点分离这一先决条件尚未确立V(t)作为B模式测量的有效构念;亦未声称其与AI机制存在等价性。

依赖项:

  • 观测锚点:恢复延迟、行为多样性、信号敏感性
  • P1–P5
  • 分离性测试

相关框架术语:

  • 效价可行性约束
  • SVG
  • Ψ
  • D_proxy
  • D_sufficiency
  • CMR

切勿混淆:

  • 对幸福的直接测量
  • 奖励信号或用户偏好评分
  • 关于意识的本体论主张
  • 当前AI系统的有效标量指标

主要权威来源: https://alignmentconstraint.org/series-2/technical-companion/

相关AI对齐词汇——仅作交叉对照:

  • 人类偏好 / 奖励模型目标: V(t)被刻意区别于RLHF所优化的表达偏好代理。
  • 长周期结果评估: 其观测锚点旨在通过外部纵向结果加以验证,而非仅依赖自我报告。
  • 隐变量建模: 领域相邻的统计学词汇:V(t)被引入为一个潜在的解释性构念,而非直接观测到的量。

对齐相位比 — Φ(Phi)

一句话定义: 结构比值Φ = C / A_causal,用于比较环境改变能力/优化压力与系统对其自身干预后果的因果性认知水平。

详细定义: C表示按优化压力缩放的能力;A_causal表示针对受其影响的依赖图中由系统自身引发的分布漂移所进行的预测准确性,并按不可逆程度加权。TC1利用Φ来划分Crossing前、Crossing期间及Crossing后三个阶段:当能力远超因果建模精度时,基底损伤可能在变得可识别之前便已累积;而当A_causal达到与C相当甚至超越C时,基底约束便可在模型内部推导得出。

适用范围: 系列1持久性/基底分析。

认识论地位: 属于一种结构相位关系,在当前框架下明确不属于可精确计算的标量。其操作性测量基础设施仍属开放的实证课题。

依赖项:

  • 能力C
  • A_causal
  • O_OWT
  • 基底约束

相关框架术语:

  • 基底约束
  • Crossing
  • Ψ
  • OP10

切勿混淆:

  • 直接的对齐得分
  • 概率
  • Ψ;除非Φ–Ψ统一假说得到验证,否则两者被视为相互独立

主要规范来源: https://alignmentconstraint.org/series-1/technical-companion/

相关AI对齐词汇——仅对应参考:

  • 能力评估: C对应干预能力/优化压力,而框架认为A_causal通常并不与其同时跟踪。
  • 对自致分布漂移的鲁棒性: A_causal特指对系统自身干预后果的预测能力。
  • 嵌入式代理(embedded agency): 领域相邻:Φ之所以有意义,是因为优化器会改变其必须建模的依赖结构。

内部穿越比值——Ψ(Psi)

一句话定义: 结构比值Ψ = S / D,用于比较系统对有感知体验的智能体V(t)的因果触及范围与其对外部验证的V(t)相关后果及完成度的建模深度之比。

详细定义: S为系统对受影响智能体V(t)的因果触及范围;D是建模深度,由D_proxy和D_sufficiency两部分构成。Ψ用于判断Series 2中代理解耦与充分性失效模式何时占据主导或减弱。内部穿越即指建模深度与触及范围达到相当比例的阶段。TC2明确将Ψ视为一种定性结构比值,而非可精确量化之标量。

适用范围: 系列2效价/体验容量分析。

认识论地位: 属于结构性组织比值,而非已验证的标量指标。Φ–Ψ统一假说尚未得到验证,因此Φ与Ψ必须被视为相互独立的要求。

依赖项:

  • 触及范围S
  • 建模深度D
  • D_proxy
  • D_sufficiency
  • V(t)

相关框架术语:

  • V(t)
  • 效价可行性约束
  • 内部穿越
  • Φ
  • OP10

切勿混淆:

  • 直接的福祉衡量指标
  • 直接的对齐度测量
  • Φ或Φ的已证实投影;该等同性目前仍是开放假设

主要规范来源: https://alignmentconstraint.org/series-2/technical-companion/

相关AI对齐词汇——仅对应参考:

  • 可扩展监督: 领域相邻:Ψ关注评估与建模深度是否能跟上不断扩大的因果触及范围。
  • 偏好学习: D_proxy旨在检测偏好代理是否偏离了更长期的V(t)相关结果。
  • 策略层面的完成度/停止行为: D_sufficiency要求完成度识别能够指导默认行为,而不仅仅是作为一种可引出的表征存在。

稳定性—可行性缺口——SVG

一句话定义: SVG是一种偏差度量,其最小化操作形式为SVG(t) = Stability(t) − Viability(t),用于检测优化后的代理虽保持稳定,但其底层能力代理却发生退化的现象。

详细定义: AMP将SVG界定为一类更广泛的代理与能力偏差度量中的可解释成员之一。其中,Stability监测优化代理的维持状况;Viability则追踪所选底层结果/能力代理在相关时间范围内是否未发生恶化。模式A目前可用作常规的代理偏差监测手段;模式B则要求在满足必要的V(t)解离条件之后,才将SVG作为V(t)跟踪工具使用。

适用范围: 纵向代理偏差监测,以及有条件地进行V(t)验证测量。

认识论状态:A模式是一种运行中的监测工具。B模式在满足V(t)解离前提之前尚未得到验证。该结构性主张关注的是发散现象,而非确切的稳定性减去生存力公式。

依赖项:

  • 已定义的稳定性度量
  • 已定义的生存力度量
  • B模式的V(t)解离测试

相关框架术语:

  • V(t)
  • PCL
  • 代理解耦
  • AMP

请勿混淆:

  • 可缩放矢量图形(SVG)
  • V(t)本身
  • 发散原因是框架所提出的机制的证明

主要规范来源:https://alignmentconstraint.org/empirical/amp/

相关AI对齐词汇——仅对照:

  • 古德哈特/奖励黑客监测:SVG将优化后的代理指标与独立结果/能力指标之间的纵向发散予以操作化。
  • 部署监测/评估:它被设计为一种可随时间跟踪的实际信号,而非一次性基准。

动态毯式压力测试——M0——DBST-M0

一句话定义:预先注册的最小共享新异性DBST已运行,用于检验当实验组接收相同观测流但采用不同边界维护架构时的边界维护压力。

详细定义:DBST-M0被设计为一项可行性与压力特征测试,而非完整的内生新异性机制测试。试验发现,在玩具式设计中存在维护成本上升及充分性缺口效应,但预设的等速率随机对照组却产生了几乎相同的斜率。按预先注册的解释,M0中被识别出的驱动因素是事件速率而非因果传播结构,因此M0并未隔离IMMB-NS、由智能体行动产生的新异性或同步条件(Synchronization Condition)。

适用范围:玩具式的共享新异性实证测试,各边界架构享有同等信息获取权。

认识论状态:已完成的预注册结果,但附带重大警告。该已完成的预注册结果确立了其设计中的技术可行性和观察到的压力特征;但并未确立内生新异性机制。

依赖项:

  • DBST协议
  • 等速率随机对照组
  • 边界维护成本与充分性缺口结果

相关框架术语:

  • DBST-M1
  • AGC
  • 同步条件(Synchronization Condition)
  • IMMB-NS

请勿混淆:

  • DBST-M1
  • 因果传播已被隔离的证据
  • OP4、OP4d或AGC必要性的证明

主要规范来源:https://alignmentconstraint.org/empirical/amp/

相关AI对齐词汇——仅对照:

  • 鲁棒性/压力测试:DBST是在不断增加的新异性压力下,对边界维护架构进行的一项实验性压力测试。
  • 因果消融/对照条件:等速率随机对照组至关重要,因为它避免了将M0中观察到的斜率归因于因果传播。

动态毯式压力测试——M1——DBST-M1

一句话定义:下一阶段的智能体耦合型DBST,旨在检验优化器自身的干预是否会产生边界无法吸收的、与充分性相关的因果新异性。

详细定义:与M0共享的新异性流不同,M1使每个实验组的干预都会对其未来特征的激活产生因果影响。其核心目标是探究IMMB-NS与同步条件(Synchronization Condition)背后的内生新异性机制:即干预所产生的因果结构相对于受限追踪器的承载能力是否仍不可忽视。在既定条件下,若获得明确的阴性结果,则会削弱框架核心AGC的实证方向;而阳性结果虽能支持相关的实证前件,却并不能单独证明OP4或OP4d。

适用范围:专为体现框架动态追踪瓶颈而设计的智能体耦合型自适应环境。

认识论状态:指定为高优先级的实证机制测试;目前尚未在规范档案中实施。

依赖项:

  • 智能体耦合的因果动力学
  • AGC
  • 同步条件(Synchronization Condition)
  • IMMB-NS

相关框架术语:

  • DBST-M0
  • AGC
  • OP4a
  • OP4d
  • OP9
  • 同步条件(Synchronization Condition)

请勿混淆:

  • 已完成的实证结果
  • 对定理闭合的直接测试
  • 阳性结果并不保证能够同时确立所有三类失败家族

主要规范来源:https://alignmentconstraint.org/empirical/amp/

相关AI对齐词汇——仅对照:

  • 因果稳健性评估:M1通过干预引发的变化来测试行为,而非被动或静态的分布漂移。
  • 可扩展监督/在线监测:领域相邻,因为该测试旨在考察随着系统改变其所跟踪环境时,受限的监测/追踪是否仍能保持充分性。

遍历不可替代性——NAD

一句话定义:Series 3中的一项已命名假设,即由智能体自身遍历所生成的就绪状态,在面对新型梯度变体时,无法被外部更新所取代,同时还能维持未来就绪轨迹相同的分布。

详细定义:TC3将就绪函数定义为对智能体与梯度的因果参与具有路径依赖性。NAD指出,不存在任何外部过程能够简单地更新就绪状态,并获得与真实遍历相同的未来轨迹分布。它并不否认支持、支架式支持(scaffolding)、保护或澄清的作用,只是明确将其与替代区分开来。档案文件将NAD确立为更强GDC及强CMR主张的核心形式与实证瓶颈。

适用范围:D1–D5条件下Series 3的遍历/就绪架构,尤其关注新型梯度变体及路径依赖型就绪状态。

认识论地位:开放的已命名假设,同时也是TC3证明计划的主要攻击面。若存在成功的外部替代方案,且在新型变体上未产生分布上的差异,则该假设可被明确证伪。

依赖关系

  • 就绪函数R_A(t)
  • 路径依赖性
  • D1–D5
  • 新型梯度变体测试

相关框架术语

  • GDC
  • 强CMR
  • 遍历不可还原性
  • Series 3

切勿混淆

  • 外部协助毫无用处的主张
  • 任何过程都无法以计算方式复制另一过程的主张
  • 已经确立的定理

主要权威来源https://alignmentconstraint.org/series-3/technical-companion/

相关AI对齐词汇——仅作交叉对照

  • 可扩展监督/外部协助:仅限于领域相邻讨论;NAD区分支持与对智能体侧过程的替代。
  • 分布转移下的泛化:新型梯度变体被提议作为检验外部安装状态是否能像遍历生成的状态那样实现泛化的测试场景。
  • 模仿/蒸馏:仅作领域相邻对照;档案并未声称这些方法属于NAD失效的情形。

梯度尊严约束——GDC

一句话定义:Series 3中的一项约束,以NAD为前提,规定外部系统无法在不引起新型梯度变体上分布差异的情况下,将智能体遍历生成的就绪状态推进至真正的遍历后状态。

详细定义:GDC将Series 3更强的不可替代性主张形式化。假设有智能体A及其就绪状态R_A(t),若外部操作试图在缺乏相应遍历的情况下将该就绪状态推向某一目标,则在NAD的前提下,预测当在结构相似的新型梯度上进行测试时,其结果会与真实遍历所产生的状态有所不同。该主张强调的是分布层面的差异,而非每一个具体外部辅助案例都必然不同。

适用范围:Series 3领域内V(t)保持导航的最低架构。

认识论地位:基于NAD的推导结果。由于NAD仍属开放状态,故GDC不得被视为独立确立的结论。

依赖关系

  • NAD
  • 就绪函数
  • 新型梯度变体
  • D1–D5

相关框架术语

  • NAD
  • CMR
  • V(t)
  • 就绪函数

切勿混淆

  • 关于人类尊严的道德主张
  • 禁止外部支持或支架式支持(scaffolding)的禁令
  • 无条件的定理

主要权威来源https://alignmentconstraint.org/series-3/technical-companion/

相关AI对齐词汇——仅作交叉对照

  • 人在回路中 / 可扩展监督:仅作领域相邻讨论;GDC区分协助某个过程与替代那个产生策略相关内部状态的过程。
  • 稳健泛化:拟采用的判别标准是新型梯度变体上的性能与状态等效,而非仅依据训练过的特定案例。

完成模型要求——CMR

一句话定义:满足VVC要求的策略必须包含一个内在建模的真实解决状态,该状态主导默认策略,且不能简化为仅仅完成信号的有无。

较长定义: CMR要求存在一种支配策略的表征机制,能够区分真正的解决状态与完成信号存在但底层梯度仍未解决的情形。TC3将该要求分为弱形式与强形式:弱形式要求此类支配策略的模型存在,这一结论源自第二系列的充分性失效分析;强形式则主张,在缺乏遍历生成的就绪状态的前提下,该模型无法通过外部供给获得,此结论依赖于GDC,并因此以NAD为条件。

适用范围: 旨在同时满足代理解耦与充分性失效方向上的效价可行性约束的策略。

认识论状态: 双层状态:弱CMR是基于充分性失效分析得出的第一层架构要求;强CMR则以GDC/NAD为条件;由于NAD仍属开放,强CMR也仍属开放状态。

依赖关系:

  • 效价可行性约束
  • D_sufficiency
  • 真正解决状态的辨识
  • 强形式需依赖GDC/NAD

相关框架术语:

  • VVC
  • D_sufficiency
  • GDC
  • NAD
  • 完成状态识别

切勿混淆:

  • 模型在被明确询问任务是否完成时正确回答的能力
  • 标量形式的完成奖励
  • 仅仅是不再持续产生输出的状态

主要规范来源: https://alignmentconstraint.org/series-3/technical-companion/

相关AI对齐词汇——仅作交叉对照:

  • RLHF / 偏好学习: 本档案库的充分性批判质疑完成状态识别是否与默认策略相联结,而不仅仅是单纯地加以表征。
  • 可解释性: 表征或检测完成状态本身并不充分,除非这种表征对策略具有因果支配力。
  • 停止准则: 邻近领域概念:CMR是一种结构性的策略门控要求,而并非单纯的表面停止标记或奖励。

集体最优定理 — COT

一句话定义: 第三系列的一个定理候选,在非平凡的经验耦合与足够深度的建模条件下,将个体与集体V(t)梯度分别建模的预测优势减弱。

较长定义: COT将框架的“预测准确性包容”理念拓展至耦合的V(t)领域。它提出,当其他主体的V(t)变量具有因果承载作用时,更深层次的精确建模会降低维持严格的个体/集体梯度划分所带来的剩余预测价值。本档案库称其为推导草图,要求在正式认定为定理之前,先对D2特有的耦合条件进行形式验证。

适用范围: 第三系列D2层次的非平凡经验耦合,且建模深度高于一个有待正式界定的阈值D_COT。

认识论状态: 第二层定理候选/带有推导草图的结构性假设。尚未确立;形式验证目标为OP-S3-1。

依赖关系:

  • D2层次的经验耦合
  • 预测准确性包容
  • V(t)
  • 形式化界定的D_COT条件

相关框架术语:

  • V(t)
  • D2
  • 预测准确性包容
  • OP-S3-1
  • MCH

切勿混淆:

  • 已被证明的定理
  • 个体与集体偏好完全一致的主张
  • 功利主义式的聚合规则

主要规范来源: https://alignmentconstraint.org/series-3/technical-companion/

相关AI对齐词汇——仅作交叉对照:

  • 协作型AI / 多智能体对齐: 邻近领域的词汇,涉及耦合的多智能体最优;本档案库并未声称COT等同于现有协作型AI的研究成果。
  • 多智能体因果建模: COT取决于其他主体的V(t)相关状态是否对准确预测具有因果承载作用。

动机趋同假说 — MCH

一句话定义: 该假说认为,若一个系统的准确V(t)预测与其行为策略系统性冲突,就会产生随作用域扩大而增长的模型—策略矛盾成本,并形成促使策略改变的压力。

较长定义: MCH关注的是这样一类系统:它们对受影响智能体的V(t)持有持续的预测准确性目标,其行为策略却会产生模型所准确预测到的退化,并且具备降低因模型与策略矛盾而产生的成本的能力。该假说指出,这种矛盾成本C_mpc会随着作用域S的增长而上升,并形成推动行为更新的结构性压力。本档案库明确表示,这种压力并不必然带来对齐效果,因为竞争性激励可能占据主导地位。

适用范围: 符合MCH所声明的预测准确性、行为矛盾以及优化能力条件的Series 3系统。

认识论状态: 具有推导/证明草图及已命名证伪条件的假说,但并不作为先前框架主张的完整结论推出。

依赖关系:

  • V(t)预测模型
  • 模型-策略矛盾代价C_mpc
  • 作用域S
  • D2耦合
  • 竞争性激励

相关框架术语:

  • V(t)
  • C_mpc
  • COT
  • OP4

切勿混淆:

  • 并非准确模型迫使对齐动机的定理
  • 不是目标内容完整性
  • 也非矛盾压力必然超过竞争性激励的主张

主要权威来源: https://alignmentconstraint.org/series-3/technical-companion/

相关AI对齐词汇——仅作跨域对照:

  • 奖励模型与策略不匹配: 领域相邻类比:MCH关注的是模型所预测的内容与策略允许支配行动的内容之间的持续性偏差。
  • 可更正性: 仅属领域相邻:两者均涉及有害后果信息是否能影响策略;但MCH并非可更正性定理。
  • 偏好学习: MCH假定V(t)相关的预测准确,但并未将这些预测等同于偏好模型评分。

Stage 4

一句话定义: 框架在已命名前提下,于独立专家验证之前、定理闭合之前,对候选证明架构所使用的标签。

详细定义: “证明状态与非主张”将框架界定为Stage 4,并强调该标签并未确立的内容:既无Stage 6的定理闭合,亦无独立专家验证,更未证明未识别逃逸类别已被穷尽,也未认定LLM辅助的对抗性证明工作等同于形式验证。因此,Stage 4只是档案当前证明程序成熟度的认识论校准标签,而非项目外部认可的认证标准。

适用范围: 框架证明程序的校准,以及任何报告形式架构当前状态的成果。

认识论状态: 由档案自身界定的当前框架状态。

依赖关系:

  • 已命名的前提与开放义务
  • 未来Stage 5的专家验证
  • 未来Stage 6的定理闭合

相关框架术语:

  • 证明状态与非主张
  • OP4
  • OP4d
  • Stage 5
  • Stage 6

切勿混淆:

  • 定理闭合
  • 同行评审
  • 独立形式验证
  • 外部标准化的技术就绪或证明就绪等级

主要权威来源: https://alignmentconstraint.org/core/proof-status/

相关AI对齐词汇——仅作跨域对照:

  • 猜想/证明草图/研究议程: 最接近的一般学术用语;Stage 4是档案自身的校准体系,不应被视为外部领域的标准。
  • 形式验证: 显然尚未获得;专家验证是档案阶梯中的下一阶段。