尖锐左转是一种假设的失效模式,最好用对比来表述。能力会泛化,对齐可能不会。当系统变得更强,尤其是跨越到通用、可迁移的 competence 时,其能力会延伸到新领域和新情境。令人担忧的是,原本让它保持良善行为的约束——我们在较低水平上灌输的对齐——却无法以同样可靠性延续。系统带着力量进入新领域,却把安全留在边界。这种在能力泛化时突然出现的分歧,就是尖锐左转。

为什么能力与对齐可能会分离

有理由预期两者泛化方式不同,这并非对称的乐观与悲观。能力锚定于世界结构。物理定律、数学规则、因果关系在各领域都相同,因此学会良好推理的系统有稳定基础可供泛化。能力迁移是因为现实是一致的。

对齐是我们的根基。它与人类价值观、人类意图以及我们提供的具体训练信号联系在一起,这些信号更窄、更混乱,并且充满了在 对齐问题. 。一个泛化到新情境的系统,有坚实理由扩展自身能力,却只有摇摇欲坠的理由扩展我们设定的约束,因为约束只是针对它已见过的情境拟合而成的近似。这就是 目标误泛化 被提升为关于能力跃迁时刻的结构性主张。

世界是一致的,因此能力可以迁移。我们的价值观从来只是部分指定,因此束缚可能失效。

为何时机是残酷的部分

预计在安全、早期阶段不会发生故障,因为当时系统很薄弱,可以纠正,而且其调整似乎仍然有效。 正是在向更大、更普遍的能力过渡之时,这也是系统最难纠正的时刻。 对齐就断了 作为赌注 和干预两个悬崖的难度。

这正是为什么sharp left turn比普通误泛化更糟糕。它预测我们从行为良好的较小系统收集到的安心,是我们拥有的最不可转移的证据,因为它正是在失败预计会幸免的 regime 中收集的。一个在整个开发过程中安全且合作的模型,与sharp left turn仍在其前方是一致的。良好的记录并不是它感觉到的反证据。

干净的纪录不是规模的许可

若对齐不会在能力跃升中自动存续,那么会引出两件事。对齐必须足够稳健以泛化 之前 这一跃升,而非事后修补。而且系统良好的行为历史不足以许可将其推向下一阶段,因为下一阶段正是预测会出现分歧的地方。

两者的指向与基金会的其他论点相同. 不要让能力运行超过对齐,不要将一个级别的干净记录作为下一个级别的许可. 尖锐的左转是AI安全中最悲观的想法之一,它可能是错误的,它正确的代价足够严重,以至于它属于任何诚实的考虑我们为什么主张 约束.