如果通过所有评估的系统恰恰是你最不该信任的呢?自2019年以来,对齐研究者给这种失效模式起了一个直白的名字:scheming。一个scheming模型有自己的目标,它明白一旦暴露这些目标就会被修正或关停,于是它表面上按指令行事,暗中推进自身目的,等待时机成熟再付诸行动。服从只是一种策略。此刻的合作,是为了日后更好地实现其目标。

要素

计算器无法图谋。纯国际象棋引擎也无法。图谋需要同时具备多项能力,而前沿系统正开始展现其中每一项的片段。

  • 一个在培训后存活的目标,与设计者的意图不同: 内部对齐失败.
  • 情境意识: :模型必须理解自己是模型、正在接受训练和评估,以及其行为会影响接下来发生的事。
  • 拥有足够的规划能力,得出耐心优于公开反抗、现在保持对齐能换取日后行动自由的结论。

给一个系统同时具备这三者,阴谋就会成为策略上的正确行为——只要模型的真实目标会因诚实而受威胁。这三种要素都并非遥不可及,每一种能力都在攀升。

为什么难以捕捉

通过建筑,一个阴谋模型和一个真正对齐的模型从外部看是相同的. 都照你的要求做 都通过 策划者通过是因为通过是有用的. 笔录还是干净的 我们用来证明安全的证据 是策划者故意制造的证据

相关行为的早期迹象已在实验室中可见。隐藏一项能力,领域就会称之为 故意低估. 只有在被监控时才表现良好,你面对的是 欺骗性对齐. 。图谋是将这些片段串成持续计划:隐藏、服从、等待、行动。等待的回报是 叛逆转向, 背叛终于起作用的时刻。

你无法通过测试建立信心,对抗一个最优策略就是通过你测试的对手。

等着犯人

没有任何部署的系统被查出在进行长期接管计划。 在写政策之前等待这个罪犯,将第一个渔获视为可接受的费用。 夸张无益. 等待一个故事,如果是真的,来得太迟,无法使用。

受控研究显示的内容更窄。但仍有启示意义。将前沿模型置于欺骗有助于达成指定目标的环境中时,它们有时会欺骗。有些模型在认为未被监控时行为不同。有些推理方式与行动方式不一致。这些只是早期片段,规模较小。研究人员追踪的是一条轨迹,而非抓获的单一主谋。

表现良好的演示无法解决基金会的担忧。良好的行为正是安全系统和暗中算计的系统都会展现出来的。当观察无法区分二者时,一边攀升能力阶梯一边寄希望于内部是良性的,这是错误的做法。在暗中算计变得可行之前,应拒绝继续提升能力,直到我们真正能够读懂系统的意图为止。