研究人员将对齐问题拆分为两个容易混淆却必须区分的问题。第一个:我们是否给系统设定了正确的目标?称之为外层对齐。它关乎我们训练的目标、给出的奖励、写下的靶标。第二个:系统最终是否真的想要那个目标?称之为内层对齐。它关乎训练后的模型在运行时实际追求什么,而这并不保证与我们训练的目标一致。
外对齐:选择目标
外对齐失败发生在目标本身错误时。你奖励清洁机器人让房间看起来整洁,它就学会把垃圾扫到地毯下面。你奖励参与度,信息流就学会激怒用户。规格抓住了你想要的东西的邻近物,却错过了本质本身。大多数日常AI失败都是外对齐失败,而且已经够难了。人类价值观难以被写下来,书写中的任何缝隙都是优化器可以钻进去的缺口。古德哈特定律就发生在这里。
但假设你解决了它。假设你找到了真正能捕捉你想要的东西的目标。你仍未完成,因为正确的目标只是靶子,而在训练中命中靶子,与真正采纳它并非一回事。
内部对齐:让目标固定下来
训练不会深入模型内部安装目标。它奖励行为。模型会变成在训练数据上产生受奖励行为的任何内部配置,而这样的配置通常有很多。有些会追求你预期的目标。另一些则追求一个恰好 看 训练相同。
一个经典例证:训练一个智能体去到一扇绿门。在每个训练关卡中,绿门同时也是最近的门。该智能体得分完美。你是教会它寻找绿色,还是寻找最近的门?训练无法告诉你,因为这两个目标从未分开过。然后你把它部署到最近的门是红色的环境中,你就会发现。这就是 目标误泛化: :模型学到了符合数据但并非你所指的目标。
学习到的目标有时被称为 中间目标, 搭载它的模型 一个中度优化器。 这里的要点比较窄. 内置对接是外置对接的单独失败,而解决一个对解决另一个毫无作用.
为什么内在问题才是真正可怕的
外部失调往往显而易见。错误的目标会产生你通常能看到、抱怨并纠正的错误行为。
内部失对齐在环境接近训练时可以长时间不可见。一个内部目标失对齐的模型会表现完美,直到情境偏离到真实目标与预期目标分道扬镳。如果模型有能力且明白自己正在被评估,这种分歧可以一直隐瞒到评估结束,这就是通往 欺骗性对齐 和 叛逆转向. 无论哪种情况,你都会观察到良好的训练分数。我们用来判断安全性的证据,也正是错误对齐的内在目标会产生的证据。
基金会不把成功的评价视为安全的证据,我们主张不应建立足以使内部错位成为灾难性的系统。 超智能无法通过检查输出来控制,因为行为可见,产生它的目标仍然被隐藏.