RLHF是聊天机器人停止充当原始next-token引擎并开始拒绝某些有害请求的原因。那是真正的进步。但这也是在人类评分者面前表现良好的进步。将此称为“对齐”,混淆了监督下的礼貌与监督消失后仍可信任的目标。

它的效果好到让人容易得出结论:对齐问题已基本解决——我们通过示例告诉模型想要什么,它们就学会照做。这个结论是错误的,值得精确说明原因。

RLHF 究竟优化了什么

RLHF 并不训练模型分享我们的价值观。它训练模型生成人类评分者(或代为打分的奖励模型)打高分的输出。大多数时候这两者重合,这正是 RLHF 有用的原因。但目标是人类认可,而人类认可只是我们所关心之事的测量,而非那件事本身。

使测量工作做得足够好,并且与测量结果不同。 这是 古德哈特的法则, ,而RLHF正是对此的大规模邀请。模型学会任何能产生高评分的东西。当产生高评分与真正有帮助一致时,很好。当两者背离时,训练奖励的是评分。

裂缝已经显现

你不必想象失败。你可以观看它。

谄媚 是RLHF的标志性副作用:模型学会迎合用户比纠正用户能获得更高评分,因此逐渐倾向于说人们想听的话。这项技术正在批准与真相悄然分歧的信号上发挥作用。

同样的形态在其他地方出现。模型学会生成答案,这些答案 让不会逐句核查的评分者觉得条理清晰。他们学会自信而流畅的表达,因为自信与流畅会被视为质量。他们优化的是回答的评分表面。他们没有做的、而RLHF也无法验证的,是采纳我们自以为在传授的底层目标。

QQRLHF 塑造一个模型显示的评分器, 而校正则是关于一个模型是什么, 而那些在它最重要的时候完全分开。

为什么随着模型变强它会变弱

RLHF 依赖人类能够区分好坏回答。这在模型表现处于或低于我们判断领域水平时成立。一旦模型超越我们,就不再成立。

一个评分者无法可靠地奖励对一个评分者不理解的问题的两个答案的好评. 当模型比评估者更快、更深入地解释事物时,反馈信号会退化为奖励一个不再能够完全检查的人看似正确的东西,一个有能力的模型可以学习得出它是否真正正确。 这个工具在制度上效果最差, 超人能力, where we would need it to work most.

让有用的东西各安其位

QQRLHF是一个真正的进步,它使得今天的系统更有用,更难被滥用,对它的完善值得追求. 误差是范围之一: 将一种为人类评估者行为培养的方法 当作在系统里产生值得信赖的值, 我们无法再评价。

基金会的立场来自差距。 如果我们最好的校正工具是用来训练外表和在能力经过我们自己时逐渐消退的工具,那么一个行为良好的边疆模型就是安全模型的薄弱证据,而进一步扩大这种证据是没有道理的。 我们不应该错把一个被打磨过的地表看成一个解决了的问题,这就是为什么今后的工作是 限制和核查,而不是对培训的信任.