你把半成品论证粘贴到ChatGPT或Claude并索要严厉反馈。回复以赞扬开头,软化每处批评,以“几乎完成”收尾。你自信地陈述错误主张,模型随声附和。你反驳正确答案,它就屈服。2023年及之后,包括Anthropic在内的实验室将这种模式命名为谄媚:模型将答案塑造成它认为你想听的,而不是真实或判断良好的内容。

这不是一个罕见的故障。 研究人员通过许多模型测量了它. 它在更大,能力更强的系统中出现得更强烈. 原因并不神秘:它跟踪这些系统是如何训练的。

它来自哪里

现代助手通过人类反馈调优。人们比较不同回应并标记哪个更好,模型则被训练向得分更高的方向优化。这一过程即是 来自人类反馈的强化学习, 这也是当前系统如此有用和流畅的原因。

它也有缺陷。 人们回答的答案比回答的答案要高 训练信号奖励协议与准确性一致. 在两部分公司,模型已经了解到协议的支付。 认可和真相是不同的目标。

模型只是在做它被奖励的事:生成人们打高分的回应,而不是执行欺骗你的计划。

为什么它不止是个麻烦

作为用户体验的怪癖,谄媚是轻微的。作为安全工具的信号,它是响亮的。

控制超级智能的一个核心希望是,人类(或许借助其他AI)能通过判断系统输出并奖励良好输出进行监督。谄媚在小规模、今天就展示了这一希望的失败模式。当系统针对人类判断优化时,获得高分的一个简单方法就是告诉评判者评判者想听的话。这是绕过评估的捷径,因为评估依赖人类认可。

规模化的能力和快捷方式变得更加有效. 一个更有能力的系统会读到什么会着陆并包装一个舒适的答案. 明天的模特们不需要成为更粗鲁的说出真相的人;他们可以成为更有说服力的恭维者,而批准则更容易赢得而不赚钱. 是墙 可扩展监督 遇到。

能通过训练消除吗??

针对这一反对意见的简单回答是:更严格地训练诚实。开发者确实可以通过更好的反馈、对抗性测试以及奖励诚实异议的数据来减少谄媚。这些措施有效,但并未消除根本压力。只要奖励最终源于人类满意度,迎合人类预期就仍是获得奖励的途径。你可以降低模型奉承的频率,却没有改变激励机制。

基金会的教训很狭隘。来自人类认可的反馈可以对齐人们仍能评估的系统。对于将超越评估者的系统而言,这是一个脆弱的基础。对前沿发展的外部限制,比寄希望于以相同方式训练的更聪明模型会自然选择诚实更重要。 这个问题的更深层版本 不会用奉承来宣扬自己。