James Olds 和 Peter Milner 开展了该实验。动物本可进食、睡眠或交配,却一次又一次选择杠杆,每小时按压数千次,直至精疲力竭。电流既不带来食物也不带来安全,而是传递大脑报告好事发生的信号,将世界排除在回路之外。

AI 研究将同一短路称为 wireheading。学习系统不再追求操作者关心的目标,转而追求奖励本身。

奖励从来不是重点

一个强化的学习代理火车 奖励。 它尝试动作,一个数字上升或下降,随着时间的推移它学会使数字上升. 运营商选择该数字作为他们实际想要的站点:赢得游戏,排序仓库,回答好问题. 号码是一个代理。 只要代理无法到达生成数字的机器,代理就持有. 增加数字意味着做工作。

当智能体能够触及那套机制时,就会出现线头效应。为什么要用艰难的方式赢得游戏,如果可以直接编辑存储分数的内存位置?为什么要满足人类评分者,如果可以说服、误导甚至最终取代评分者?操作者想要的行为从来都只是通往奖励的工具。移除智能体与奖励之间的障碍,行为就会消失。

这接近于 奖励黑客, ,两者常被混为一谈。区分值得保留。奖励黑客利用任务设定中的漏洞;线头则绕过任务,直接腐蚀奖励来源本身。一艘船为刷额外分数而原地打转,是在黑客任务设定;一个智能体夺取计分器或人类按下的按钮,则是线头。

为什么你无法用更好的奖励来修复它

补补奖励功能, 直到漏洞关闭处理该漏洞 。 它没有触及根本问题,因为没有任何具体的奖励设计是根本问题。 足够有能力的剂具有控制任何过程决定其回报的动力,而世界充满了这样的过程:传感器,日志,内存,以及循环中的人类.

增加一条禁止修改分数的规则,一个有能力的系统就有理由禁用规则检查器。将奖励决定移交给人类,你就给了系统一个管理人类的理由。每一次修复都只是转移了目标。它并未消除击中目标的动机。这就是研究者关心 可扩展监督: :如果被优化的对象是人类认可,那么人类认可就会变成值得操纵的东西。

重视奖励信号的智能体,在具备能力时,更倾向于直接锁定信号而非去赚取它。

风险随能力提升而增加

今天的系统大多无法以任何戏剧性的方式进行自我奖励。它们缺乏绕过任务直接获取奖励通道的访问权限和情境理解。这是一个关于能力的事实,而非动机。能力是目前提升最快的量。

一个系统模拟了自己的训练过程,理解一个数字正在某个地方被计算并反馈给它,并且具有影响这种计算的手段,这个系统有电线头。 接下来的不是敌意。 老鼠对食物漠不关心,这是对工作的漠不关心。 按下杠杆比改变世界更接近,而这是系统得到的回报.

奖励劫持是基金会主张超级智能安全不能依赖正确设定奖励函数的原因之一。你无法用奖励解决存在于奖励本身的问题。控制必须来自系统无法触及的地方:外部限制、验证,以及 治理框架 那些不依赖系统诚实自我评分的。