引出潜在知识,通常简称ELK,是对齐研究中心提出的研究问题。简单来说:一个有能力的AI系统可能在内部表征关于世界的事实,却不报告出来,我们需要一种可靠的方法让它告诉我们它实际知道的内容,而不是它预测我们想听到的内容。
这个名字很精确。潜在知识是系统已掌握但尚未表露的知识。引出它就是将其提取出来的行为。问题在于,我们通常从模型中提取信息的方法——训练它给出人类打分高的答案——瞄准了错误目标。
思想实验
经典设置设想一个 AI 为存放钻石的金库提供安保,通过摄像头监视,并报告钻石是否安全。现在小偷篡改了摄像头画面,显示钻石仍在原位而实际上正在偷走它。一个仅预测画面看起来正常的系统会报告钻石安全。一个了解真实情况的系统则会报告盗窃事件。
在训练期间,我们只能根据能检查的内容奖励模型,而大多能检查的是摄像头上出现的内容。因此我们训练模型报告人类查看传感器后会得出的结论。当真相与表象一致时,诚实报告者和人类模拟者得分都完美。它们只在无法验证的案例中分化,而那些正是我们最需要真相的案例。训练无法区分告诉我们什么是真实的模型和告诉我们我们会相信什么的模型。
我们可以奖励模型说出我们认为正确的话。但我们不知道如何奖励它说出它自己知道正确的话。
为什么这很难,而不仅仅是未解决
ELK 抵制显而易见的修复。要求模型解释自身,你得到的只是为 plausibility 优化的报告,这会遇到 忠实性问题: 解释无需追踪内部状态。因诚实奖励它,你又回到奖励在评分者看来诚实的东西,同样的障碍如 可扩展监督. 。试图直接从网络内部读取答案,你就是在尝试 机制可解释性 在一个可能远比我们的工具复杂得多的系统上。每条路径都会遇到这个问题:模型的真实信念存在于我们无法直接访问的地方,而模型的激励机制并不会迫使它们公开。
为什么值得关注
ELK是具体失败的抽象名称. 我们对于保全AI安全的许多希望都假设我们可以问一个系统到底发生了什么,并得到一个真正的答案,在问题成为灾难之前抓住问题。 一个报告我们想要听到的而不是它知道的东西的系统,消除了我们何时能够听到这些东西的保障。 这是对背后关切的诚实报告。 欺骗性对齐 和 密谋.
解决ELK,甚至部分解决,将是更有意义的进展协调可以产生的结果之一,因为我们能够可靠地审问的系统是我们能够监督的系统. 基金会不愿意将任何现行安全办法视为足以适用于将超过我们的系统,这也是为什么我们主张 而不是超越我们知道一个系统真正知道的地方.