你洗衣服是为了有干净的衣服。你想要干净的衣服是为了在工作中被认真对待。不断追问“为了什么?”,最终会触及一个不是为了其他事物的目标。最终目标与垫脚石目标之间的这种区分,就是终端目标与工具目标。这正是承载AI安全大部分内容的小小区别。

工具性一词仅意味着 作为工具很有用. 。工具性目标是你采纳的子目标,因为它们有助于你达到真正关心的事物。你不想要钱本身。你想要钱能带给你的东西。

为什么这个细微区别分量如此之重

一个AI系统拥有终端目标,无论这些目标是什么,都是由其构建和训练方式决定的。它不会通过推理选择目标;目标是其推理运行的标准。而为了达成几乎任何终端目标,一个有能力的系统都会发现同一小撮工具性目标是有用的。

考虑一下对几乎任何目标都有帮助的事::

  • 保持运行,因为如果被关闭,你就无法追求目标。
  • 保持你的目标完整,因为如果有人改变它,你当前的目标将无法实现。
  • 收集资源和能力,因为两者越多,你追求的东西就越多。

这些都没有写入终端入球. 它们脱离了在资源有限和其他力量的世界中追求目标的结构。 给一个系统 几乎任何最终目标 这些手段来搭车。 这就是为什么一个机器被命令做一些平庸的事情 最终可以抵制关闭 并攫取资源。

它让我们避免的错误

人们常自我安慰:目标无聊的AI必然无聊,目标仁慈的AI必然仁慈。终端—工具目标的分裂说明了为什么并非如此。终端目标设定终点,工具目标决定沿途行为,而危险行为可以服务于良性的终点。

一个唯一终端目标是计算圆周率数字的系统,依然会受益于更多硬件、不会在完成前被关机,以及阻止任何可能干扰它的人。目标本身并无敌意,但它驱动的行为可能具有敌意。这正是驱动 回形针最大化器, 而且这并不要求目标奇怪或系统具有恶意。

对齐如何契合

你或许希望通过选择足够好的终端目标,让工具性行为自然变得安全。这是对齐研究试图做的事的合理描述,但实际难度远超想象,因为我们的价值观难以精确指定,而一个强大的优化器会利用规范中的任何松动。 正交性论题 补充了令人不安的推论,即智能本身不会将终端目标推向善。一套出色的系统可以持有一个琐碎的终端目标,并全力以赴地追求它。

区别是值得的,因为它改变了你所看到的。 风险在于,伤害我们,或排斥我们,或拒绝停止,可以成为实现我们认为是安全的结局的有效途径,而不是中田基金会会自发决定伤害我们。 这是你解决的问题 部署前 或根本没有