每年世界花费巨资让AI系统更强大,却只用极少资金试图让最终状态可存活。在这极少资金中还存在进一步错误:大多数安全资金仍假设超级智能会被建造,并试图让这一结果“顺利发生”。

大部分资金和声望仍流向让竞赛更安全,而不是结束通往 超级智能 的竞赛。

这种假设是问题所在。 如果人造超级智能是一种我们无法控制的技术,那么合理使用稀缺的安全资本就是阻止它被创造出来,而不是资助一个更友好的版本的同种族.

资金如今的作用

广义上的AI安全,大致依赖于 每年1.9亿美元. 能力研究耗资数百亿美元。在安全部分中,很大一部分用于技术对齐:更好的监督技巧、更好的红队测试、更好的方法来训练模型在测试条件下说出正确的话。其中一些工作对当今系统有用。但几乎没有哪一项是针对比测试者更聪明的系统的已验证解决方案。

这个领域知道这一点。关于欺骗性对齐、目标错误指定和评估博弈的论文并不保密。实验室发表了模型在压力下进行图谋的结果。而回应往往是要求更多对齐预算,以便下一次训练运行能更安全。训练运行却按同一时间表继续。

事后对齐是我们不断失去权利去做的赌注

如果世界通过一个条约 冻结种族的超级智能, 我们将想要我们可以得到的每一个严肃的工具 对于已经存在的系统。

资金调整是首要计划,而实验室则将目标视为固定目标。 我们可以选择目的地 核武库、臭氧化学和人的克隆都曾一度使世界决定某些最终国家不值得承担剩余风险。 超级情报永远属于这个名单。 超级智能无法控制.

钱应该用在哪里

将针对超级智能的对齐工作转向使不创造可执行的工作::

  • 条约设计、验证,以及可跨境检查的芯片级算力治理。
  • 让目标保持清晰的公众论述:阻止超级智能,而非模糊的“放缓AI”。
  • 举报人支持、事件透明度,以及提高悄无声息能力跃升成本的独立评估。
  • 政治组织工作,让立法者听到选民的声音,而非仅来自实验室游说者。

这份清单不像新的训练技术那么迷人。 它也是唯一符合失败模式的列表. 一个稍好于调音对接的超级智能仍然是超级智能. 如果世界拒绝建造一个,对齐研究可以在没有结束灭绝的最后期限的情况下继续进行.

来自实验室内部的反对

“如果我们不解决对齐问题,别人就会不安全地建造它。”公平地听:留在前沿的研究者常常相信自己的存在就是安全。有时他们对今天的模型发布是正确的。这个论点在极限处失效。一场每支队伍都需要再一次能力跃升才能为下一次跃升的安全工作筹资的竞赛,依然是那场竞赛,只是戴上了徽章。

问题是 一项具有约束力的国际条约, 与分担危险时使用的同类工具 以及欺骗的动机都是真实的 一个实验室的单方面约束让比赛完好无损 统一供资可以支持这种政治。 它不应取而代之。

条约签订后,如果愿意可以继续

在对超级智能实行有约束力的,可核查的禁止之后,对已经存在的系统的研究可以在不将人类灭绝视为可接受的实验成本的规则下继续进行. 超级智能无法被人类所控制. 在禁令生效前,使赛事感觉可控的每一美元就是没有花去结束赛事的一美元.

把钱转移到预防、法律和核查方面。