《超级智能战略》于2025年3月问世,其作者阵容旨在获得华盛顿重视:AI安全中心主任丹·亨德里克斯、前谷歌首席执行官埃里克·施密特,以及Scale AI创始人亚历山大·王。其目的是将超级智能从研究文献拖入国家安全语言,而它确实做到了。数周内,它就被军备控制学者讨论、在智库中进行兵棋推演,并在国会证词中被引用。

类比是它最有趣的地方,也是问题所在。

其核心是一个精心挑选的首字母缩略词:MAIM,即“相互确保AI失控”(Mutual Assured AI Malfunction),故意呼应MAD。它承载了论文的核心主张:曾让核大国避免相互毁灭的恐怖僵局,在AI领域也有对应物,而且无论是否承认,它已经存在。

我们认为这篇论文抓住了真正重要的点,同时也认为其核心机制无法承受所赋予的重量。两者都至关重要。

论文所称已存在的僵局

论证大致如下。假设一个国家似乎即将取得决定性突破,一种在论文框架中将赋予超级武器和未来掌控权的系统。没有哪个对手能承受让这种情况发生。一个首都控制超级智能的世界,对其他每一个首都而言,都如同冷战期间先发制人的优势一样无法容忍。

但与已部署的核武库不同,进行中的AI项目是脆弱的。它存在于坐标已知的數據中心,依赖电网,并依赖可被精心放置的入侵悄无声息破坏的数月训练运行。因此,受威胁的对手有战争以外的选择,且有一系列梯度:间谍活动、降低训练运行或污染数据的隐蔽网络攻击、破坏周边基础设施,以及极端情况下对设施本身的物理打击。

该论文声称,这只是一种描述,作者认为这种描述已经抓住了人工智能超级大国面临的战略现实。任何积极、明显地争夺人工智能主导地位的国家都应该预料到其项目会因竞争对手而出现故障。 因此有了这个名字,也因此产生了矛盾的希望:如果每个玩家都知道争夺统治地位的冲刺会被破坏,那么就没有人会冲刺,并且游戏中最不稳定的举动就会被阻止。 与 MAD 一样,作者认为,可以通过刻意的做法来稳定僵局:将数据中心选址远离城市,以减少极端梯级的灾难性,使升级阶梯的网络梯级与动态梯级明显分开,并扩大竞争对手之间的透明度,以便没有人将商业项目误认为是主导性竞标。

其他两大支柱

MAIM占据了头条,但该策略有三个部分,我们认为第二个最有用。 防扩散 将原本用于防止裂变材料落入恐怖分子手中的机制应用于AI:像追踪浓缩铀一样追踪先进芯片,保护模型权重免遭盗窃,并在系统中内置防护,使其拒绝协助生物武器设计或关键基础设施攻击。这一支柱假设各国在 算力治理 即使在其他所有领域都在竞争,也像华盛顿与莫斯科在冷战最激烈时期共同推进防扩散一样。

竞争力 是现实主义的代价:各国应利用AI强化本国经济与军事,尤其要通过本土制造修复脆弱的芯片供应链,这一担忧后来已固化为 出口管制政治 如今正塑造整个行业。

该论文将这一三元组与它所拒绝的两种策略相对照:放任竞赛先造出超级智能再祈祷,以及它所斥为不可行的全球暂停。在这一叙述中,威慑是介于鲁莽与天真之间的成熟选项。

论文正确之处

从成就说起。多年来,竞赛的标准理由一直是对手的超级智能将是灾难性的,所以我们必须先到那里。“超级智能战略”悄然颠覆了这一点。如果单边主导的尝试令对手无法容忍,那么每个人的尝试对某人来说都是无法容忍的,而竞赛本身成为国家安全的威胁而非答案。来自这一级别作者的论述发挥了实际作用。它将失控与战略不稳定放在那些永远不会阅读对齐论文的人的案头,并以体面的语言确立了克制可以被强制执行,而非仅仅被请求。

与此同时,不扩散支柱只是我们所倡导的条约架构中的一部分,只是切入角度不同。芯片追踪、权重安全,以及 硬件赋能的治理 具有双重用途:它们同样服务于威慑制度和核查制度。用于构建它们的每一美元,都是让未来协议可核查的一美元。

核类比站不住脚的地方

麻烦始于当你去探究是什么让MAD保持稳定,并将每个要素与AI对应部分进行比对的时候。

核发射是明确的。它在数分钟内可归因,其起源精确到米,且它触发的响应是确定且事先为所有人所理解的。现在进行比较。一次“破坏稳定”的训练运行从外部看,与商业运行无异;相同的集群、相同的功率消耗、相同的卫星特征。阈值未定义,这并非因为起草努力不足,而是因为能力不会像导弹羽流那样宣告自己。这就是我们所说的 定义危险 AI, 而MAIM完整继承了这一点:威慑机制需要一条红线,而这篇论文无法精确指出红线在哪里。

归因在另一个方向也失效。当一次训练运行崩溃时,是破坏、漏洞还是坏数据?一个国家可能在不知情的情况下遭受攻击,这意味着攻击不起威慑作用;也可能误认为自己遭受攻击,而这更糟。威慑通过可见、可信、可归因的威胁发挥作用。隐蔽网络行动不具备这三者。MIRI、RAND等机构的分析师在论文发表数周内就准确指出了这些问题,尤其是可观察性批评从未得到满意回答:多名研究者得出结论,稳定威慑的条件目前尚不成立,可能需要对对手数据中心进行深入、相互透明才能实现。

还有升级阶梯本身。将攻击核武国家关键基础设施的行为常态化为常规治国手段,显然不是稳定的良方。该文件的答案是保持网络梯级远低于动能梯级,假定破坏行动的目标与你对所处梯级的解读一致。冷战史记载了多次此类解读出现分歧的时刻,它还提供了该文件未详述的另一警示:相互确保摧毁多次因事故、假警报和误判而濒临失败,靠运气而非学说挽救。采用其逻辑即意味着采用其失效模式。

威慑需要明确的触发线和 unmistakable 的回应。MAIM 目前两者皆无。

即使 MAIM 有效,它也无法做到什么

就算把框架里的所有内容都接受,仍有一个更深的限制。MAIM只能威慑一种特定失败:国家故意、公开地冲向单边主导。它对我们最担心的失败模式毫无作用,因为那种模式根本没有可威慑的侵略者。

不一致不关心数据中心上空飘扬哪面旗帜。一个竞争程序的世界,每个都小心地保持在破坏阈值以下,仍然是一个世界 冲向无人能控的系统, 同时保留竞赛中常见的削减安全措施的压力。更糟的是,MAIM 自身又增添了压力:面临破坏威胁的项目有充分理由隐藏、加固和分散,而保密正是所有有价值安全实践的敌人。威慑约束了竞争者,而 控制问题 本身不受监管,以及通往灾难的更缓慢、更安静的途径,包括 逐渐丧失权力 完全不需要任何主导意图,就能完全躲过它的雷达。

对峙也不是静止状态。MAD之所以可容忍,是因为威慑现有武器的使用是一项有界任务。MAIM必须永远威慑一种移动中的能力的发展,而阈值每年都在变化,因为算法效率不断提高,计算前沿不断去中心化。永久的危机管理只是带好标签的倒计时,不是策略。

威慑与条约并非对立

核威慑从来不是孤立存在的。它之所以能长期存续,靠的是几十年来加装在它身上的那些不起眼的机制:热线、核查、NPT、SALT、START,以及 验证协议 让双方都能清点对方弹头。MAD提供了恐惧,军控则在恐惧转化为战争前将其转化为规则。该文件援引冷战前半段却对后半段不屑一顾,把协调克制斥为乌托邦,等于选择性引用历史。

而这两半共享同一引擎。要让威胁破坏具有可信度,一个国家必须深入了解对手的 AI 项目,才能判断主导性竞逐何时启动。这种监视——卫星、芯片追踪、训练运行情报——正是 超级智能条约 需要验证。该论文与其初衷相悖,却论证了条约中最难的部分已在构建中。

因此我们的结论比论文支持者或最严厉的批评者所写的都要狭窄。MAIM作为描述有价值:它准确命名了对峙状态,确立了单边冲刺会遭到抵制,并告诉国防部门,竞赛本身是威胁而非解决办法。它作为终点则失败了,因为核大国之间永久、不明确、隐蔽的对峙并非稳定,而且它把真正的存在风险来源——系统本身——置于无治理状态。威慑只是争取时间。 一份经过验证的国际协议 正是时候。