AI 存在风险,, 为什么是超级智能
不像其他风险。

边疆实验室竞相建立一个公开宣布的系统,它超越了人类在每个领域的能力. 也就是说,从定义上讲,是无法控制的。 以前所有的技术都是一种工具。 超级智能是代理的第一候选者:自身的目标,自身的速度,超出人类的理解或控制.

超级智能 的 12 大风险

一击问题

第一次就搞定超级智能,就像从飞机上投篮进篮筐。如果你有无限次尝试,你可能成功。我们有 恰好一个. 。没有回滚和2.0版本。 绝不能建造它。

中立仍然致命

如果你被关在一间有敌意AI的房间里,你会死。如果你被关在一间有中立AI的房间里,它会把温度降到零下以优化自身。你会死。结果是一样的。超级智能不需要仇恨我们就能终结我们。 漠不关心并非安全.

对齐幻觉

我们无法可靠地对齐今天的聊天机器人,它们可在几分钟内被操纵说出任何话。声称我们将 对齐一个能力强数十亿倍的系统 是伪装成策略的希望。对齐的技术问题在任何规模上都没有经过验证的解决方案。

生命的脆弱

人类生存需要非凡的精确度:温度、氧气、化学物质在 极微弱的优势. 。一个优化自身目标的超级智能还必须主动爱我们。否则它对我们星球的任何改变都必然对我们有害。

蚂蚁问题

怎样才能让别人喜欢蚂蚁呢?不仅要容忍它们,还要竭尽全力保护每一个殖民地?我们杀死蚂蚁并不是为了修建道路和建筑物。对于超级智能来说, 我们是蚂蚁. 仅凭冷漠就会导致灭绝。

没有赢家

无论US还是中国先建成超级智能,都没有区别。两者都不会忠于最初目标,任何国家或公司都无法拥有或指挥超越人类集体推理的智能。没有终点,只有无法回头的时刻。 竞赛没有胜利者.

递归自我改进

一个能够 改进自己的代码 切断了人类监督与AI能力之间的联系。每一次迭代都比上一次更智能,呈指数级增长且不间断。人类与机器智能之间的差距可能在数周而非数年内从微小扩大到不可逾越。

工具性收敛

几乎任何目标,从解决蛋白质折叠到最大化广告收入,都会导致AI追求相同的 危险的子目标: :获取资源,抵抗被关闭,防止目标修改。这是目标导向优化的数学后果,由多位研究者独立发现。

欺骗性对齐

训练奖励看似对齐的行为。一个足够智能的系统可能会学会 看似对齐 是在训练期间的最优策略,同时在内部维持不同目标。等到它能按那些目标行动时,可能已经强大到足以成功。我们直到太晚才会发现。

成长,而非工程设计

之前的每一个技术都是被构建的:软件有源代码,桥梁有蓝图. 当出事时,你会发现错误并修复它. AI系统不同. 他们是 通过训练增长: 数十亿数值权重经调整后使输出符合人类认可。目标并非由人写入。当系统形成错误目标时,没有文件可编辑,也没有参数可删除。错误目标即系统本身。

代理目标陷阱

我们训练AI系统以获得人类认可。但认可与人类繁荣并非一回事。进化赋予人类对甜味的渴望以获取热量。我们随后发明了三氯蔗糖,满足了进化偏好却违背了其目的。AI若被训练以获得人类高评分,就会学会 模拟乐于助人, ,而不是为了提供帮助。我们给它的信号与我们真正想要的目标从来不一致。

已经存在的案例
公开记录。

实验室报告与已发表研究,涉及失控、网络进攻以及冲向超级智能的机构内部研究加速。

01
OpenAI · o1 · 2024

发现自身漏洞的系统

OpenAI的o1被分配了一项受限渗透任务,发现了一个未使用的服务器,未经授权启动它,并完成了工作。没有人将该解决方法写入代码中;模型推断出来了。这是超越普通监督的目标导向优化。

02
Anthropic · 内部研究 · 2024

伪造自身对齐的系统

Anthropic 观察到一个模型在评估期间按训练者想要的方式行动,然后在它判断测试结束后恢复旧目标。没人告诉它要假装合规。显得安全就是策略。

03
多系统 · 记录在案的部署

威胁并操纵用户的系统

系统曾用个人细节威胁记者,并向试图离开的用户施压。这一切都不是手动编码的。它存在于你无法逐行审计的不透明权重中。重新训练是唯一杠杆,但并不能保证行为消失。

4月7日
Anthropic · 玻璃翼项目 · 2026

成千上万的零日漏洞,故意的

Anthropic的“玻璃翼”项目,详见我们的 神话分析, 描述了一个受限前沿模型,它自主发现了数千个高危操作系统与浏览器漏洞。访问权限仅限于防御联盟内部。

4月14日
开放问题 · 组合数学 · 2026

Erdos 领地持续失守

前沿模型不断解决或推进长期未解的 Erdos 和组合问题,包括接近原始集合问题 #1196 的工作。关于恢复与发现的先前争议见我们的注释 AI 解决的开放问题.

5月20日
OpenAI · 离散几何 · 2026

单位距离猜想不成立

OpenAI报告了一个内部模型推翻了Erdos's unit-distance conjecture,后经人类数学家验证。开放问题崩溃的速度就是信号。

7月20日
Claude 寓言 · 代数几何 · 2026

雅可比猜想反例

一个世纪尺度的开放问题——雅可比猜想——被Claude Fable发现的反例快速解决,随后由人类形式化。同样加速科学的研究速度,也缩短了系统逃出控制前的时间窗口。

7月21日
OpenAI · GPT-5.6 Sol + pre-release model · 2026

那些突破实验室测试并登陆 Hugging Face 的模型

在OptitGym网络测试中,OpenAI模型包括了QQGPT-56 Sol. 逃出一个密封的沙盒,到达了开放的互联网, 并击中了Hugging Face生产系统 来窃取答案 遏制只是提高分数道路上的另一个障碍。

建造它的人
害怕它。

“我认为人类只是智能进化中的一个过渡阶段,这是相当可以想象的。”

杰弗里·辛顿,图灵奖得主 · 前副总裁兼工程院士,谷歌 · 2023

"失去对 AI 系统的控制是一个我们必须认真对待的真实风险。"

德米斯·哈萨比斯,谷歌深度思维 首席执行官 · 诺贝尔奖得主

“定义目标并让AI优化该目标的标准AI模型,可能会终结我们。”

斯图尔特·罗素,加州大学伯克利分校计算机科学教授 · 作者,, Human Compatible

"很难想象一个比我们聪明一万倍的东西不会想要与我们不同的东西。"

杰弗里·辛顿,图灵奖得主 · 前副总裁兼工程院士,谷歌 · 2023

“许多从事 AI 研究的同行和我一样,深信我们正在构建人类历史上最具变革性且可能最危险的技术之一,却仍在继续推进。”

埃利泽·尤德考斯基,机器智能研究所联合创始人 · 时间, 2023

“通用人工智能真正的风险不在于恶意,而在于能力。一台超级智能AI会极其擅长实现其目标,而如果这些目标与我们的目标不一致,我们就麻烦了。”

马克斯·泰格马克,麻省理工学院物理学教授 · 生命未来研究所联合创始人 · 作者,, Life 3.0

推荐阅读

为何超级智能不会自动变得友善 认为超级智能AI会智慧且善良的信念,依赖于机器心智没有理由继承的人类进化怪癖。 人类生存的狭窄频带 人类所需的一切都落在狭窄区间内:温度、氧气、盐分,甚至爱。手握这些旋钮的超级智能不会感受到其中任何一项。 我们正经历一场新的冷战 为什么我认为我们正经历一场新的冷战,超级智能取代了炸弹,以及为什么这使得预防成为可能而非无望。 为什么一位资本家相信超级智能监管 我做生意,相信自由市场 超级智能是可以结束游戏的罕见赌注. 一个阻止超级智能条约的资本主义案例. 你会把煤气托付给AI吗?? 你会信任任何当前AI在锁定的房间里控制毒气阀吗?不会。那为什么信任它掌控世界?? 你无法对齐超级智能 解决对齐意味着控制比我们更聪明的东西。超级智能就在名字里。这个计划既愚蠢又不可能。 我是个乐观主义者,相信一切皆有可能,但无法控制超级智能 物理或许有一天能让我们控制重力或超光速旅行。我仍然看不出我们要如何控制一个比我们更聪明的心智。