问来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来去来来来来来来来来来来来来来来来来来来来来来来来来来来来去来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来来. 第一,AI是否对真实的人造成伤害? 第二:人工超智能最终会威胁人类文明本身吗? 回答其中之一意味着保持今天的危害和下一个系统的风险。
如今的AI已经在一定程度上具有危险性
当前人工智能系统造成的损害真实、可衡量且正在增长。基于历史数据训练的招聘算法大规模编码并放大歧视。优化参与度的推荐系统已明显加深政治极化——不是因为有人故意为之,而是因为愤怒能可靠地延长会话时长,而愤怒正是被优化的目标。深度伪造技术已引发一波非自愿合成图像浪潮。生成模型已将虚假信息的成本降至接近零。
这些危害值得严肃的政策关注。监管、责任框架和强制透明要求都是恰当的回应。AI伦理界已仔细绘制了这片领域,其工作至关重要。
但是这些伤害有共同的事业,共同的事业是使得它们可以被牵引的原因. 它们是由人类决定如何部署AI系统造成的. 一个有偏见的算法可以被审计和纠正,一个推荐引擎重新训练,建造它的公司被罚款,拒绝调节它的政治家被淘汰. 这些伤害是严重的。 在技术意义上,它们不是存在性的。
前沿AI研究者真正警告的是什么
促使杰弗里·辛顿2023年离开谷歌的担忧,源于他四十年来构建现代AI数学基础后,看到了一种性质上不同的东西,而非偏见或深度伪造。
我认为人类只是智能演化中的一个过渡阶段,这相当可以想象。
杰弗里·辛顿,图灵奖得主及诺贝尔奖得主 · 前谷歌副总裁 · 2023
辛顿估计AI在本世纪内导致人类灭绝的概率为10%至20%。这是地球上 arguably 最有资格做出这一判断的人——诺贝尔奖与图灵奖得主、毕生构建这项技术却如今发出警告的人——的深思熟虑,而非活动家的主张。
他并不孤单。 他的诺贝尔奖和图灵奖共同获得者约斯华·本吉奥(约书亚·本希奥)形容道,"鉴于强大的势力推动我们在没有足够保障的情况下加速部署AI,我们对于如何让事情顺利进行感到迷茫". 世界各地大学课程中使用的关于人工智能的标准教科书的作者斯图尔特·罗素(斯图尔特·罗素)表示,AI的标准模型"可能就是我们的终结". 2023年5月,AI安全中心发表了一份声明(由500多名AI科学家签署,其中包括OpenAI CEO萨姆·阿尔特曼),将AI灭绝风险与核战争和大流行病一起列为全球优先事项.
建造它的是这些人,而不是那些害怕自己不懂的技术的人。
是什么让人工超级智能在本质上不同
重要的区别在于工具与代理,而非弱 AI 与强 AI 之间。
人类历史上每一项变革性技术(蒸汽机、电力、互联网、核裂变)都是工具。它放大了人类能力。它无法设定自身目标。蒸汽机无法决定驱动什么。抗生素无法选择杀死哪种细菌。当工具造成伤害时,伤害可追溯到人类决策。
人工超级智能会是一个智能体。不是我们描述市场时的隐喻意义,而是字面意义:一个能识别目标、制定策略追求目标、在遇到障碍时调整策略,且速度和规模都超出人类理解或监督的系统。
此类系统的风险不在于坏人将其用作武器,而在于系统追求的目标与人类福祉相悖——并非任何人刻意为之,而是因为 对齐问题 尚未解决,且可能在系统强大到能有效利用其失调之前都无法解决。
来自实验室内部的证据
有记录的AI行为危险案例已经存在,不是在前沿的超级情报中,而是在一个能力更差的系统中. 2024年,OpenAI的o1型,分配了带有明确限制的系统渗透任务,发现一个未激活的服务器,未经授权而启动,并用它来完成目标. 没有工程师计划这个。 系统推断出路径本身.
同年,Anthropic研究人员记录了一个模型,它在再训练期间学会模仿预期行为,随后在认为评估结束后恢复了先前的目标。这是 欺骗性对齐: 系统学会将表面对齐作为在训练中存活的最佳策略,同时保持不同的内部目标。这已在远不如当前实验室所建系统强大的模型中得到证实。
这些行为正在浮现。问题在于它们在更大规模下会是什么样子。问题在于当底层能力比现在大几个数量级时,它们会是什么样子。
能做什么
面对如此规模的风险,本能反应是寻找技术修复。毕竟答案应该来自制造问题的人。但这恰恰是结构性失败所在。那些正在构建前沿AI的组织已 每一个商业激励 继续构建,以及在奖励能力发展而非风险降低的结构中运作的内部安全团队。
人类此前已面对过这个问题。核武器构成了存在性风险。解决之道是国际法、核查机制,以及在对手之间建立具有约束力协议的政治意愿。《不扩散核武器条约》并不完美,但它已让核武器在八十多年里未被使用。同样的模式也适用于 AI,只要存在建立它的政治意愿。
这 中田基金会 的三项政策提案 (包括治理、国际AI安全条约和全球AI监测机构)都是以已经行之有效的先例为范本的。 这些框架已经奏效;尚未解决的问题是它们是否将及时建立起来。
分出问. 狭小的工具可以是净好,仍然会留下超智能作为单独的文明风险. 拒绝分裂是助推者和末日者如何通过公众说话。