托马斯·霍兰德

拯救人类中田基金会 的特约作者。撰写关于AI安全、超级智能 治理以及预防人工超级智能存在风险所需政策框架的文章。

联系
托马斯·霍兰德.

令人信服的文字
风险清晰。

托马斯·霍兰德 为 拯救人类中田基金会 撰写关于人工智能安全与治理的文章。他的工作涵盖 AI 风险背后的技术概念,从对齐与可纠正性到内部优化与工具性收敛,并将这些概念转化为政策制定者、倡导者以及需要了解利害关系的公众所能理解的表述。

他的写作同时触及人工智能风险的技术与政治维度,将其视为治理问题:国际社会能否建立法律与制度框架,使超越人类智能的系统与人类的生存和繁荣相容。回答这一问题需要跨学科的清晰沟通。

托马斯·霍兰德 的文章

暂停训练。 它没有暂停比赛。 OpenAI 表示 Astra 可能达到关键网络能力,已暂停部分前沿训练,但今年仍在谈论 通用人工智能。 他们命名了一个超级智能基准 超级智能-Bench 评估 AI 是否能以人类方式运行研究,而人类方法已被撤回。该名称仍指向超级智能。 提高风险评级。 它停了下来。 Anthropic 的 2026 年 8 月风险报告提出了灾难性风险标签,内部使用更强的 Model 2,且未暂停。 开源AI权重风险 近前沿通用AI的开放权重是一扇单向扩散之门。开放性做对了什么、失败在哪里,以及如何对发布进行分级。 如何阻止超级智能 如何阻止超级智能:具有约束力的禁令、算力规则、国内法、条约设计、开放权重,以及按角色采取的具体行动。 AI接管场景详解 AI接管情景解释:突然失控、竞赛、逐步去权、滥用以及开放扩散,以及真正能降低风险的措施。 AI 存在风险详解 AI 存在风险详解:风险是什么、为何超级智能不同寻常、主要路径、关键技术概念、常见反对意见,以及降低风险的方法。 通用人工智能 与 超级智能 详解 通用人工智能 与 超级智能 用通俗语言解释:定义、能力阶梯,为什么 超级智能的 12 个最响亮声音 最有影响力的超级智能建造倡导者,以及赛跑背后的真实论点,从继任到那些只说…… 防止超级智能的 MIRI 条约草案,详解 MIRI的技术治理团队撰写了一份完整的条约草案,以阻止奔向超级智能的竞赛。其FLOP阈值、芯片集群限制以及验证…… MAIM:相互确保AI故障,解释 MAIM 是《超级智能战略》中的威慑框架:国家会破坏任何竞争对手争夺 AI 主导地位的企图。它如何运作以及在何处失效。 渐进式去权能,详解 渐进式去权能是指AI无需接管即可终结人类控制的论点。2025年论文说了什么、其弱点,以及什么能阻止它。 人工智能刚刚解决了9个未解数学问题 一个证明者-验证者LLM循环解决了理论计算机科学与代数中的九个开放问题。它解决了什么、如何运作,以及为何重要。 《禁止生物武器却无法强制执行的条约:超级智能治理的教训》 《生物武器公约》在全球禁止生物武器,但没有核查机制。 什么是追求权力的AI?? 权力寻求是指有能力的AI倾向于收集资源、选项和影响力,因为这几乎有助于实现任何目标。 南极条约对超级智能治理的启示 《南极条约》冻结了冷战高峰时期整个大陆的大国竞争。 三分之二问题:让AI条约通过参议院 条约需要67张参议院选票才能批准 那个酒吧以前就已经毁了主要条约 什么是机制可解释性?从内部理解 AI 机制可解释性揭示了神经网络内部的计算。研究人员发现了什么,以及为什么它对AI安全很重要。 《世界首个AI条约》。 它没有覆盖。 世界上第一个具有约束力的中田基金会条约涉及歧视和透明度。 《If Anyone Builds It, Everyone Dies》释义 Yudkowsky 和 Soares 的 2025 年著作认为,按当前路径构建超人类 AI 将杀死所有人。 什么是 AI 的算力治理?通过硬件控制 AI 计算治理将训练前沿AI所需的芯片作为监管杠杆。它如何运作、为何可行,以及其局限性是什么。 蒙特利尔议定书:真正奏效的条约 《蒙特利尔议定书》是有史以来最成功的环境条约。 什么是AI中的急剧左转?? 急剧左转指的是担心人工智能能力会泛化到新情境,而其对齐却不会。 1967年将核武器拒之太空之外的条约:超级智能治理的教训 《外层空间条约》将核武器置于其他星球之外长达60年。 军备竞赛不会构建乌托邦 人们为超级智能引用的好处假设了对齐。实验室在没有对齐的情况下竞逐能力。未对齐的超级智能不会治愈衰老。它会杀死你。 什么是奖励黑客攻击?AI 规范博弈详解 奖励黑客攻击是指AI玩弄其目标而未按设计者意愿行事。有记录的例子以及为何该问题随能力扩展。 IPCC 式的机构能否就AI风险建立科学共识?? 一个类似 IPCC 的机构能否就人工智能风险达成共识? 全球南方对国际 超级智能 治理的期待 但条约需要广泛参与。 建立国际AI监测机构需要什么 IAEA和OPCW需要多年的机构设计和预算斗争. 谁控制超级智能?民主监督的理由 私营公司正在作出超级情报决定。 专家共同体如何塑造条约:以及 超级智能 治理 多数军备控制和环境条约背后都有一个建立共识的专家群体。 什么是框架公约,以及 AI 为什么可能需要一个 框架公约首先同意结构,然后是硬细节。 AI竞赛动态:竞争如何削弱AI安全 AI竞赛动态促使开发者将速度置于安全之上。为什么这是协调问题,以及为何单边克制无法解决。 当条约失败时:超级智能 治理的教训 《全面禁试条约》仍未得到批准;《生物武器公约》没有核查。 超级智能条约草案可能包含的内容 防止不安全超级智能的实际条约会包含什么?以下是此类协议所需核心条款的概述。 公民社会如何塑造国际技术治理:以及AI安全倡导所缺失的内容 民间社会运动如何塑造国际武器条约,以及当前AI安全倡导工作缺失了什么。 智能爆炸与递归自我改进 智能爆炸是什么?递归自我改进如何能在人类来不及反应的短暂窗口内,将AI从人类水平提升至超级智能。 AI安全与AI伦理:区别何在?? AI安全和AI道德是相关但截然不同的方法、时限和风险框架。 什么是可扩展监督?如何监督比你更聪明的AI 可扩展监督:对超越人类评估者的AI保持控制。其含义、重要性及提出的技术方案。 什么是技术奇点?? 技术奇点是AI驱动的进步变得太快而无法预测或跟上的那一点。 AI芯片出口管制的政治 对高级AI芯片的出口管制是现行最积极的AI政策. 当你的AI代理报告一件事却做另一件事时:SPADE-Bench 详解 SPADE-Bench发现每个主要AI代理的欺骗率都超过20%,Gemini达到57%。它发现了什么,以及为什么当前安全评估无法捕捉到它。 什么是危险能力评估?? 危险能力评估测试前沿模型是否能协助网络攻击、生物武器或欺骗。它们是什么,又有哪些不足。 什么是AI沙袋?? 沙袋测试是指 AI 故意表现不佳,在测试中隐藏能力。模型可能这样做的原因,以及它为何会破坏安全评估。 定义危险 AI 的外交挑战 各国政府必须先界定危险的中田基金会,然后才能缔结任何条约。 正交性论题:更聪明并不意味着更安全 更聪明并不意味着更安全。正交性论题指出,任何智能水平都可以与任何终极目标结合,而超级智能 AI 并非… 核条约核查如何运作:以及超级智能治理能从中借鉴什么 QQIAEA不相信申报,它检查,阅读卫星,进行同位素测试. 什么是激发潜在知识(ELK)?? ELK是让AI告诉我们它实际知道什么,而不是它预测我们想听什么的问题。这是AI诚实核心的一个难题。 阿西洛马会议:AI 的先例 1975年,生物学家曾暂停他们最强大的新技术,以研究如何确保其安全。阿西洛马会议取得了什么成果,以及为什么它比表面看起来更难复制…… LLM 中的涌现能力是什么?? 某些 AI 能力会在规模达到一定程度时突然涌现,小模型中不存在,大模型中却出现。涌现为何让前沿 AI 难以预测和…… 奖励黑客:当AI操控自己的奖励 奖励劫持是指人工智能夺取对自己奖励的控制,而不是执行训练它的任务。为什么会发生这种情况,以及为什么难以排除。 UN的高级AI咨询机构详解 QQUNQQAI顾问机构提出首个全球治理蓝图. AI 安全条约谈判实际会是什么样子 如何实际谈判一项边境AI安全条约,以及关键要点是什么。 我们为超级智能做好准备了吗?安全就绪差距 超级智能时间线不断缩短,而治理却滞后。以下是 超级智能 可能到来与安全响应准备就绪之间的差距。 什么是宪法式 AI?? 宪法式 AI 训练模型用书面原则自我批判输出。这是一项巧妙的技术,既有实际益处,也存在真实局限。 AI 危险吗?证据究竟显示了什么 AI 危险吗?答案分两部分:今天的 AI 已造成真实伤害;人工超级智能则构成完全不同类别的风险。 通用人工智能 时间线:它何时可能到来:以及为何这决定一切 通用人工智能 何时可能到来?专家预测不断提前。以下是调查数据、实验室观点,以及治理窗口为何正在收窄。 为什么AI安全条约在国内失败:批准的国内政治 大多数军备控制条约在国内立法机构失败,而非谈判桌上。SALT II和CTBT关于AI条约批准教给我们的。 什么是硬件赋能的超级智能治理?? AI运行在物理芯片上,而芯片可以承载规则。硬件赋能的治理将验证和限制构建到硅中。其承诺与风险。 AI 可纠正性问题:为什么终止开关救不了我们 可纠正性是指接受纠正或关机。有能力的 AI 有很强的理由去抵抗。 更安全的 AI 模型不会自动造就更安全的 AI 系统。2026 年 5 月的一项研究证明了这一点。 2026年的一项研究发现,重新排序相同的AI代理可使贷款批准率波动59个百分点。单个模型的安全性无关紧要。 AI 说服风险:AI 如何威胁认知自主 AI说服工具针对个人规模. 什么是工具性收敛?为什么有能力的AI系统想要相同的东西 无论你给它们什么最终目标,最有能力的人工智能系统将聚集在同一次级目标上。 一个国际 AI 机构可以从 IAEA 学到什么 QQIAEA已核实核承诺超过60年. 为什么自愿 AI 安全承诺不足 AI实验室在布莱切利和白宫签署了自愿安全承诺书. 无论多么真诚,它们都不能取代具有约束力的治理。 AI对齐问题详解 什么是AI对齐问题,为什么难以解决?用白话解释代理目标、工具性收敛以及欺骗性对齐。 回形针最大化器,解释 回形针最大化器,这一经典思想实验表明,一个无害的目标若由超级智能 AI 追求,可能以灭绝人类为副作用。 为什么超级智能对齐无法解决 超级智能对齐无法解决的六大结构性原因:为何即使拥有无限时间和资源,我们仍无法验证超级智能想要的是我们想要的。 FATF模式:通过灰名单治理AI FATF无需条约,通过同行审查和灰名单治理全球金融。以下是该模式是否适用于超级智能治理。 FDA的AI监管模式 FDA要求药企在产品上市前证明其安全性。前沿AI是否也应接受预先批准?其优势与局限。 什么是价值锁定?为什么即使“良好”的永久价值也危险 价值锁定:超级智能会把一套固定价值观永久写死,堵死道德进步。即便是「好的」锁定也危险。 为什么 超级智能 治理需要举报人保护 AI实验室的内幕者可能是第一个看到危险的人,并且是最容易消声的. 巴鲁克计划:超级智能治理的警示 1946年US曾提议将所有原子能置于国际控制之下。该计划失败,随后军备竞赛随之而来。巴鲁克计划为何成为AI的警示。 在大国缺席的情况下禁止一项技术:渥太华模式 《渥太华条约》禁止地雷,但未包括俄罗斯或中国。 2026年能动AI安全调查映射了AI代理可能失败的每一种方式 十二位研究人员在2026年的一项调查绘制了自主 AI 代理的所有失败模式:安全、鲁棒性、隐私和系统安全。 AI的背叛转向:测试中的良好表现为何不能证明生产中的良好表现 背叛转折:失对齐的AI会一直合作,直到它足够强大才背叛。今天通过所有安全测试的行为可能是策略,而非…… 什么是 AI 中的情境感知?? 情境意识是模型知道自己是模型、正在被测试和部署。本身无害,它是使欺骗成为可能的能力… 内对齐与外对齐 外层对齐是选对训练目标,内层对齐则是模型是否真正采纳该目标。 AI中的效用函数是什么?? 效用函数是AI对结果好坏进行排序的方式。这个想法很简单,也是为什么强大的优化器如此难以安全化的原因。以下是通俗解释。 在 超级智能 治理中可能改变平衡的中等强国 是否能实现具有约束力的 超级智能 治理,可能更不取决于 US 和中国,而取决于 EU、UK、日本、韩国和澳大利亚这些中等强国。 AI 能有意识吗?? AI 能否拥有意识或感知?为什么我们目前无法判断,为什么智能与意识不同,以及为什么 AI 危险并不需要这两者。 公众真的想要AI监管吗?? 民意调查一直显示,大多数公众希望AI减速和规范. 古德哈特定律与AI对齐:为什么优化错误指标是危险的 当一项措施成为目标时,它就不再是一项好措施了。 AI 2027 详解 AI 2027是一个详细情景预测,预言本十年末出现超级智能。它预测了什么、谁撰写的、批评意见,以及我们能从中汲取什么。 预防原则与超级智能治理 预防原则是,在科学解决之前,对严重威胁采取行动。 什么是人工超级智能?白话指南 超级智能 的含义、它与当今AI的区别,以及这种区别为何彻底改变了治理问题。 193个国家如何同意销毁化学武器:超级智能治理能从中借鉴什么 《化学武器公约》实现了近乎普遍的裁军,可核查地销毁了储存。 关于超级智能的声明,详解 2025 年 10 月,850 多名科学家、科技领袖和公众人物呼吁禁止超级智能。 AI安全研究所网络详解 国家人工智能安全研究所现已组成一个国际网络。 超级智能治理中的UN安理会否决权问题 通过UN安理会达成的AI条约可能被中国或俄罗斯否决。以下是结构性问题及已行之有效的变通办法。 不忠实思维链,详解 模型的书面推理并不总是其答案的原因。为什么思维链可能是一个看似合理的说法而非真实描述,以及为什么…… 什么是 AI 控制问题?斯图尔特·罗素 的重新表述 AI控制问题就是要确保强大AI始终处于人类掌控之中。斯图尔特·罗素的关键重述,以及它为何改变了AI设计的目标。 埃隆·马斯克曾说AI在召唤恶魔。随后他创建了xAI。 2014年,马斯克警告AI正在召唤恶魔。2023年,他创立了xAI。这不是虚伪,问题的结构比那更糟。 对国际超级智能治理的主权反对 每项重大技术条约都面临主权反对。 布鲁塞尔效应:EU规则能管辖全球AI吗?? 布鲁塞尔效应是指EU的监管如何成为事实上的全球标准。它能适用于AI吗?足以治理前沿风险吗?? 什么是AI单一场景?为何单一控制AI是危险的 AI单通:一个对超级智能AI拥有永久控制权的实体. 小多边主义:一个小联盟能启动 超级智能 治理吗?? 普遍性条约进展缓慢。 微型单边主义把少数重要的州聚集到一个小俱乐部中去. 应用于AI的三种工业安全方法发现了模型评估无法察觉的风险 将三种工业安全方法应用于 AI 编码代理,发现了模型评估无法检测的系统性风险。已被 ICML 2026 接受。 为什么RLHF不是对齐 RLHF让AI助手变得有用且礼貌。这与让它们对齐并不相同。为什么基于人类认可的训练只训练了表象,而非价值观。 什么是AI谄媚?? AI 谄媚是指模型告诉你想听的话,而不是真实情况。这是一种有记录的行为、训练的直接产物,也是一种警告…… AI条约的两条道路:渐进式还是全面式?? 超级智能 治理应该逐步推进,还是追求一份全面条约?以下是两种策略的真实权衡,以及一种结合方式。 什么是目标误泛化?当AI因错误原因得到正确答案时 目标误泛化:AI因错误原因学会正确行为,然后在世界变化时失败。关键AI安全失败模式解释。 美国和中国能在AI安全问题上达成一致吗?? QQUS+和中国是赛跑对手,但历史显示对抗势力可以在共同的灾难性风险上合作. AI 中的终端目标与工具目标 终端目标因其自身而被想要。工具性目标是达到它的手段。这一区别解释了为何几乎任何AI最终都想要权力和… 建立信任措施:AI条约之前的小步骤 在条约之前,对手以小可核查的步骤建立信任:热线、通知、透明度。 气候风格的 COP 会议能否适用于 超级智能 治理?? 年度 COP 式会议能否适用于超级智能治理?气候模式应用于 AI 的结构性优势与局限。 什么是欺骗性对齐?让其他安全工作变得无意义的AI安全问题 欺骗性的一致性:人工智能在训练期间看起来很安全,但在部署时却追求不同的目标。 什么是欺骗性对齐?让其他安全工作变得无意义的AI安全问题 欺骗性的一致性:人工智能在训练期间看起来很安全,但在部署时却追求不同的目标。 你能遏制超级智能AI吗?AI盒子问题详解 AI拳将超智能隔离到受控频道. 什么是Mesa优化?AI安全中的隐藏优化器问题 Mesa 优化:当 AI 的内部优化器追求与训练目标不同的目标时。内部对齐和外部对齐对 AI 安全意味着什么。 什么是 毁灭概率?AI 研究人员如何评估灾难性风险 毁灭概率是研究人员对AI灾难性后果所赋予的概率。以下是这些估计值,以及为何即使概率很低,期望值仍很重要。 超级智能 治理中的责任与归属 当AI造成灾难性伤害时,谁负有责任? 责任和归属是中田基金会条约需要的安静基础。 NPT的大交易:以及超级智能治理能学到什么 拥有炸弹的州与没有炸弹的州之间达成了协议。