AI安全研究所是政府设立的机构,旨在评估前沿AI系统对国家安全和公共安全的风险,并建立国家自身对前沿AI的专业知识。第一波集中于2023年国际AI峰会。研究所现通过首尔及后续会议推动的国际网络共享方法和发现。
如今已有数个主要国家首都设立了相关机构或等效组织。其中大多数仍无法下令叫停一个危险模型。
名称说明:两家创始机构已更名。UK 机构于 2025 年 2 月更名为 AI Security Institute。US 机构现为 NIST 下的 Center for AI Standards and Innovation (CAISI)。“AI safety institute”仍是通用标准术语,本指南全程使用该表述。
多年来,唯一深入理解前沿模型的机构是那些正在构建它们的公司。研究所试图在政府内部建立独立技术能力,使公共机构能够自行评估系统,而非把开发者的简报当作最终结论。
他们实际在做什么
他们的工作集中在几个领域。
- 使用背后的方法测试前沿模型(有时在发布之前)在网络、生物学和自治等领域的危险能力 能力评估.
- 发展评估科学本身,因为良好衡量这些风险仍是一个开放的研究问题,而非既定程序。
- 向政府提供建议,让政策由真正研究过系统的人来指导。
- 国际协调,使在一个国家测试过的模型不必在各地从头重建,也使标准开始趋同。
这是真正的制度进步。建立国家能力以理解前沿AI是治理它的先决条件。你无法监管无法评估的东西,而直到最近,政府基本上都做不到。
他们大多缺乏的力量
大多数AI安全研究所可以测试,咨询和发布. 很少有人能够强迫,获得模型往往取决于实验室合作,结果通常通知而不是约束。 在大多数情况下,研究所不能下令扣留危险型号。 这些机构可以看到风险,建议采取对策。 他们很少需要一个。
评估与权威之间的差距是结构性限制。一个发现严重危险却只能提出建议的研究所,其效力仅取决于政府对抗商业和竞争压力继续推进的意愿。目前的大部分架构是一个预警系统。预警系统在有人掌握权力回应警报之前,不是保障。
没有权威的能力是政府如何迟到才得知坏消息,然后再采取行动。 不能强迫停止的测试是治理的准备,而不是治理本身。
它们可能成为什么
AI安全研究所的持久价值在于它们后来为具有约束力的制度所汇集的东西:独立的技术能力、共同的标准以及政府之间的国际渠道。 从这个意义上讲,它们是: 基金会所主张的那种机构. 该 IPCC 模型 展示了共享的科学评估如何支持国际政策。
必须改变的是权威。 评估必须同执法联系起来,无论是通过国内法,使一个研究所的注册成为部署条件,还是通过一个国际框架,提供经核实的调查结果产生实际后果。 赋予这些机构与其专长相匹配的权力,许多认真治理的脚手架已经部分建成. 依法停止超级情报, 以公共评价能力作为基础设施,而不是取代禁止和核查。