Институт безопасности ИИ — это государственный орган, созданный для оценки передовых систем ИИ на риски для национальной безопасности и общественной безопасности, а также для накопления государственной экспертизы в области передового ИИ. Первая волна таких институтов сформировалась вокруг международного саммита по ИИ 2023 года. Сейчас институты обмениваются методиками и результатами через международную сеть, которую продвинули встречи в Сеуле и последующие.
Несколько крупных столиц теперь имеют институт или аналог. Большинство из них всё ещё не могут приказать удержать опасную модель.
Примечание об именах: два учредительных института переименованы. Орган UK стал Институтом безопасности ИИ в феврале 2025 года. Институт US теперь Центр стандартов и инноваций в области ИИ (CAISI) при NIST. Термин «институт безопасности ИИ» остаётся общим обозначением, и в этом руководстве он используется повсеместно.
Годами единственными организациями, глубоко понимавшими передовые модели, были компании, их создающие. Институт — попытка поместить независимые технические возможности внутрь государства, чтобы публичные органы могли оценивать системы, а не принимать брифинг разработчика за последнее слово.
Что они на самом деле делают
Их работа группируется в несколько областей.
- Тестирование передовых моделей, иногда до выпуска, на опасные способности в областях вроде кибер, биологии и автономности, с использованием методов, лежащих в основе оценки возможностей.
- Развитие самой науки оценки: измерять эти риски всё ещё открытая исследовательская задача, а не устоявшаяся процедура.
- Консультирование правительства, чтобы политика основывалась на людях, которые действительно изучили системы.
- Международная координация, чтобы модель, протестированную в одной стране, не приходилось заново создавать везде, и чтобы стандарты начали сходиться.
Это реальный институциональный прогресс. Создание государственной экспертизы по передовым системам ИИ — необходимое условие для управления ими. Нельзя регулировать то, что не можешь оценить, а до недавнего времени правительства в основном не могли.
Власть, которой им в основном не хватает
Большинство институтов безопасности ИИ могут тестировать, консультировать и публиковать. Немногие могут заставить, доступ к моделям часто зависит от сотрудничества в лаборатории, и результаты обычно информируют, а не связывают. В большинстве случаев институт не может заказать опасную модель. Эти органы могут видеть риск и рекомендовать ответ. Они редко требуют одного.
Этот разрыв между оценкой и полномочиями — структурное ограничение. Институт, который обнаруживает серьёзную опасность и может только рекомендовать, эффективен ровно настолько, насколько правительство готово действовать вопреки коммерческому и конкурентному давлению продолжать. Большая часть нынешней архитектуры — это система предупреждения. Система предупреждения не становится защитой, пока кто-то с властью не отреагирует на сигнал.
Способность без полномочий — это то, как правительства поздно узнают плохие новости и действуют позже. Тестирование, которое не может остановить, — это подготовка к управлению, а не само управление.
Кем они могли бы стать
Долгосрочная ценность институтов безопасности ИИ заключается в том, что они собираются для связывающих режимов позже: независимый технический потенциал, общие стандарты и международный канал между правительствами. В этом смысле они являются ранней формой Тип тела, за который выступает Фонд. IPCC модель показывает, как совместная научная оценка может поддерживать международную политику.
Что нужно изменить, так это власть. Оценка должна быть связана с правоприменением, будь то через внутреннее законодательство, которое делает заключение института условием развертывания, или через международную структуру, которая дает проверенные выводы, реальные последствия. Дайте этим институтам власть, соответствующую их опыту, и большая часть строительных лесов серьезного управления уже частично построена. Остановить суперинтеллект по закону, с потенциалом общественной оценки как инфраструктуры, а не как замены запрета и проверки.