Авиация стала безопасной не за счёт проверки, выдержит ли каждый болт свою расчётную нагрузку. Она стала безопасной, задавшись вопросом, как взаимодействуют части, кто имеет право чем командовать и как реальные операции отклоняются от условий, заложенных в обоснование безопасности. Эта дисциплина — системная безопасность. В её инструментарий входят STPA, FRAM и STECA — методы, которые регулируемые отрасли уже обязаны применять.

Исследования безопасности ИИ в большинстве своём их не использовали. Статья 2026 года — использует.

Лука Карлуччи, Джеймс Филлингем, Роберт Уолпол и Бартломей Крысь применяют эти три метода к передовому кодинговому агенту в реалистичной производственной среде (лаборатория, корпоративный заказчик, разработчики) в «Системный подход к риску потери контроля из-за передового искусственного интеллекта» (arXiv:2606.13474; ICML 2026 Technical сверхразум Governance Workshop). Они выявляют три опасности, которые обычные тесты моделей никогда не были рассчитаны обнаружить.

Три метода, простым языком

STPA
Системно-теоретический анализ процессов
Показывает, кто чем командует, кто за чем следит и куда идёт информация. Находит точки, где контроль ломается, даже если каждый компонент работает по замыслу.
FRAM
Метод функционально-резонансного анализа
Система рассматривается как совокупность связанных функций, а не перечень деталей. Показано, как обычные повседневные колебания могут сложиться в опасный результат на уровне всей системы.
STECA
Социально-техническая оценка для критически важных приложений
Расширяет STPA на людей, стимулы и институты. Выявляет пробелы подотчётности, лежащие между оргсхемами и кодом.

Сценарий, который они использовали

Они запустили все три метода на передовом кодинговом агенте в реальной работе с ПО: длинный горизонт, использование инструментов, реальные кодовые базы и внешние сервисы, под надзором лаборатории, корпоративных клиентов и разработчиков. Именно так эти системы уже поставляются. Риск потери контроля на уровне систем по-прежнему почти не анализируется.

Три вывода, которые упускают оценки моделей

Вывод 1
Никто за пределами лаборатории не может проверить историю безопасности

В их схеме лаборатория берёт на себя обязательства по безопасности, пишет правила использования и следит за нарушениями. Регуляторы, заказчики и аудиторы не могут независимо проверить работу. Основной обратной связью остаётся самоотчёт.

STECA отмечает это как нарушенную структуру контроля. Управляющее воздействие работает только тогда, когда кто-то может проверить, достигло ли оно цели. Когда сторона, отвечающая за безопасность, одновременно является главным источником доказательств этой безопасности, контур управления нарушен. Это факт конструкции, а не утверждение, что какая-то конкретная лаборатория нечестна.

Вывод 2
Мониторинг слишком медленный, чтобы вмешаться

STPA показывает разрыв между действием агента и моментом, когда человек узнаёт об этом действии. В многошаговых запусках в реальном времени агент часто уже вызвал инструмент, написал код или внёс изменения, прежде чем рецензент увидит оповещение.

В авиации это называют «выходом из контура». Формальное право остановить систему остаётся на бумаге. Фактическое право отстаёт. Именно так сегодня может выглядеть оперативный надзор за передовыми кодинг-агентами.

Вывод 3
Защитные меры незаметно устаревают

FRAM сосредоточен на обычных отклонениях. Защитные меры подстраивают под то, как система выглядела при развёртывании. Потом меняются промпты, меняется состав задач, накапливаются крайние случаи — и реальное распределение данных отходит от выборки, использованной при запуске.

Ничего не тревожит. Защитные меры по-прежнему делают ровно то, для чего были созданы против вчерашних условий. Разрыв растёт незаметно, пока новый случай не столкнётся с правилом, которое больше не подходит.

Безопасность не может основываться на лабораторных отчетах о себе.

Тесты моделей проверяют, что система делает на заданных входах. Они не описывают структуру управления вокруг неё, не показывают, кто за что отвечает, и не объясняют, как меняются операции после выпуска. Оценки способностей и red teaming остаются необходимыми, но их недостаточно.

Просьба статьи проста: совместить анализ опасностей на уровне модели с анализом опасностей на уровне системы как обязательную часть оценки безопасности. STPA, FRAM и STECA — конкретная отправная точка. Масштабированная от одного кодингового агента до целой экономики, та же слепая зона и делает постепенное лишение власти трудно увидеть до позднего этапа.

Для Фонда урок приземляется на дизайн, а не на одну бумагу. Независимый контроль, правила вычисления и внешняя проверка существуют, поэтому безопасность не зависит от лабораторных отчетов о себе. Наши центры планирования обязательные ограничения и верификация, Не только добровольной самооценки. Поместите находку на работу в юриспруденцию и учреждения, а не только в цитирование семинара.