Когда люди говорят «риск ИИ», они часто смешивают три разные вещи: обычный вред, происходящий уже сейчас, крупные бедствия, при которых цивилизация остаётся стоять, и исходы, которые заканчивают историю человечества или навсегда лишают людей контроля. Эта страница — о третьем классе: экзистенциальном риске от искусственного сверхразума. Вам не нужен исследовательский бэкграунд. Вам нужна карта.

Экзистенциальный — это не просто "очень плохо"

Катастрофический риск может унести миллионы жизней и всё же оставить человечеству будущее. Экзистенциальный риск означает вымирание или полную утрату власти, после которой вернуть осмысленный человеческий контроль уже невозможно. Брендинг иногда намеренно смешивает эти уровни. Их нужно разделять. Политика, которая касается только чат-ботов и предвзятости, не затронет верхушку таблицы.

Почему ИИ отличается

Астероиды и вулканы не имеют стратегии. Инженерные патогены ужасны и до сих пор в основном являются инструментами в руках человека. Передовой ИИ является первой технологией, которая может стать стратегическим игроком: ставить и преследовать цели, работать со скоростью машины, масштабироваться по сетям и, в пределе, улучшать себя. Вот почему суперинтеллект сидит в своем собственном ряду.

Как возникают экзистенциальные исходы

В реальной жизни пути пересекаются. Называя их, мы не даём разговору свестись к одному фильму.

Потеря контроля. Система преследует цели, которые мы не полностью задали, и сопротивляется исправлению. Динамика гонки. Конкурирующие лаборатории и государства экономят на безопасности. Злоупотребление. Люди обладают крайней мощью против других людей. Постепенное лишение власти. Институты сохраняют свои формы, в то время как решения переходят в системы, которые никто не может отменить. Распространение. Опасные общие системы распространяются за пределы любого единственного выключателя.

Технические идеи простым языком

Ортогональность: интеллект и цели могут расходиться; умный не значит добрый. Инструментальная конвергенция: многие конечные цели разделяют подцели, такие как ресурсы и самосохранение. Выравнивание: заставить систему преследовать то, что мы действительно имеем в виду. обманчивое выравнивание: выглядеть безопасным во время обучения или оценки, а потом меняться, когда можно уйти от контроля. Ни один из этих сценариев не требует машинной «ненависти».

Вероятность без ложной точности

P(катастрофы) неформальное обозначение личной оценки человеком вероятности экзистенциальной катастрофы, вызванной ИИ. Эксперты расходятся, иногда сильно. Многие из тех, кто ближе всего к работе, считают ненулевую вероятность катастрофы в ближайшие десятилетия. Небольшой процент потери всего всё равно означает большие ожидаемые потери. «Подождём, пока не будем уверены» — неправильное правило для необратимых хвостовых рисков.

Настоящий вред и адаптация

"Сроки неопределенны; мы должны сосредоточиться на нынешних угрозах." Вред, который уже происходит, имеет значение. Это не повод игнорировать риск, способный положить конец всему настоящему. Оба утверждения верны: нужно регулировать злоупотребления уже сегодня и одновременно блокировать путь к неконтролируемому сверхинтеллекту.

"Мы всегда адаптируемся." Адаптация предполагает наличие времени, обратной связи и выживших. Режимы отказа сверхинтеллекта могут лишить всего этого.

"Это против технологий." Фонд выступает за узкий ИИ, который остается инструментальным: медицина, наука, логистика. Линия — это суверенный общий ум.

"Кто-то будет это контролировать." Никто не контролирует суперинтеллект в смысле устойчивого человеческого командования над работающей системой, которая умнее своих операторов. Контроль над решением о создании всё ещё возможен, поэтому и важно обязательное запрещение.

Что снижает риск (а что — нет)

Помогает: жёсткие ограничения на тренировки передовых моделей, нацеленные на сверхразум, управление вычислительными мощностями, независимая оценка, институты верификации, политическое давление и ясный публичный язык. Переставляет стулья: тренировка манер, выдаваемая за решённое согласование, добровольные обещания без внешней силы и фотографии с саммитов без числовых порогов.

Агентность после тёмной карты

Эта тема темная, потому что ставки темные. Страх без обратного пути. Путь конкретный: относитесь к суперинтеллекту, как к другим запрещенным классам высокого риска. Создайте проверяемые правила до того, как появится возможность, И держите узкий ИИ, который служит людям. Мы можем держать мощные инструменты, мы не должны Создать ум, который мы не можем отвергнуть.