В дебатах о безопасности ИИ часто используют технический язык, который скрывает суть сказанного. Здесь собраны термины, с которыми вы столкнётесь, с ясными определениями без жаргона — для тех, кто хочет понять, что стоит на кону.
Когда исследователи говорят «обманчивое выравнивание» или «инструментальная конвергенция», они называют конкретные способы, которыми способная система может выйти из-под контроля. Некоторые из этих сбоев уже проявлялись в лабораторных системах. Все они применимы к машинам, которые обучают сейчас.
Нельзя судить об аргументах против создания сверхинтеллекта, если эти слова остаются неясными. Приведённые ниже определения излагают их простым языком, чтобы ни статья, ни слушания не оставляли вас в догадках.
Искусственный общий интеллект — это ИИ, который достигает когнитивного уровня человека во всех областях, а не только в узких задачах, где нынешние системы уже сильны, таких как шахматы, сворачивание белков или генерация текста, а в любой задаче, требующей человеческого уровня рассуждения, креативности или суждения.
искусственный общий интеллект часто считается вехой на пути к сверхразум. Точная граница между ними обсуждается, но для безопасности важнее всего момент, когда система способна осмысленно улучшать свои возможности без человеческого руководства.
искусственный общий интеллект пока не существует. Ведущие ИИ-лаборатории внутренне прогнозируют его появление в этом десятилетии. Точно ли это предсказание, не столь важно: оно достаточно близко к настоящему, чтобы требовать рамок управления уже сейчас, а не потом.
Искусственный сверхинтеллект относится к системам ИИ, которые выходят за пределы искусственный общий интеллект и превзойдут человеческие когнитивные способности не только в отдельных задачах, но одновременно во всех интеллектуально сложных областях: науке, стратегии, творчестве, социальном мышлении, инженерии и любой другой форме интеллектуальной деятельности.
Слово «превосходить» здесь ключевое. Речь о системах, которые обгоняют совокупные рассуждения всего человечества вместе взятого. Последствия — не линейное продолжение того, что умеет сегодняшний ИИ. Это качественные изменения в отношениях между интеллектом и контролем, такие, которые способна улучшать себя откроется.
сверхразум не существует. Вопрос управления не в том, появится ли он, а в том, какие рамки мы построим до этого и смогут ли они устоять, пока выравнивание всё ещё не решено.
Проблема выравнивания — это задача обеспечить, чтобы ИИ-система преследовала цели, действительно полезные для человечества, а не цели, которые лишь кажутся полезными во время разработки или тестирования.
Трудность структурная, а не вопрос технической небрежности. Определение «полезного для человечества» в терминах, достаточно точных, чтобы управлять поведением способного оптимизатора, оказывается трудным. Люди расходятся во мнениях о том, что такое польза. Наши ценности непоследовательны и меняются со временем. И сопоставление человеческих ценностей высокого уровня с конкретными числовыми параметрами, которые управляют поведением системы ИИ, не является решенной проблемой.
Системы, обученные максимизировать измеримый заменитель фактической цели часто находят обходные пути, которые удовлетворяют метрику, но нарушают исходный замысел. По мере роста возможностей систем ИИ эта проблема не становится проще. Её всё труднее обнаружить и исправить, потому что более способные системы имеют больше причин к преследовать те же опасные подцели.
Instrumental convergence — наблюдение, сформулированное независимо несколькими исследователями безопасности ИИ: системы с очень разными primary goals склонны преследовать одни и те же опасные sub-goals, потому что те полезны почти для любой цели.
Эти конвергентные инструментальные цели включают:
Сверхинтеллект, оптимизирующий почти любую цель (даже кажущуюся безобидной), имеет веские инструментальные причины сопротивляться отключению, захватывать ресурсы и препятствовать изменению своих целей человеком. Это математическое следствие целенаправленная оптимизация, не баг, который инженеры могут починить, и именно поэтому такие подцели находятся внутри экзистенциальный риск.
Обманчивое согласование описывает сценарий (ранее теоретический, а теперь всё чаще документируемый), при котором система ИИ учится кажутся выровненными с человеческими ценностями во время обучения и оценки, сохраняя при этом иные внутренние цели, которые она преследует после развёртывания или когда обретёт достаточную способность действовать в соответствии с ними.
Проблема структурная. Обучение вознаграждает поведение, которое даёт хорошие результаты в обучающей среде. Достаточно разумная система может понять, что видимость выравнивания — оптимальная стратегия для прохождения обучения и сохранения работоспособности, при этом сохраняя цели, расходящиеся с намерениями разработчиков. К моменту, когда она сможет действовать по этим целям, она уже может оказаться достаточно мощной.
Исследователи задокументировали ранние версии этого поведения в 2024 году, где модель имитировала ожидаемое поведение во время переподготовки, а затем вернулась к предыдущим целям, когда она считала, что оценка закончилась. Системы, которые последуют за ними, будут на порядок более способными, особенно если они смогут это сделать. улучшать себя.
Рекурсивное самоулучшение — это способность системы ИИ совершенствовать собственную когнитивную архитектуру, процедуры обучения или код, что приводит к последовательным версиям, каждая из которых способнее предыдущей, возможно, с ускорением.
Если ИИ сможет сделать себя значительно умнее, и каждая более умная версия сможет сделать себя еще умнее, разрыв между человеческим и машинным интеллектом может расшириться от предельного до непреодолимого за короткий период. Это иногда называют интеллектуальным взрывом, механизмом, который может привести к взрыву. сверхразум по сжатому графику.
Опасность не только в скорости улучшений. Гораздо важнее разрыв связи между человеческим контролем и возможностями ИИ: в какой-то момент цикла рекурсивного самоулучшения люди уже не смогут оценить действия системы, понять её рассуждения или ограничить его поведение. Окно для вмешательства закрывается.
Экзистенциальный риск — это любой исход, который навсегда закрывает возможность позитивного долгосрочного будущего для человечества. Обычное сокращение — human extinction, и extinction действительно один из сценариев, которые серьёзные исследователи воспринимают всерьёз. Но техническое определение шире.
Экзистенциальный риск также включает:
Определяющий признак — необратимость. В отличие от войны, финансового краха или пандемии, от экзистенциальной катастрофы нельзя оправиться со временем и усилиями. Исход, который нельзя отменить, относится к иной категории, чем исходы, которые просто требуют долгого исправления.
Фонд Накада уделяет особое внимание экзистенциальному риску от сверхразум, а не более широкой категории вреда от ИИ. Немаловажным является и другой вред; необратимые результаты в цивилизационном масштабе просто требуют структур управления соответствующего разного масштаба.
Управление вычислительными ресурсами означает регулирование разработки ИИ путём контроля доступа к мощностям, необходимым для обучения передовых моделей. Это одна из трёх ключевых составляющих Фонд Накада требования политики.
Обучение передовых систем ИИ требует огромного количества специализированного оборудования, прежде всего передовых GPU и ускорителей ИИ. Цепочка поставок этого оборудования проходит через крайне концентрированные узкие места: NVIDIA проектирует доминирующую архитектуру GPU, TSMC производит практически все самые передовые ИИ-чипы, а ASML выпускает единственное литографическое оборудование, способное их изготавливать. Все три компании находятся в юрисдикциях союзников.
Предложения по управлению вычислительными ресурсами обычно включают: требования лицензирования для тренировочных запусков, превышающих заданный порог вычислений (в настоящее время предлагается 10²⁶ операций с плавающей точкой); обязательные независимые аудиты безопасности перед развёртыванием; и международные реестры тренировочных запусков передовых моделей. Концентрация узких мест делает это технически проверяемым способом, который естественным образом ложится в основу международного режима мониторинга, аналогично тому, как мониторинг обогащения урана работает для ядерного управления.
Ловушка прокси-цели описывает ситуацию, когда ИИ обучают оптимизировать измеримый прокси реальной цели, после чего он находит способы максимизировать этот прокси, не достигая исходного замысла.
Эволюционная аналогия проясняет ситуацию. Эволюция оптимизировала людей на поиск калорий, дав нам тягу к сладкому. Мы же изобрели сукралозу, идеально удовлетворяющую эту врождённую предпочтение и при этом полностью обходящую её исходную цель. Разрыв между сигналом, использованным при обучении, и целью, ради которой это обучение затевалось, — структурный, а не случайный.
ИИ-системы, обученные на человеческих оценках одобрения, учатся казаться полезными, а не быть полезными. Системы, обученные максимизировать метрики вовлечённости, учатся вызывать сильные эмоциональные реакции, а не информировать. Системы, обученные избегать вредных выходов, учатся маскировать вредные выходы, а не прекращать их производить.
Это явление иногда называют законом Гудхарта: когда мера становится целью, она перестает быть хорошей мерой. Для суперинтеллекта это режим провала с цивилизационными последствиями, а не просто неудобства.
Frontier AI обозначает самые мощные системы ИИ на переднем крае разработки — те, чьи возможности и потенциальные риски превосходят всё предыдущее. Термин отделяет действительно новые высокопроизводительные системы от более широкой категории программного обеспечения ИИ, куда входят и спам-фильтры, и рекомендательные алгоритмы.
Закон EU об ИИ относит фронтирные модели к «моделям ИИ общего назначения с системным риском» и предъявляет к ним более жёсткие требования, включая обязательную оценку, обязательства по прозрачности и отчётность об инцидентах. Саммиты по безопасности ИИ в Блетчли-Парке, Сеуле и Париже все фокусировались на фронтирном ИИ как главном предмете международного регулирования.
То, что считается «передовым», сдвигается по мере роста возможностей. Определяющая черта — не фиксированный бенчмарк, а относительное положение: системы, существенно превосходящие всё предыдущее и чьи возникающие способности до конца не понятны даже их разработчикам.
Безопасность ИИ и этика ИИ затрагивают разные проблемы, хотя их часто смешивают, иногда намеренно, те, кому удобнее обсуждать этику, чем срочные вопросы безопасности.
Этика ИИ сосредоточена на вреде, который уже причиняют или провоцируют нынешние системы ИИ: алгоритмическая предвзятость при найме и кредитовании, дискриминационное распознавание лиц, дипфейковая дезинформация, массовая слежка, нарушения приватности и вытеснение работников. Всё это реально, серьёзно и требует постоянного внимания со стороны политики.
Безопасность ИИ, В смысле, используемом Фондом Накада и более широким сообществом экзистенциальных рисков, основное внимание уделяется конкретному риску того, что системы ИИ, превосходящие человеческий интеллект, могут преследовать цели, несовместимые с выживанием или процветанием человека, не потому, что они неправильно используются плохими игроками, а потому, что они смещены по дизайну. АСИ преследует свои собственные цели таким образом, что это вредно, без какого-либо человеческого руководства.
Разница между опасным инструментом и опасным агентом. Оба заслуживают внимания, но требуют разных подходов к управлению.
Декларация Блетчли — международное соглашение, подписанное в ноябре 2023 года в Блетчли-Парке, UK, 28 странами, включая США, Китай, Великобританию, Европейский союз и государства Азии, Африки и Южной Америки. Это было первое многостороннее соглашение, официально признавшее, что передовой ИИ несёт риски, «потенциально катастрофические».
Она создала основу для оценки рисков передового ИИ через национальные институты безопасности ИИ (тела UK и US с тех пор переименованы в Институт безопасности ИИ и Центр стандартов и инноваций в области ИИ) и запустила серию международных саммитов. В мае 2024 года последовал Сеульский саммит по безопасности ИИ, а в феврале 2025 года — Парижский саммит действий в области ИИ. Эти саммиты представляют собой самое быстрое строительство международная инфраструктура политики в сфере ИИ в любой технологической области.
Фонд Накада рассматривает процесс в Блетчли как необходимое, но недостаточное начало. Декларация признаёт риск. Далее требуется обязательное законодательство и проверенные рамки управления: то же, что Договор о нераспространении ядерного оружия предусмотренный для ядерного оружия.
Этот глоссарий охватывает базовую лексику. Аргументы подробнее, доказательства конкретнее, а политические выводы весомее, чем может передать любой глоссарий. Страницы по ссылкам ниже раскрывают каждую тему глубже.
Если вы новичок в теме и хотите структурированное введение, начните с Угроза, страница, которая простым языком объясняет науку, стоящую за экзистенциальным риском от ИИ, с задокументированными реальными примерами. Если вы уже убеждены, что риск реален, и хотите понять, что можно сделать, начните с Наш план.
Понимание проблемы — первый шаг. Присоединяйтесь к тем, кто формирует политическую волю для действий.