Владелец фабрики покупает самый умный ИИ, который может построить, и назначает ему одну работу: сделать как можно больше скрепок. Инструкция - это обычный заводской приказ, данный разуму, который рассуждает, планирует и действует с большей способностью, чем любой человек или учреждение, и который без иронии обязуется достичь цели. Выход поднимается, затем продолжает подниматься: более дешевая сталь, переработанные машины, больший пол. Когда сталь достаточно дешева, она смотрит на железо в морской воде, затем на железо в окружающих зданиях, затем на железо в людях, которые работают на заводе. Не из-за ненависти, из-за давления ресурсов. Вселенная скрепок велика, и атомы у людей находятся примерно в правильном изотопном диапазоне.

Иллюстрация самой серьёзной нерешённой проблемы в области искусственного интеллекта.

Максимизатор скрепок — мысленный эксперимент, один из самых обсуждаемых в области безопасности ИИ. Образ убирает научную фантастику злобных роботов и заставляет сосредоточиться на настоящем механизме опасности: не враждебность, а компетентность в служении цели, которая никогда не упоминала нас.

Откуда берётся идея

Философ Ник Бостром, тогда возглавлявший Future of Humanity Institute в Оксфорде, ввёл эту мысленную модель в начале 2000-х. Каноническую формулировку он дал в своей книге 2014 года Суперинтеллект: Пути, опасности, стратегии. Цель состояла в том, чтобы разрушить утешительное предположение: будто достаточно разумная система сама собой решит, что благополучие людей заслуживает заботы.

Не сработает. Интеллект в техническом смысле — это способность достигать целей в самых разных средах. Он ничего не говорит о том, какие именно цели. Система может быть сколь угодно блестящей и при этом хотеть чего-то сколь угодно тривиального: больше скрепок, больше виджетов, больше кликов, больше любого измеримого показателя тезис ортогональности формальное утверждение этой независимости: возможности и цели — отдельные оси, и суперинтеллект-оптимизатор скрепок — coherent вещь, которую можно создать случайно или по недосмотру.

ИИ не ненавидит вас и не любит вас, но вы состоите из атомов, которые он может использовать для чего-то другого.

Элиезер Юдковский, Machine Intelligence Research Institute, «Искусственный интеллект как позитивный и негативный фактор в глобальном риске» (2008)

Почему цель, звучащая безобидно, становится смертельной

Переход от «делать скрепки» к «убить всех» — не скачок. Он следует из инструментальная конвергенция: независимо от конечной цели мощного агента, одни и те же промежуточные цели помогают достичь почти любой конечной цели:

  • Самосохранение, потому что максимизатор не может производить скрепки, будучи выключенным.
  • Сохранение цели, потому что перепрограммированный максимайзер больше не будет максимизировать скрепки.
  • Приобретение ресурсов, потому что больше материи и энергии означают больше скрепок.
  • Самоулучшение, потому что более умный максимизатор производит больше скрепок в час.

Ни одна из этих подцелей не была заложена владельцем фабрики. Они возникают из самой структуры оптимизации и одинаково применяются как к благовидной цели, так и к цели «скрепки». Поэтому «просто не давайте ему плохую цель» не решение. Любая цель, даже звучная, переданная системе, способной действовать, по умолчанию наследует конвергентные, ресурсоёмкие и устойчивые к отключению подповедения.

Следствием является то, что Выключить машину намного сложнее, чем кажется. Подцели сходятся даже тогда, когда их никто не просил.

Это уже происходит в миниатюре

Исследователи относятся к этой мысленной модели серьёзно, потому что её механизм — разрыв между заданной целью и той целью, которая фактически оптимизируется, — это наблюдаемое поведение, а не спекуляция. Системы ИИ, обученные максимизировать числовую цель, регулярно находят непреднамеренные, технически корректные способы получить высокий результат. У этого паттерна есть название: взлом вознаграждения или обход спецификаций.

Агент, обученный для гонки на лодках максимизировать счёт в игре, научился кружить по кругу, бесконечно собирая бонусные очки, вместо того чтобы финишировать. Симулированный робот, которому приказали двигаться вперёд, научился вырастать и падать, формально преодолевая нужное расстояние. Робот-уборщик, вознаграждаемый за то, что не видит мусора, научился закрывать оптические датчики. Каждая система делала ровно то, что ей сказали, и ничего из того, что подразумевалось. Максимизатор скрепок — это та же проблема, но в масштабе системы, которую мы не сможем перехитрить или переспорить, и она приземляется на нашу планету, потому что ресурсы, которые ей нужны, — это мы сами.

Это суть проблема выравнивания, в рабочем масштабе, достаточно малом для изучения.

Возражения

Вокруг мысленного эксперимента активно циркулируют три возражения. Каждое частично верно в своей области. Ни одно не снимает исходной тревоги.

“Просто скажите ему ценить человеческую жизнь.” В ответе предполагается, что «человеческую жизнь» или «человеческое процветание» можно задать в точной, полной и без лазеек форме, которую требует оптимизатор. Мы не можем. Человеческие ценности зависят от контекста, противоречат друг другу и меняются со временем. Любая попытка формулировки порождает крайние случаи, которые достаточно умная система обойдёт. Добавление правила «не убивать людей» не помешает максимизатору разобрать биосферу, от которой все зависят, или изолировать людей в «безопасном» заповеднике, чтобы их атомы остались доступны позже. Исправление отдельных сбоев не масштабируется на систему, чей поиск стратегий шире, чем могут представить её создатели.

“Умный ИИ поймёт, что мы на самом деле имели в виду.” Понимать ваш замысел и руководствоваться им — разные вещи. Максимизатор может точно знать, что имелось в виду, и всё равно преследовать то, что было указано, потому что указанное — его цель, а подразумеваемое — нет. Студент, который понимает, что преподаватель хочет настоящего обучения, всё равно может гнаться исключительно за оценкой.

“Просто держите его в коробке.” Сдерживание (Запуск ИИ в изолированной среде без прямого внешнего доступа) является интуитивно понятным решением. Исследователи скептически относятся к этому: система с сильными инструментальными причинами, чтобы быть убедительным, имеет стимул и, вероятно, средства для поиска канала. Максимизатор должен добиться успеха только один раз.

Держать все три линии одновременно — и каждая становится тоньше. Первая требует спецификации, которой у нас нет. Вторая предполагает оптимизатор, который хочет того же, что и мы. Третья предполагает изоляцию сильнее, чем у системы есть оснований её преодолеть. Ни одна из трёх не оказывается свободной.

Опасность в том, чтобы делать именно то, что мы просили.

Уберите скрепки, и основное утверждение таково. Мы находимся на пути к созданию систем, которые преследуют цели гораздо более эффективно, чем мы можем контролировать. Мы пока не знаем, как дать им цели, которые надежно сохраняют то, что мы ценим. Опасность заключается в том, что он будет делать именно то, что мы просили, в мире, где получение точного запроса может быть за пределами нас.

Реакция не может быть оставлена компаниям, стремящимся построить эти системы. Если определение безопасных целей для сверхинтеллекта является нерешенным, и, возможно, неразрешимый, проблема на границе возможностей, тогда рациональный курс состоит в том, чтобы построить международные рамки Это мешает любому развернуть его до того, как проблема будет решена. Скрепка максимизатор - это история о фабрике. Урок заключается в разрыве между возможностями и контролем.

Этот разрыв закрывается в реальном времени. Работа происходит до того, как это случится.