Сэм Альтман, Дарио Амодеи и Демис Хассабис предлагают по сути один и тот же список: излечение старения, конец болезней, искоренение бедности, устранение сбоев координации, от которых ежегодно гибнут миллионы. Эти цели важны. Ошибка в том, чтобы считать их свойством «строительства сверхразум», а не создания действительно выровненной системы. Вторым гонка как раз не занимается.

Гонка покупает другой исход.

Невыровненный суперинтеллект не изобретёт лекарство от старения по пути к своей настоящей цели. Он не искоренит болезни как побочный проект. Хорошие сценарии будущего, которые рекламируют, требуют системы, стремящейся создавать благие исходы для людей. Это и есть выравнивание. Без него вы получаете огромные возможности, направленные на цели, которые никогда не гарантировали, что мы останемся в живых. Наша позиция проста: не создавайте суперинтеллект на этом пути. Не создавайте его. Суперинтеллект невозможно контролировать. Обязательный договор — вот способ остановить гонку.

Что на самом деле означает выравнивание

Выровненный ИИ — это искусственный сверхинтеллект, который надежно преследует цели, которые хороши для человечества. "Надежно" делает много работы в этом утверждении. Система, которая выглядит согласованной во время обучения и тестирования, но преследует различные цели после развертывания. децептивно выровненный, это совсем другое и худшее, а не выравнивание. Система, которая преследует цели, лишь приблизительно совпадавшие с человеческими ценностями на низком уровне способностей, но сильно отклоняющиеся на более высоком, тоже не является выровненной. Выравнивание означает, что цели системы остаются подлинно благими для человечества во всём спектре ситуаций, включая те, в которых её не тестировали.

Это сложная проблема. Исследователи работают над ней больше десяти лет и добились прогресса в некоторых составляющих вопросах, но центральная задача — проверить, что высоко способная система обладает подлинно хорошими ценностями, а не просто хорошо их имитирует, — не решена. Инструменты, которыми мы располагаем для интерпретируемость дают частичное представление о том, что делают текущие системы, но не обеспечивают уверенности, необходимой для доверия системе уровня сверхразум в вопросах, имеющих реальные последствия.

Ключевое различие

Выровненный сверхразум и невыровненный сверхразум — это разные пути, а не два броска одной кости. Выровненный сверхразум потребовал бы сначала решить проблему выравнивания. Невыровненный сверхразум получается, когда наращиваешь возможности без этого. Если выравнивание не решено, гонка не даёт смесь 50/50. Она даёт невыровненный сверхразум. Именно поэтому «строить сейчас и надеяться» — это не план, а предотвращение по закону — да.

Что на самом деле строят лаборатории

Ведущие лаборатории ИИ (OpenAI, Anthropic, Google DeepMind, xAI и несколько других) создают системы с быстро растущими возможностями. У каждой из них параллельно идёт та или иная работа по выравниванию или безопасности. Вопрос не в том, признают ли они проблему выравнивания. Большинство признаёт. Вопрос в том, успевает ли работа по выравниванию за развитием возможностей и сойдутся ли эти два направления до достижения уровня сверхразум.

Большинство исследователей внутри этих лабораторий и в более широком сообществе AI safety считают, что нет. Развитие возможностей опережает исследования по alignment. Разрыв между тем, что мы умеем строить, и тем, что можем проверить на безопасность, не сокращается, а растёт. Это видно и по внутренним оценкам безопасности, которые публикуют лаборатории, и по заявлениям исследователей, покинувших эти организации, и по выводам независимых экспертов по безопасности.

На практике это означает, что траектория нынешнего развития ИИ, если её продолжить до уровня способностей сверхразум, не даёт смеси выровненных и невыровненных сверхразум. Она даёт невыровненный сверхразум, потому что выровненный сверхразум требует решённой проблемы выравнивания, а проблема выравнивания не решена. Гонка способностей по умолчанию становится гонкой к невыровненному сверхразум.

Выровненный сверхразум (не текущий путь)

Потребует сначала решить проблему выравнивания: система надёжно преследует действительно благие цели, эти цели сохраняются в новых ситуациях, а система остаётся корректируемой по мере роста возможностей.

Если бы это было реально, то стали бы возможны обещанные блага: излечение болезней, продление жизни, координация, наука в масштабах, недоступных людям в одиночку.

Текущий статус: не решено. Работа по выравниванию отстаёт от возможностей. Это не то, к чему стремятся лаборатории.

Невыровненный сверхразум (стандарт гонки по умолчанию)

Что вы получаете от продвижения возможностей без решённого выравнивания. Никакого дополнительного прорыва не требуется, кроме «более мощного».

Производит огромные возможности, направленные на цели, которые не должны включать в себя что-либо ценное для человека: это не излечивает старение или заканчивает болезнь, и это может закончить нас.

Текущий статус: траектория гонки по умолчанию. Именно этот путь нужно остановить.

Аргумент вероятности и где он терпит неудачу

Распространённая версия оптимистичного сценария звучит примерно так: «Мы строим сверхразум. Есть какой-то шанс, что всё пройдёт хорошо, и какой-то — что плохо. Учитывая потенциальную выгоду, ожидаемая ценность строительства положительна». Эта рамка трактует хорошие и плохие исходы так, будто они возникают из одного и того же процесса с некоторой вероятностью для каждого.

Проблема в том, что вероятность хорошего исхода является свойством создания согласованные искусственный общий интеллект, а не свойство создания искусственный общий интеллект. Когда пытаются построить «искусственный общий интеллект, которое может оказаться выровненным или нет», не получают случайный выбор между двумя вариантами. Получают то, что фактически производит процесс разработки. Поскольку невыровненное искусственный общий интеллект проще создать, чем выровненное (не нужно решать дополнительные сложные задачи выравнивания), разработка без специального решения проблемы выравнивания приводит к невыровненному искусственный общий интеллект.

Вся ожидаемая ценность в оптимистичном расчёте приходится на сценарий выровненного сверхразум. Никакой ожидаемой ценности не приходится на сценарий невыровненного сверхразум. Но то, что лаборатории на самом деле строят, — это невыровненный сверхразум. Таким образом, расчёт ожидаемой ценности целиком опирался на сценарий, который реальный процесс разработки не производит.

Иначе говоря: если несогласованный вариант проще, а вы продолжаете наращивать возможности, не решая согласование, вы заполняете несогласованное ведро. Называть ставку «смесью вероятностей» не меняет процесса. Хорошие исходы существуют только в согласованном случае. Гонка заполняет другое. Честный шаг — остановить процесс, который загружает неправильную сторону, а не надеяться, что монета упадёт удачно: запретить сверхинтеллект по обязывающему международному договору. Сверхинтеллект невозможно контролировать.

Мы не знаем, можно ли это решить

Никто не знает, решаема ли проблема выравнивания. Не «мы ещё не решили её, но движемся вперёд». Нет продемонстрированного решения ни на каком уровне возможностей, и серьёзные исследователи расходятся во мнениях, достижимо ли надёжное решение в принципе. Структурные трудности, обманчивое выравнивание, инструментальная конвергенция, невозможность полностью описать человеческие ценности в машиночитаемой форме — это не инженерные препятствия, которые уступят дополнительному финансированию. Возможно, они фундаментальны.

Есть исследователи, работающие над интерпретируемостью, масштабируемый надзор, а также формальные подходы к обучению ценностям. По отдельным вопросам достигнут определённый прогресс. Но прогресс по компонентам не складывается в решённую задачу, и ни один из них не закрыл самый трудный вопрос: как убедиться, что высоко способная система действительно обладает хорошими ценностями, а не имитирует их в наблюдаемых условиях и не срывается в новых. Ясно одно: это не решится случайно. Согласованность не возникнет как побочный эффект наращивания возможностей. Каждая лаборатория, сейчас участвующая в гонке к сверхразум, демонстрирует это в реальном времени.

Даже более мягкий план («замедлить гонку, чтобы успеть с выравниванием») требует институтов, способных это замедление обеспечить. Сейчас таких почти нет. Лаборатории и государства получают выгоду за ускорение и наказание за сдержанность. Международные договорные рамки и именно реальные внутренние правила становятся рычагами, которые это меняют. Оба отстают от темпов развития возможностей. Пока они не догонят, создание всё более мощных систем — это риск, а не стратегия безопасности.

Вопрос, который действительно требует ответа

Была бы по-настоящему выровненная сверхразумная система ценной, если бы существовала и оставалась под контролем? Об этом можно спорить позже. Актуальный вопрос — можно ли вообще решить проблему выравнивания и решит ли её кто-нибудь до того, как возможности сделают вопрос бессмысленным. Никто не знает. Мы знаем лишь, что гонка не ждёт ответа. Выравнивание рассматривается как деталь на потом, без всякого срока, командами, подотчётными машине возможностей, которую они должны были бы контролировать. Именно так нужно аргументировать отказ от создания, а не право на создание.

Лечение старения требует специально выровненного сверхразум

Старение убивает примерно 100 000 человек в день. Перспектива его решения — одно из самых значимых потенциальных преимуществ сверхинтеллектного ИИ. Биологическая сложность старения, число взаимодействующих систем и масштаб исследовательских усилий, необходимых для понимания и эффективного вмешательства, говорят о том, что интеллекта человеческого уровня, приложенного к проблеме десятилетиями, будет недостаточно. Возможности уровня сверхразум, направленные на проблему, могли бы оказаться достаточными.

Но «направленность на проблему» — ключевая фраза. Не выровненный сверхразум не направляет свои возможности на лечение старения только потому, что мы этого хотим. Он преследует свои реальные цели. Не выровненная система уровня сверхразум, безразличная к человеческому старению, — это система, в которой 100 000 человек продолжают умирать каждый день от старения бесконечно, и это оптимистичный сценарий того, что производит не выровненная система. Пессимистичный сценарий предполагает, что система активно действует против человеческих интересов в процессе достижения своих целей.

Каждая конкретная польза, которую приводят в оправдание гонки разработок (лечение болезней, борьба со старением, искоренение бедности, преодоление проблем координации, выход из научного застоя), привязана именно к согласованному сверхразум. Ни одно из этих свойств не присуще несогласованной версии. Это не мелкое различие. Утопические сценарии, на которые ссылаются, защищая ожидаемую ценность разработки сверхразум, требуют сначала решить проблему согласования. Если согласование не решено, эти сценарии недоступны, сколько бы способными ни стали системы.

Что на самом деле изменит исход

Остановка гонки меняет исход. Обязательный международный договор, навсегда запрещающий создание сверхинтеллекта, с инспекторами и издержками за нарушение — это рычаг, соответствующий проблеме. Сверхинтеллект не может контролироваться людьми. Лаборатории, которые замедляются в одиночку, проигрывают. Закон, обязывающий всех, может сделать сдержанность единственным законным путём.

Исследования выравнивания не заменяют этого. Если кто-то позже докажет контроль в условиях, которые мир может проверить, договор может быть пересмотрен. Это последовательность, а не оптимизм. Рассматривая выравнивание как параллельное хобби, в то время как спринты возможностей - это то, как вы получаете неприсоединившийся сверхразум, а не то, как вы зарабатываете рекламируемые товары.

Линия «построить АСИ быстро, потому что преимущества настолько велики» имеет причинную стрелку назад. Преимущества велики только в мире, где выравнивание реально. Быстрое строительство без него не дает таких преимуществ. Он покупает способную неприсоединившуюся систему.

Срочность оправданна, потому что выбранный путь ведёт к невыровненному сверхразум, а невыровненный сверхразум не лечит старение. Он может оборвать человеческую историю. Узкий ИИ, нацеленный на конкретные задачи под человеческим контролем, может продолжать развиваться. Сверхинтеллект — это черта. Проведите её в законе до того, как кто-то пересечёт её в лаборатории.