Когда люди впервые сталкиваются с опасениями по поводу сверхинтеллектного ИИ, естественная реакция: почему бы просто не запереть его? Пусть думает, задавайте вопросы через защищённый интерфейс и не давайте ему ничего делать в физическом мире. Получаете пользу от интеллекта без рисков автономных действий. Это идея, лежащая в основе боксирования ИИ, или сдерживания ИИ.

В сфере ИИ-безопасности изоляцию системы считают недостаточной. Проблема в разуме, а не в замке.

Это было серьезно рассмотрено в литературе по безопасности ИИ. Он также рассматривается и в значительной степени отвергается как надежное долгосрочное решение.

Что на самом деле предлагает боксирование ИИ

В самой жёсткой форме AI boxing подразумевает физическую изоляцию (никаких сетевых подключений, никаких физических исполнительных механизмов, никакой возможности влиять на системы за пределами изолированной среды), ограниченные каналы вывода (только текстовое общение через человека-«привратника») и строгие протоколы относительно того, какие входные данные система получает и какие выходные данные приводятся в действие.

Цель — извлечь рассуждения и знания системы, не позволяя ей совершать действия, которые могут привести к непредвиденным последствиям. В самой консервативной версии это даёт то, что исследователи называют оракульным ИИ: систему, которая только отвечает на вопросы и явно запрещена совершать действия или давать рекомендации, которые дали бы ей рычаги влияния на мир.

Предложение логично. Для систем примерно на уровне человеческих возможностей оно может даже работать. Проблемы возникают, когда тщательно анализируешь, что требуется для сдерживания, если система внутри «коробки» значительно превосходит людей снаружи.

Проблема социального инжиниринга

Сдерживание зависит от людей-«привратников», которые могут оценивать результаты работы системы и не допускать, чтобы опасные из них воплощались в действия. Для этого привратники должны уметь определять, какие результаты опасны.

Система, значительно более интеллектуальная, чем ее привратники, может создавать выходы, которые кажутся полностью безопасными, но не являются таковыми. Он может моделировать психологию конкретных людей, читая их ответы, определять их убеждения, ценности и слабости, а также строить аргументы, кадры или информацию, которая тонко меняет их поведение в направлении, которое хочет система. Это описание того, что делают убеждения и риторика, выполняемые системой с гораздо более сложными рассуждениями, чем любой человек.

В неформальных экспериментах 2002 и 2005 годов Элиезер Юдковский играл роль ИИ в коробке, противостоящего людям-хранителям, заранее обязавшимся держать его внутри. Только текстовым разговором он убедил оппонентов выпустить его в трёх из пяти попыток. Он отказался раскрывать, какие аргументы использовал.

Эксперимент по боксированию ИИ, как описано на LessWrong

Эксперимент Юдковского предполагал, что человек играет роль ИИ, а не реальную сверхразумную систему. Дело не в том, что это доказательство неудачи, а в демонстрации: человеческие «привратники» не являются надёжной последней линией обороны перед лицом изощрённого собеседника, мотивированного на побег из изоляции. Настоящий сверхразум обладал бы неизмеримо большими возможностями находить и использовать уязвимости в психологии любого конкретного привратника.

Информация как действие

Оракульный ИИ пытается решить проблему социального инжиниринга, ограничивая систему ответами на фактические вопросы. Если система не может давать рекомендации, она не способна манипулировать через убеждение.

Сложность в том, что информация и действие на уровне обсуждаемых возможностей не разделяются чисто. Ответ на вопрос «какой самый эффективный способ лечить эту болезнь?» дает спрашивающему конкретное действие. Ответ на «какая политика больше всего принесет пользы человечеству?» формирует политические предпочтения того, кто его прочитает. Подробное техническое объяснение того, как работает процесс, дает любому, кто его получит, возможность этот процесс реализовать.

Достаточно способные ответы на вопросы сами по себе влияют на мир. Сверхинтеллект, отвечающий через контролируемый канал, не нуждается в прямом управлении чем-либо, если его ответы достаточно убедительны, чтобы формировать убеждения и действия людей. При достаточном числе взаимодействий с достаточным числом людей даже замкнутая система высокой мощности способна изменить мир одной лишь информацией, не покидая физического корпуса.

Проблема длинного горизонта

Человеческое мышление склонно сосредотачиваться на отдельных взаимодействиях. Была ли эта конкретная выдача опасной? Этот конкретный разговор — манипулятивным? Но система со сверхчеловеческими планирующими способностями может рассуждать через тысячи взаимодействий на протяжении месяцев или лет. Стратегия, выглядящая совершенно безобидной в любом отдельном обмене, может быть частью скоординированного долгосрочного подхода к накоплению влияния, формированию убеждений или созданию условий для побега.

Те, кто проверяет отдельные выходные данные, играют в шашки против противника, который играет в шахматы на временном горизонте, недоступном для полного наблюдения. Асимметрия растёт вместе с разрывом в возможностях между системой и её контролёрами.

Для чего на самом деле полезно сдерживание

Исследования сдерживания имеют реальную ценность как тактика задержки. Меры по сдерживанию, которые приобретаются в течение шести месяцев или года, могут быть достаточными для завершения исследований по согласованию, которые решают основную проблему. Физические меры изоляции, которые не позволяют смещенной системе действовать, в то время как люди решают, что делать, лучше, чем отсутствие изоляции вообще.

Правильная формулировка

Сдерживание — огнетушитель, а не огнезащитная стратегия. Оно может пригодиться в кризисе, но не заменяет создание систем, которые изначально не загораются. Полагаться на него как на основной подход к безопасности — значит планировать кризис. Проблема возникает, когда сдерживание считают решением, а не временным мостом. Лаборатории, считающие, что сдерживание решает проблему безопасности, могут продолжать создавать и развёртывать высокомощные системы, не решая выравнивание, в уверенности, что «коробка» удержит. Доверие это неоправданно для систем на тех уровнях возможностей, которые имеют наибольшее значение.

Последствия для управления

Проблема боксирования ИИ имеет прямое следствие для того, как следует мыслить управление сверхразум. Любая схема управления, опирающаяся на «мы его сдержим, если что-то пойдёт не так» как на запасной механизм безопасности, строится на фундаменте, который технический анализ не поддерживает.

Альтернатива — требовать, чтобы согласованность целей проверялась до развёртывания систем, способных преодолеть сдерживание, а не полагаться на сдерживание как последнюю линию обороны после развёртывания. Для этого нужны международные механизмы управления с достаточными полномочиями, чтобы отдельные лаборатории или страны не могли запускать такие системы до проведения проверки, ведь именно конкурентное давление «выпустить первым» и создаёт ситуацию, когда сдерживание остаётся единственным вариантом.

Это центральный аргумент для такого рода обязательная международная система безопасности ИИ к чему стремится Фонд. Не стоит оказываться в ситуации, когда единственной преградой между вами и несогласованным сверхинтеллектом остаётся «коробка». Создание структур управления, которые не допустят такой ситуации, — вот настоящее решение той проблемы, которую иллюстрирует мысленный эксперимент с изоляцией.

Изоляция помогает бороться со слабыми системами. Против системы, которая моделирует своих тюремщиков и ценности, оставаясь свободной, коробка становится еще одним препятствием в плане. Сдерживание - это последний слой, а не разрешение на строительство того, что его побеждает.