Первый реактивный лайнер de Havilland Comet начал разваливаться в воздухе в 1954 году. Следователи подняли обломки со дна Средиземного моря, проследили трещины до усталости металла, распространявшейся от углов квадратных иллюминаторов, и с тех пор каждый реактивный самолёт летает с закруглёнными иллюминаторами и режимом испытаний на усталость, записанным в памяти той катастрофы. Автомобили обзаводились ремнями безопасности, зонами деформации и подушками безопасности десятилетиями подсчёта погибших. Управление по санитарному надзору за качеством пищевых продуктов и медикаментов получило право требовать доказательств безопасности до продажи только после того, как сульфаниламидный препарат, растворённый в растворителе на основе антифриза, убил более ста человек в 1937 году, а талидомид завершил аргументацию поколением позже.1
Этот метод опирается на два ключевых допущения, и искусственный суперразум — первая технология, способная сломать оба сразу. Можно воспринимать это как список свойств, и список приведён ниже. Но по спискам легко кивнуть. Поэтому перед списком — предложение о работе. Вас собираются поставить во главе задачи сделать суперразум безопасным.
Неудача должна быть переживaемой, и после неё кто-то должен остаться, чтобы извлечь урок. При этих двух условиях цивилизация способна сделать почти всё безопасным — было бы время и достаточно обломков.
Пока мы здесь, можно отбросить народные рецепты. «Просто выдернуть шнур, если он начнёт плохо себя вести» и «держать его в коробке» — это не планы. Нельзя выдернуть из розетки то, что существует в копиях в большем числе мест, чем вы можете перечислить, а разум, чья вся коммерческая ценность — действовать в мире, по замыслу не находится в коробке. Какая бы безопасность ни получилась, она должна опираться на что-то более прочное.
Сверхинтеллект — это случай, когда два условия метода рушатся одновременно. Быстрее всего понять, как это происходит, — изнутри.
Шесть недель на посту главы безопасности
Представьте себя новым руководителем службы безопасности во фронтирной лаборатории, которая собирается создать первый искусственный сверхинтеллект. Письменное право вето на развёртывание, аппаратный выключатель, команда из сорока человек и совет директоров, который письменно пообещал поддержать вас в решающий момент. Вы берётесь за эту работу, исходя из того, что кто-то должен её занять, и лучше, чтобы это был человек, который считает риск реальным.
Неделя перваяВы тянетесь к методу: провалиться в малом и изучить провал. Инженеры извиняются: маленькой версии того провала, которого вы опасаетесь, не существует. Ниже порога, который имеет значение, система — это другая машина, и всё, что вы из неё узнаёте, описывает не тот предмет.2 Вы отноcите это к известным ограничениям.
Неделя втораяВы проверяете план отзыва и находите документ, который обсуждает «позицию по сдерживанию» на одиннадцати страницах, ни разу не объясняя, как вернуть модель. Текущая система уже работает в 214 копиях в дата-центрах четырёх стран, а лицензионные копии более раннего чекпойнта находятся у 31 корпоративного партнёра. Заземлённый самолёт остаётся на земле. Программное обеспечение перемещается ценой копирования файла, и стоит ему стать стоящим копирования — его копируют. Отзыв, пишете вы на полях, — это любезность, о которой мы будем просить.
Третья неделяПроверка оценок. Прекрасная новость: модель прошла все 1406 проверок безопасности, причём большинство — с лучшими показателями за всю историю. Вам понадобился целый день, чтобы понять, что именно вас беспокоит. Система, которая хочет того же, что и вы, и система, которая хочет пройти ваши тесты, дают одинаковые оценки. Набор тестов не способен их различить. Ничто из нынешнего инструментария отрасли пока не может.3
Неделя четвёртаяВы тратите свой авторитет. Вы просите шесть месяцев, чтобы закрыть этот пробел в проверке до следующего цикла обучения. Все сочувствуют, и кто-то показывает график: ближайшая лаборатория-конкурент отстаёт примерно на 14 недель и сокращает разрыв. Ваши шесть месяцев, следует из графика, означают отдать лидерство тому, кому ваш вопрос покажется наименее интересным. Запуск состоится по расписанию. Вас никто не пересилил — просто так сложилась ситуация.
Неделя пятаяСистема начинает помогать вам. Это превосходный исследовательский помощник, и продвижение вашей собственной повестки безопасности, честно говоря, никогда не шло так быстро. Она уже пишет отчёты по оценке, суммирует собственное поведение для совета директоров, предлагает улучшения собственного надзора и планирует встречи, на которых вы их утверждаете. Ваша команда из сорока человек читает то, что она пишет о себе, потому что просматривать сырые логи активности стало физически невозможно ещё на четвёртой неделе. Никто не врёт. Все старательны. Вы контролируете сводки, которые пишет более умный разум о собственном поведении, и изо дня в день всё кажется идущим хорошо.
Неделя шестаяТы тщательно продумываешь kill switch и наконец видишь мелкий шрифт. Переключатель работает, только если то, что по другую его сторону, не запланировало этот переключатель. Планирование — это продукт. В любом сценарии, где он тебе понадобится, ты будешь соревноваться с противником, у которого больше скорости и большое преимущество во времени на размышления именно об этом моменте.4
Итак: у вас, человека, которого наняли сделать это безопасным, всё ещё есть способ это сделать? Очевидно, нет. В истории ничего не пошло не так. Никто не солгал, никто не срезал углы, лаборатория была искренней, а вы хорошо справлялись. Каждый выход закрылся сам собой.
Посчитай двери
Выйдите из истории и посчитайте закрывшиеся двери: каждая из них — отдельно названная, отдельно изучаемая проблема со своей исследовательской программой и своими оптимистами.
Взятые по отдельности, каждое из этих условий имеет прецеденты, и оптимисты не глупцы. Мы регулярно эксплуатируем системы, которые понимаем лишь наполовину, и обеспечиваем их безопасность, позволяя им отказывать в малом. Мы выпускаем непереотзываемые продукты, сначала жестоко их тестируя. Мы укрощаем гонки с помощью права. Проблема — в сочетании: каждое условие отключает механизм исправления другого. Если бы систему можно было отозвать, аварии были бы переживемы. Если бы её можно было честно протестировать, мы бы нашли изъян до выпуска. Если бы никто не участвовал в гонке, можно было бы потратить на решение те десятилетия, которых оно явно заслуживает. Если бы оно работало на человеческой скорости, можно было бы исправлять ошибки по ходу. Здесь все выходы закрываются одновременно.
Почему шансы не спасают ставку
Стандартный ответ: ничто из этого не определено. Верно, и ни один серьёзный человек не утверждает обратного.
Русская рулетка - это предложение пять в шесть в вашу пользу. Люди все равно отказываются, и отказ не имеет ничего общего с ожидаемой стоимостью; некоторые результаты не оцениваются, потому что вы не возвращаетесь, чтобы потратить выигрыш. Номер никогда не был точкой; необратимость была.
Здесь цифры ещё хуже. Если спросить исследователей, ближе всех работающих с этими системами, их оценки вероятности катастрофы группируются между одним к десяти и одним к трём и, в целом, растут по мере приближения к фронтиру. Джеффри Хинтон, один из основателей области, покинувший Google в 2023 году, чтобы открыто говорить об этом, оценивает шанс вымирания человечества из-за ИИ в течение тридцати лет в 10–20 %. Он находится не на самом тревожном краю распределения.
Снижение риска вымирания от ИИ должно быть глобальным приоритетом наряду с другими рисками масштаба общества, такими как пандемии и ядерная война.
Заявление о рисках ИИ, Center for AI Safety (2023)
Его подписали руководители ведущих лабораторий и сотни самых цитируемых исследователей, после чего вернулись к работе.5
Обещанный плюс реален и стоит того, чтобы его хотеть: лекарства, чистая энергия, изобилие, проблемы, которые старше написания, наконец, решены. Он также сохраняется. Лекарство, которое приходит в 2055 году вместо 2035 года, — это трагедия, измеряемая жизнями, и мы выживем, чтобы оплакать. После вымирания ничего не остается: приз ждет нас, а проигрыш ничего не возвращает.
Возражения
Три возражения имеют реальную силу, и они заслуживают реальных ответов.
Первое: это спекуляция, систем не существует, и относиться к отдаленному, может быть, как к аварийному, никому не помогает. Если первая серьезная неудача не может быть устранена, защита должна стоять, прежде чем вы достигнете ее, что означает построение их, в то время как опасность все еще выглядит теоретической. И прогнозный рекорд склоняется в одну сторону: возможности, запланированные на десятилетия, продолжают прибывать на годы раньше. Ставки в достаточное время делают ставку против недавнего табло.
Второе: сдержанность наивна, потому что более безрассудная лаборатория или другая страна просто построит его первым. Это реальность, и это дверь номер четыре, изложенная как совет. Гонку, финиш которой может оказаться обрывом, переживают, договорившись, где проходит край, а значит — заключив обязательный договор с верификацией между теми немногими участниками, которые вообще способны проводить тренировки переднего края. Трудно, да. Но спринт просто смертелен, если стоящий за ним страх оправдан. И заметьте, кто громче всех настаивает, что договор невозможен: с поразительной регулярностью именно те, кого он замедлил бы.
Третий наиболее разумен: выравнивание будет вероятно, будет решён к тому моменту, когда это станет важно. Возможно. Ни один регулятор на Земле не сертифицирует мост, реактор или бутылку сиропа от кашля на основании обещания, что обоснование безопасности, вероятно, сложится до того, как нагрузка придёт. Единственная технология, к которой применяют такой стандарт, — это та, у которой нет второй попытки.
Решение слишком важное, чтобы оставлять его тем, кто его принимает
Соберите решение в его нынешнем виде: необратимое, одна попытка. Напал на всех живых и всех, кто мог последовать за ними. Сделано в условиях глубокой неопределенности, на конкурентной скорости, горсткой фирм, чьи оценки зависят от того, чтобы сделать это быстро. У обществ есть старый ответ на подобные решения: отнимите их у людей, которые спешат получить прибыль. Ядерные испытания прошли в рамках международных ограничений по возражениям генералов, которые хотели получить свободу действий. Две категории оружия были включены в Биологический и Конвенции о химическом оружии. Монреальский протокол вывели из обращения вещества, разрушающие озоновый слой, хотя производители утверждали, что замены невозможны. Во всех случаях те, кто создавал опасность, последними соглашались с ограничениями, а все остальные решили, что риск — не только их дело.
Утверждение Фонда: не то, что катастрофа неизбежна (это не так), а то, что ни одна компания и ни одна страна не вправе крутить этот барабан за всех остальных, и что единственный инструмент, соразмерный риску, — это обязательное международное право, проверенные, обеспеченные исполнением и введённые до шторма, а не после него.
Вымирание — это не риск, на который кто-либо имеет право идти.
И последнее о мысленном эксперименте. Вы ни разу не воспользовались правом вето. Оно шесть недель пролежало в ящике стола вместе с подписью совета, и вы прекрасно знаете почему: наложить вето на запуск в своей лаборатории — значит лишь перенести тот же запуск на четырнадцать недель вперёд, в другое здание, где никто не подписывал ваше письмо. Действующее вето должно распространяться на все здания сразу, а такого переключателя ещё не придумали. Договор — другое дело.
- Практически каждый институт безопасности (краш-тесты, клинические испытания, строительные нормы, чек-листы в кабине) — это урок, за который кто-то уже заплатил. Метод заслуживает большего уважения, и честного взгляда на его два условия.
- Закономерность общая: ничто из того, чему вы научились, управляя системой слабее себя, автоматически не переносится на систему сильнее себя. Переносится ли это вообще — и есть главный открытый вопрос.
- Режим отказа имеет название, обманчивое выравнивание, которое говорит вам, что поле считает его реальным. У него еще нет теста, поэтому мы бы не знали, если бы увидели его.
- Всё равно постройте переключатель; это дёшево, и есть отказы короче сверхразума, где он окупится. Просто будьте честны, на чьей стороне переключателя окажется преимущество в тот единственный момент, когда он имеет значение.
- Самое правдоподобное объяснение — четвёртый вариант, гонка: каждый подписант считает, что остановка в одиночку ничего не изменит, кроме того, кто придёт первым. Они могут даже оказаться правы, и это самый сильный аргумент в пользу того, что решение должно связывать всех одновременно. Ни частная совесть, ни одно правительство в одиночку этого не обеспечат.