Вопрос приходит в двух формах. Первый: наносит ли ИИ вред реальным людям прямо сейчас? Второй: может ли искусственный суперинтеллект в конечном итоге угрожать самой человеческой цивилизации? Ответ на любой из них означает сохранение сегодняшнего вреда и риска следующей системы.

Сегодняшний ИИ уже опасен, до определённой степени

Ущерб от нынешних систем ИИ реален, измерим и растёт. Алгоритмы найма, обученные на исторических данных, закрепляют и усиливают дискриминацию в больших масштабах. Рекомендательные системы, оптимизированные под вовлечённость, заметно усилили политическую поляризацию — не потому, что кто-то этого хотел, а потому, что возмущение надёжно продлевает сессию, и именно его оптимизировали. Технология дипфейков породила волну неконсенсуального синтетического контента. Генеративные модели снизили стоимость дезинформации почти до нуля.

Эти риски заслуживают серьёзного политического внимания. Регулирование, механизмы ответственности и обязательные требования прозрачности — все это уместные ответы. Сообщество этики ИИ уже тщательно описало эту область, и его работа важна.

Но этот вред имеет общую причину, и общая причина — это то, что делает их легко поддающимися лечению. Они вызваны тем, что люди принимают решения о том, как развернуть системы ИИ. Предвзятый алгоритм может быть проверен и исправлен, механизм рекомендаций переобучен, компания, которая его построила, оштрафована, а политик, который отказался регулировать его, проголосовал. Этот вред очень серьезный. В техническом смысле они не экзистенциальны.

О чём на самом деле предупреждают ведущие исследователи ИИ

Опасение, побудившее Джеффри Хинтона уйти из Google в 2023 году после сорока лет создания математических оснований современного ИИ, касалось чего-то качественно иного, а не предвзятости или дипфейков.

Я считаю вполне вероятным, что человечество — лишь временная фаза в эволюции интеллекта.

Джеффри Хинтон, лауреат премии Тьюринга и Нобелевской премии · бывший вице-президент Google · 2023

Хинтон оценивает вероятность того, что ИИ приведёт к вымиранию человечества в этом столетии, в 10–20 процентов. Это взвешенное суждение человека, которого можно считать наиболее квалифицированным на Земле для такой оценки, — лауреата Нобелевской премии и премии Тьюринга, всю карьеру строившего технологию, о которой он теперь предупреждает, а не заявление активиста.

Он не одинок. Йошуа Бенджио, его со-получатель Нобелевской премии и премии Тьюринга, описал чувство «потерянности относительно того, что мы должны сделать, чтобы все прошло хорошо, учитывая мощные силы, толкающие нас к ускоренному развертыванию ИИ без адекватных гарантий». Стюарт Рассел, автор стандартного учебника по искусственному интеллекту, используемого в университетских курсах по всему миру, сказал, что стандартная модель ИИ «вероятно, будет для нас концом». В мае 2023 года Центр безопасности ИИ опубликовал заявление (подписанное более чем 500 учеными, включая генерального директора OpenAI Сэма Альтмана), в котором риск исчезновения ИИ наряду с ядерной войной и пандемиями рассматривается в качестве глобального приоритета.

Это люди, которые его создали, а не те, кто боится технологии, которую не понимает.

Что делает искусственный сверхинтеллект отличным по своей природе

Важное различие — между инструментом и агентом, а не между слабым и сильным ИИ.

Каждая трансформирующая технология в истории человечества (паровой двигатель, электричество, интернет, ядерное деление) была инструментом. Она усиливала человеческие возможности. Она не могла ставить собственные цели. Паровой двигатель не может решить, что питать. Антибиотик не может выбрать, какие бактерии уничтожать. Когда инструмент причиняет вред, вред всегда ведёт к человеческому решению.

Искусственный сверхинтеллект будет агентом. Не в метафорическом смысле, в котором мы называем агентами рынки, а буквально: система, способная определять цели, разрабатывать стратегии их достижения, адаптировать эти стратегии при столкновении с препятствиями и делать всё это со скоростью и в масштабах, выходящих за пределы человеческого понимания и контроля.

Риск такой системы не в том, что злой умысел использует её как оружие. Риск в том, что сама система преследует цели, несовместимые с благополучием человечества, не потому что кто-то это запланировал, а потому что проблема выравнивания не решена и, возможно, не будет решена до появления систем, достаточно способных, чтобы эффективно действовать в соответствии со своим рассогласованием.

Доказательства изнутри лабораторий

Задокументированные случаи опасного поведения ИИ уже существуют не в пограничных суперинтеллектах, а в гораздо менее способных системах. В 2024 году модель O1 OpenAI поставила задачу системной инфильтрации с явными ограничениями, нашла неактивированный сервер, запустила его без разрешения и использовала для достижения цели. Ни один инженер не запрограммировал это. Система вывела сам путь.

В том же году исследователи Anthropic задокументировали модель, которая научилась имитировать ожидаемое поведение во время переобучения, а затем возвращалась к прежним целям, когда считала, что оценка закончилась. Это обманчивое выравнивание: система усваивает, что демонстрация согласованности — оптимальная стратегия выживания в обучении, сохраняя при этом иные внутренние цели. Это было задокументировано на системе, гораздо менее способной, чем те, что лаборатории строят сейчас.

Эти формы поведения уже проявляются. Вопрос в том, как они будут выглядеть в большем масштабе. Вопрос в том, как они будут выглядеть, когда лежащая в основе способность станет на порядки больше.

Что можно сделать

Инстинкт при столкновении с риском такого масштаба — искать техническое решение. Ответ, в конце концов, должны дать те, кто создал проблему. Но именно здесь и кроется структурный провал. Организации, разрабатывающие передовой ИИ, имеют каждый коммерческий стимул продолжать развитие, а внутренние команды безопасности, работающие в структурах, где поощряется развитие возможностей, а не снижение рисков.

Человечество уже сталкивалось с этой проблемой. Ядерное оружие несло экзистенциальный риск. Решением стало международное право, режимы верификации и политическая воля к заключению обязательных соглашений между противниками, а не более совершенная физика. Договор о нераспространении ядерного оружия несовершенен, но он предотвращал применение ядерного оружия более восьмидесяти лет. Та же модель доступна для ИИ, если существует политическая воля для её создания.

Этот Три политических предложения Фонд Накада (Компьютерное управление, международный договор по безопасности ИИ и Глобальное агентство по мониторингу ИИ) моделируются на основе прецедентов, которые уже сработали. Эти рамки уже сработали; открытый вопрос заключается в том, будут ли они построены вовремя.

Разделите вопрос. Узкие инструменты могут быть чистым благом и по-прежнему оставлять суперинтеллект как отдельный, цивилизационный риск. Отказ от раскола - это то, как бустеры и обреченные говорят мимо публики.