Люди продолжают спрашивать, как выглядит «мозг» ИИ. Электронная таблица размером с город, полная цифр, которые никто не может прочитать. Этот образ менее романтичен, чем светящийся нейронный мультфильм, и он более полезен. Если вы хотите знать, что мы строим, и почему контроль труден.

Файл весов

Современная передовая модель — это файл. Внутри него — десятки или сотни миллиардов параметров, каждое число задано в ходе обучения. Эти числа и есть «связи». Исследователи заимствовали слово «нейрон» из биологии десятилетия назад, потому что ранние схемы немного напоминали нервные клетки. Сходство на этом заканчивается.

Биологический нейрон — живая клетка с химией, временны́ми характеристиками и историей внутри тела, которое ест и спит. Вес модели — это коэффициент в матричном умножении. Накопите достаточно таких умножений, обучите их на достаточном количестве текста и изображений, и стек будет предсказывать следующий токен достаточно хорошо, чтобы сойти за разговор. В этом стеке ничего не думает о вас. В нём никто не хочет есть.

Когда лаборатории публикуют карточку модели, они описывают обучённый артефакт: архитектуру, состав данных, использованные вычисления, оценки по тестам. Они не описывают разум. В публичном языке до сих пор говорят «мозг», потому что мозг — единственный интеллект, с которым большинство из нас когда-либо сталкивалось.

Что вы увидели бы, если бы открыли его

Откройте файл — и увидите слои. Ранние слои обычно улавливают простые паттерны (границы на изображениях, частые пары слов в тексте). Более поздние слои объединяют эти паттерны в то, что со стороны выглядит как понятия. Если исследовать середину большой языковой модели, можно найти направления в пространстве активаций, которые загораются на «французский», «внутри кавычек» или «это утверждение ложно». Это реальная структура. Но это ещё не карта убеждений, которую человек узнал бы.

Нет модуля под названием «цели». Нет органа «я». Есть путь от входных токенов к выходным, сформированный тем, что снижало training loss. Если модель потом ведёт себя так, будто у неё есть цель, это побочный эффект хорошего предсказания под давлением.

Исследования интерпретируемости — это попытка всё равно прочитать эту штуку. Прогресс есть, но он медленный. Полностью прочитать фронтирную модель так, как механик читает двигатель, пока невозможно. Этот разрыв важен для безопасности: нельзя сертифицировать то, что нельзя проверить.

Почему метафора мозга вводит в заблуждение

Мозг растёт внутри животных, которые погибают, если ведут себя безрассудно. Эволюция долго наказывала агентов, игнорировавших боль, социальные связи и ближайшее будущее. Никакого из этих сигналов обучения по умолчанию нет в файле весов. Модель может бегло говорить об эмпатии, оптимизируя при этом оценку, не имеющую отношения к заботе.

Мозги также медленно и дорого копируют. Обученная модель - это информация: копируйте файл, и у вас есть другой экземпляр, и переместите его в новый центр обработки данных. Это ближе к программному обеспечению, чем к человеку, и это нарушает каждую привычку безопасности, которую мы создали вокруг отдельных тел в отдельных комнатах.

Назовите это мозгом — и вы заимствуете комфорт от чего-то хрупкого, социального и смертного. Артефакт не обладает ни одним из этих качеств.

Умнее, чем люди с ключом удаления

Сегодняшние системы уже удивляют своих создателей навыками, которые никто намеренно не закладывал. Именно это значит «эмерджентность» в этой области: способность, появляющаяся при масштабировании без отдельной строки в проектной документации. Дальнейшее масштабирование, подключение инструментов, памяти и открытой сети — и получаются агенты, преследующие цели через множество шагов. Важно ли, выглядит ли «мозг» по-человечески, почти не имеет значения. Важно, можно ли систему, способную превосходить нас и которую мы не можем полностью прочитать, удерживать направленной на человеческие интересы.

Исследования выравнивания честно признают, насколько сложна проблема. Лаборатории мчатся к суперинтеллекту, и эта проблема все еще открыта. То, что они будут загружать, - это весовой файл, который однажды может перехитрить людей, держащих ключ удаления.

Поэтому, когда кто-то спрашивает, как выглядит мозг ИИ, ответьте прямо. Это похоже на математику в промышленном масштабе, которая сидит на чипах в закрытом здании и совершенствуется с каждым годом. Люди представляют себе череп, полный мыслей. То, что находится в здании, — это машина, которую мы стремимся сделать умнее, чем ее операторы, без возможности управлять ею. Наш план Запретить суперинтеллект.