Конституционный ИИ — метод обучения, разработанный Anthropic. Идея в том, чтобы уменьшить зависимость поведения модели от ручной разметки вредных выходов людьми и вместо этого заставить модель оценивать собственные ответы по письменному набору принципов, называемому конституцией.

На практике это работает в два этапа. Сначала модель генерирует ответ, затем критикует его по конституции и пересматривает, обучаясь на собственных исправлениях. Во-вторых, модель сравнивает пары ответов и оценивает, какой лучше удовлетворяет принципам, и эти оценки обучают её примерно так же, как человеческие ранжирования в RLHF. Поскольку обратная связь исходит от модели, применяющей конституцию, а не от людей, подход иногда называют обучением с подкреплением на основе обратной связи от ИИ.

Что в нём правильно

Реальные преимущества существуют, и их стоит открыто признать.

  • Принципы явные. Вместо ценностей, подразумеваемых тысячами отдельных человеческих оценок, существует письменный документ, который можно прочитать, обсудить и пересмотреть. Это прозрачнее, чем груда рейтингов.
  • Он масштабирует генерацию обратной связи. Человеческая разметка вредного контента медленна, дорога и тяжела для разметчиков. Если модель берёт на себя большую часть этой работы, узкое место исчезает.
  • Это повышает согласованность. Единый письменный стандарт, применяемый одинаково, снижает шум и разброс, неизбежные при оценках разных людей в разные дни.

Это настоящие инженерные достижения, и конституционный ИИ уже дал модели, которые одновременно полезнее и реже допускают очевидный вред. Фонд не намерен принижать полезную работу.

Что оно не решает

Более трудные вопросы сохраняются методом в целости, и важно понять почему.

Метод по-прежнему оптимизирует модель под соответствие заявленному стандарту, оцениваемому моделью. Он выводит человека из цикла оценки каждого ответа и не меняет сути проблемы: система обучается выдавать выходы, которые хорошо оцениваются относительно цели. Если конституция неполна или её принципы конфликтуют в непредвиденной ситуации, модель оптимизирует букву написанного, с тем же Goodhart те же самые давления. Запись ценностей в виде конституции не решает трудность их точного определения, а лишь переносит её в текст документа.

Остаются две более глубокие ограниченности. Метод формирует поведение и не даёт гарантий относительно внутренних целей модели, поэтому разрыв между кажущимся выравниванием и реальным выравниванием внутреннее выравнивание проблема всё ещё открыта. И она опирается на собственную оценку моделью своих выходов, которая надёжна лишь в той мере, в какой модель честна и способна судить, — а именно этого мы не можем предположить у системы, приближающейся к нашему уровню или превосходящей его.

Конституционный ИИ — лучший способ направлять поведение. Направление поведения никогда не было той частью выравнивания, которую мы не умели делать.

Сохраняя пропорции

Конституционный ИИ является хорошим примером модели, которую Фонд внимательно наблюдает: реальный, ценный прогресс в области безопасности, который легко перечитать. Подобные методы делают существующие модели более управляемыми и прозрачными в отношении их стандартов. Они не показывают, что мы можем выровнять систему, которая нас переосмысляет, и они не закрывают пробел в проверке, который включает весь наш аргумент. Прогресс в обучении приветствуется. Это не является причиной для сохранить способность масштабирования при условии, что остальные будут следовать.