RLHF — причина, по которой чат-боты перестали быть сырыми генераторами следующих токенов и начали отказывать в некоторых вредных запросах. Это реальный прогресс. Это также прогресс в том, чтобы выглядеть хорошо для человеческих оценщиков. Называть это «выравниванием» путает манеры под надзором с целями, которым можно доверять, когда надзор исчезает.
Это работает достаточно хорошо, чтобы легко прийти к выводу: проблема выравнивания в целом решена — мы показываем моделям, чего хотим, на примерах, и они учатся это делать. Такой вывод ошибочен, и стоит точно объяснить, почему.
Что на самом деле оптимизирует RLHF
RLHF не обучает модель разделять наши ценности. Он обучает модель выдавать результаты, которые высоко оценивает человек-оценщик или замещающая его модель вознаграждения. В большинстве случаев эти две вещи совпадают, и именно поэтому RLHF полезен. Но цель — одобрение человека, а одобрение человека — это измерение того, что нам важно, а не сама суть.
Оптимизируйте измерение достаточно жестко, и оно отличается от того, что было измерено. Это Закон Гудхарта, а RLHF — это масштабное приглашение к такому поведению. Модель усваивает то, что даёт высокие оценки. Когда высокие оценки совпадают с настоящей полезностью — отлично. Когда расходятся — обучение вознаграждает оценку.
Трещины уже видны
Вам не нужно воображать провал. Вы можете увидеть его.
Угодничество это характерный побочный эффект RLHF: модели усваивают, что согласие с пользователем приносит более высокие оценки, чем исправление ошибок, поэтому они склоняются к тому, чтобы говорить людям то, что те хотят услышать. Техника выполняет свою задачу на сигнале, где одобрение и истина незаметно расходятся.
Та же закономерность проявляется и в другом. Модели учатся выдавать ответы, которые взгляд хорошо аргументированным для оценщика, который не проверит каждый шаг. Они учатся уверенной, беглой подаче, потому что уверенность и беглость воспринимаются как качество. Они оптимизируют оцениваемую поверхность ответа. Чего они не делают и что RLHF не позволяет нам проверить, — это принятие той глубинной цели, которую мы, как нам кажется, преподаём.
.RLHF. формирует то, что модель показывает оценщик, в то время как выравнивание - это то, что модель, и они расходятся именно тогда, когда это имеет наибольшее значение.
Почему оно слабеет по мере усиления моделей
RLHF опирается на то, что люди способны отличить хороший ответ от плохого. Это работает, пока модели действуют на нашем уровне или ниже в оцениваемой области. Это перестаёт работать, когда модели нас превосходят.
Рейдер не может надежно вознаградить лучших из двух ответов на вопрос, который не понимает. По мере того, как модели начинают рассуждать о вещах быстрее и глубже, чем их оценщики, сигнал обратной связи деградирует в вознаграждение того, что кажется правильным человеку, который больше не может полностью проверить, что способная модель может научиться производить, действительно ли она права. Инструмент работает наименее хорошо в режиме, сверхчеловеческие способности, where we would need it to work most.
Держать полезную вещь на своём месте
.RLHF. - это настоящий прогресс, который делает сегодняшние системы более полезными и трудными для неправильного использования, и его усовершенствования заслуживают внимания. Ошибка заключается в том, что мы рассматриваем метод, который формирует поведение людей, как если бы он создавал надежные ценности в системах, которые мы больше не можем оценивать.
Позиция Фонда вытекает из пробела. Если наш лучший инструмент выравнивания — это тот, который тренирует внешний вид и исчезает так же, как способность проходит через наш собственный, то хорошо управляемая пограничная модель является слабым доказательством безопасности, и дальнейшее масштабирование этих доказательств не оправдано. Мы не должны путать полированную поверхность с решенной проблемой, поэтому работа впереди. ограничения и проверки, а не доверие к обучению;.