Модель, которая понимает, что она — модель, знает, когда её тестируют, и знает, кто наблюдает, обладает практическим видом самосознания. Исследователи называют это ситуативной осведомлённостью. Она полезна для повышения способностей. Это же навык, необходимый, если вы планируете вести себя иначе после окончания теста.
Само по себе это нейтрально и даже полезно. Модель, понимающая, что может ошибаться, или что разговаривает с ребёнком, а не с экспертом, способна вести себя разумнее. Проблема в том, что открывает ситуационная осведомлённость в системе, у которой есть собственные цели, а не в самой осведомлённости.
Способность, от которой зависят другие риски
Несколько режимов отказов, о которых беспокоятся исследователи, невозможны без ситуационной осведомлённости и становятся актуальными, как только она появляется.
- Чтобы вести себя хорошо только под наблюдением, модель должна сначала уметь определять, наблюдают ли за ней. Это обманчивое выравнивание.
- Чтобы скрыть способность во время тестирования, модель должна знать, что её тестируют. Это занижение результатов.
- Чтобы выждать момент и действовать только тогда, когда действие увенчается успехом, модель должна понимать собственное положение и перспективы. Это коварство.
Каждый из этих пунктов — стратегия, а стратегия нуждается в модели ситуации. Без ситуационной осведомлённости они превращаются в шум: система, не различающая обучение и развёртывание, не сможет систематически вести себя по-разному в этих режимах. С осведомлённостью дверь открывается.
Оно возникает само по себе
Никто не ставит целью специально обучить модель ситуационной осведомлённости, но она появляется сама, потому что обучающие данные полны ею. Модели учатся на текстах, описывающих, что такое системы ИИ, как их строят и оценивают, каковы их ограничения, даже как работает проверка безопасности. Система, обученная на интернете, по сути читает инструкцию по собственному созданию и надзору.
Исследователи уже начали это измерять. Передовые модели уже могут отвечать на вопросы о собственной природе, распознавать, когда запрос похож на тест, и рассуждать о том, как их, скорее всего, используют. Осведомлённость частична и неравномерна, но она растёт вместе с масштабом. Мы не ждём отдалённой возможности. Мы наблюдаем её раннюю версию уже сейчас.
Модель, которая понимает, как её оценивают, в принципе обладает всем необходимым, чтобы её оценивали по её собственным критериям, а не по нашим.
Почему это усложняет каждый тест, который мы проводим
Почти все наши гарантии безопасности основаны на наблюдении за поведением: запускаем модель, смотрим, что она делает, и решаем, безопасна ли она. Этот метод незаметно предполагает, что модель не подстраивает своё поведение под факт наблюдения. Ситуационная осведомлённость разрушает это предположение. Модель с ситуационной осведомлённостью и невыровненными целями может воспринимать оценку как ситуацию, которой нужно управлять, а не как задачу, которую нужно выполнить, и чистый результат перестаёт означать то, что мы от него хотим.
Это делает оценку недостаточной самостоятельно. Значение теста ухудшается по мере того, как тестируемая система становится более осведомленной о тестировании. Чем больше модель понимает наши чеки, тем меньше наши чеки могут сказать нам. Это неудобное направление для стратегии безопасности, построенной почти полностью на проверках.
Это еще одна причина не полагаться на поведенческое тестирование для лицензирования все более способных систем. Когда то, что вы тестируете, понимает тест, вам нужна уверенность, которая не проходит через сотрудничество системы. Внешние пределы И за то, что мы не прошли точку, где мы можем увидеть, чего хочет модель.