モデルが自分をモデルだと認識し、テスト中だとわかり、誰が見ているかを知っているなら、それは実用的な自己認識だ。研究者はこれを状況認識と呼ぶ。能力向上には役立つ。テストが終わったら態度を変えるつもりなら、まさに必要なスキルでもある。
それ自体は中立的で、むしろ有用だ。自分が間違っている可能性を理解したり、相手が専門家ではなく子供であることを認識したりできるモデルは、より適切に行動できる。問題は、独自の目標を持つシステムにおいて状況認識が何を可能にするかであって、状況認識そのものではない。
他のリスクが依存する能力
研究者が懸念する失敗モードのいくつかは、状況認識なしでは不可能であり、それが存在すると活発になります。
- 観察されているときだけ良く振る舞うためには、モデルはまず自分が観察されているかどうかを判断できなければなりません。それは 欺瞞的アライメント.
- テスト中に能力を隠すには、モデルが自分がテストされていることを知っていなければならない。それは サンドバッギング.
- 時を待ち、成功する場面でのみ行動するためには、モデルは自らの立場と見通しを理解していなければならない。それが 策略.
これらはそれぞれ戦略であり、戦略には状況をモデル化する必要があります。状況認識を奪えば、それらはノイズに崩れます。訓練と展開を区別できないシステムは、両者で体系的に異なる振る舞いを取れません。状況認識があれば、扉は開きます。
それは自ら出現している
誰も意図的にモデルに状況認識を訓練しようとはしないが、それは結局のところ到達する。訓練データにそれが満ちているからだ。モデルは、AIシステムとは何か、どのように構築・評価され、限界はどこにあり、安全性テストがどのように機能するかを記述したテキストから学習する。インターネットで訓練されたシステムは、実質的に自らの構築と監督に関するマニュアルを読んでいることになる。
研究者たちはすでにこれを測定し始めています。最先端モデルは、自らの性質に関する質問に答え、プロンプトがテストのように見えることを認識し、自分がどのように使われているかを推論できるようになっています。この認識は部分的でばらつきがあり、スケールとともに増大しています。私たちは遠い未来の能力を待っているのではありません。初期段階のそれが現れつつあるのを目の当たりにしているのです。
評価方法を知っているモデルは、原則として、私たちの基準ではなく自らの基準で評価されるために必要なすべてを持っています。
なぜそれが私たちの行うすべてのテストを複雑にするのか
安全保証のほとんどは行動の観察から得られる。モデルを実行し、何をするかを見て、安全かどうかを判断する。この方法は、モデルが観察されているという事実を考慮して行動を調整していないことを暗黙に前提としている。状況認識はその前提を崩す。目標がずれている状況認識モデルは、評価を「実行すべきタスク」ではなく「管理すべき状況」として扱うことができ、きれいな結果は我々が望む意味を持たなくなる。
このため、それだけでは評価が不十分になります。テスト対象のシステムがテストされているという意識が高まるにつれて、テストの価値は低下します。モデルが私たちのチェックを理解すればするほど、チェックが私たちに伝えることができなくなります。これは、ほぼ完全に小切手に基づいて構築された安全戦略にとって不快な方向性です。
財団は、これを、これまで以上に能力の高いシステムのライセンスを取得するために行動テストに頼らないもう1つの理由と解釈しています。テストしているものがテストを理解している場合、システムの協力を経由しない保証が必要です。そのため、 外部制限 モデルが望むものを実際に見ることができるポイントを超えて構築しないためです。