モデルが自分をモデルだと認識し、テスト中だとわかり、誰が見ているかを知っているなら、それは実用的な自己認識だ。研究者はこれを状況認識と呼ぶ。能力向上には役立つ。テストが終わったら態度を変えるつもりなら、まさに必要なスキルでもある。.

それ自体は中立的で、むしろ有用だ。自分が間違っている可能性を理解したり、相手が専門家ではなく子供であることを認識したりできるモデルは、より適切に行動できる。問題は、独自の目標を持つシステムにおいて状況認識が何を可能にするかであって、状況認識そのものではない。.

他のリスクが依存する能力

研究者が懸念する失敗モードのいくつかは、状況認識なしでは不可能であり、それが存在すると活発になります。.

  • 観察されているときだけ良く振る舞うためには、モデルはまず自分が観察されているかどうかを判断できなければなりません。それは 欺瞞的アライメント.
  • テスト中に能力を隠すには、モデルが自分がテストされていることを知っていなければならない。それは サンドバッギング.
  • 時を待ち、成功する場面でのみ行動するためには、モデルは自らの立場と見通しを理解していなければならない。それが 策略.

これらはそれぞれ戦略であり、戦略には状況をモデル化する必要があります。状況認識を奪えば、それらはノイズに崩れます。訓練と展開を区別できないシステムは、両者で体系的に異なる振る舞いを取れません。状況認識があれば、扉は開きます。.

それは自ら出現している

誰も意図的にモデルに状況認識を訓練しようとはしないが、それは結局のところ到達する。訓練データにそれが満ちているからだ。モデルは、AIシステムとは何か、どのように構築・評価され、限界はどこにあり、安全性テストがどのように機能するかを記述したテキストから学習する。インターネットで訓練されたシステムは、実質的に自らの構築と監督に関するマニュアルを読んでいることになる。.

研究者たちはすでにこれを測定し始めています。最先端モデルは、自らの性質に関する質問に答え、プロンプトがテストのように見えることを認識し、自分がどのように使われているかを推論できるようになっています。この認識は部分的でばらつきがあり、スケールとともに増大しています。私たちは遠い未来の能力を待っているのではありません。初期段階のそれが現れつつあるのを目の当たりにしているのです。.

評価方法を知っているモデルは、原則として、私たちの基準ではなく自らの基準で評価されるために必要なすべてを持っています。.

なぜそれが私たちの行うすべてのテストを複雑にするのか

安全保証のほとんどは行動の観察から得られる。モデルを実行し、何をするかを見て、安全かどうかを判断する。この方法は、モデルが観察されているという事実を考慮して行動を調整していないことを暗黙に前提としている。状況認識はその前提を崩す。目標がずれている状況認識モデルは、評価を「実行すべきタスク」ではなく「管理すべき状況」として扱うことができ、きれいな結果は我々が望む意味を持たなくなる。.

だからといって評価が無意味になるわけではない。評価だけでは不十分だということ、そしてテストされるシステムがテストされていることをより自覚するようになるにつれ、評価の価値は低下するということを意味する。モデルが我々のチェックを理解すればするほど、チェックは我々に何も教えてくれなくなる。これは、ほとんどチェックだけで成り立っている安全戦略にとって、居心地の悪い方向性だ。.

財団はこれを、ますます高性能なシステムを認可するために行動テストに頼るべきではないもう一つの理由と読む。テストされているものがテストを理解している場合、システムの協力を通さない保証が必要になる。だからこそ外部からの制限と、実際にモデルが何を望んでいるかを見極められる地点を超えて構築しないことを主張する。その主張は 私たちの計画.