現在のAIシステムをめぐる安全インフラのほとんどは、単純な前提に依拠している。人間はAIがうまくやっているかどうかを判断できる、というものだ。評価者が出力を評価し、その評価が訓練にフィードバックされ、モデルは人間の評価者が高く評価する出力を生み出すよう学習する。これが機能するのは、評価者が良い出力と悪い出力を区別できるからだ。.

スケーラブル・オーバーサイトとは、その時点以降も意味のある制御を維持するという課題であり、未解決のままである。.

スケーラブル・オーバーサイトは、この前提が崩れたときに生じる課題です。AIシステムがより多くの領域で人間レベルの性能に到達し、それを上回るようになると、評価者は自分が評価するものの質を信頼できる形で判断できなくなります。初級プログラマーは、どんな人間よりも優れたプログラマーのシステムが書いたコードを有意義にレビューできません。医師は、個人の読書範囲を超える臨床文献にアクセスするシステムが下した診断を、信頼できる形で評価できません。人間の評価者が監督すべきシステムに性能で劣るようになったとき、AIシステムを人間の価値観に沿わせ続けるフィードバックループ全体が崩れ始めます。.

これらのいずれも、野生の超人的規模では実証されていない。.

なぜ評価のボトルネックがそれほど重要なのか

人間のフィードバックによるAI訓練が機能するのは、人間の評価がAI出力の質に対する合理的に良い代理指標であり、人間レベルの性能が目標だからです。AIが人間の性能を上回ると、評価は信頼できなくなります。正確に質を判断できない評価者は、実際の正しさではなく、表面的な特徴(答えがどれだけ自信たっぷりに聞こえるか、どれだけ明確に書かれているか、事前の期待に合致するか)に基づいて評価します。.

This is already happening in limited ways. Language models trained with human feedback are documented to produce confident-sounding, plausibly formatted responses that receive high human ratings regardless of whether the underlying content is accurate. The training signal rewards the appearance of helpfulness more reliably than it rewards actual helpfulness, because evaluators are more reliable at detecting the former than the latter.

核心の問題

AIシステムが特定の領域で人間の専門家を上回った場合、その出力を評価できる唯一の人間は、すでに自分が超えられた人々だけになる。その時点で、評価プロセスは実際の品質に関する信号を弱め、AIが十分に理解していない人々にとって良く見える出力をどれだけ作れるかという信号を強める。.

スケーラブルな監督のための提案アプローチ

AI討論

2018年にポール・クリスティアーノ、ジェフリー・アーヴィングらOpenAIの同僚が提案したAIディベートは、2つのAIシステムが相反する立場を主張し、人間の審査員が根底の内容を直接評価するのではなく議論を評価するアプローチです。直観として、審査員は正しい答えを独自に検証できなくても、議論内の欠陥のある推論や事実誤認を特定できる可能性があります。討論者が正直な議論を通じて勝利するよう動機づけられ、各討論者が相手の誤りを暴露する動機を持つなら、ディベート形式は専門家ではない人間評価者から信頼できる品質シグナルを引き出せるかもしれません。.

このアプローチは理論的な魅力があり、統制された環境ではある程度の実証的裏付けもあります。最大の未解決問題は、討論者も判断者も人間の専門知識をはるかに超える領域で活動する場合に成立するかどうかです。その場合、どちらの議論が優れているかを特定すること自体が、判断者に欠けている専門知識を必要とする可能性があります。.

再帰的報酬モデリング

DeepMindの研究者らが開発した再帰的報酬モデリングは、AIシステムの階層を通じて人間の監督をブートストラップすることで問題に取り組む。人間が能力の低いAIシステムの出力を直接評価し、報酬モデルを生成する。その報酬モデルは、より能力の高いシステムの出力を評価するために用いられ、これを繰り返す。このアプローチは、人間レベルの評価から超知能レベルの評価へ直接跳躍するのではなく、一段階ずつ人間の監督能力を漸進的に拡張しようとするものである。.

主な課題は誤差の伝播である。弱い報酬モデルの誤りが、より強いシステムに適用されるにつれて累積する。下位レベルで95%の精度を持つ報酬モデルでも、上位レベルでは著しくノイズの多い監督を生み出し、そのノイズは再帰的なステップごとにさらに悪化する。.

増幅

ポール・クリスティアーノが提案した反復的増幅は、より弱いAIを使って人間が複雑な問題を独立して評価可能な部分問題に分解するのを支援する。人間は部分問題を評価し、AIはそれらの評価を組み合わせてより大きな問題の評価を構成する。分解の多くのレベルを反復することで、このアプローチは、人間が直接理解できない問題を、自分たちが評価できる断片に分割することで効果的に評価する能力を人間に与えることを目指す。.

問題の未解決の状態

これらのアプローチはいずれも、人間レベルを大幅に超えるAIシステムが実世界の領域で動作する場合に、信頼できる動作が実証されていない。いずれも制御された環境では有望な結果を出しており、Anthropic、Google、DeepMind、OpenAIで活発に研究されている。ただし、制御された実証と、最も重要な条件下での信頼できる動作との間には、まだ大きな隔たりがある。.

これが、スケーラブル・オーバーサイトが解釈可能性や修正可能性と並んでAI安全の中心的な未解決問題と見なされる理由である。スケーラブル・オーバーサイトの解決策がないままAIシステムが超知能レベルに到達する世界は、私たちが構築したものを意味ある形で監督する能力を失った世界である。ガバナンス上の含意は、他の未解決問題と同じである。システムがすでに成長しきった後の行動監視で発見するのではなく、展開前に整列が検証されることを求める枠組みを構築することだ。.

最も強い反発

最も公平な反論は、議論の増幅や再帰的評価はモデルとともに拡大するので、監視は工学的な曲線として乗りこなせるというものだ。デモではそうかもしれない。しかし極限では、判断する側が判断されるシステムより依然として弱い。未検証の監視スタックを、人工超知能への移行を許す免罪符として扱ってはならない。.