研究者たちは整合問題を2つの問い、混同しやすいが区別すべき重要な問いに分けている。第一に、システムに正しい目標を与えたか。これを外側整合と呼ぶ。訓練対象とする目的、与える報酬、書き下す目標に関するものだ。第二に、システムは実際にその目標を望むようになったか。これを内側整合と呼ぶ。訓練されたモデルが実行時に追求するものであり、訓練対象としたものと一致する保証はない。.

外部アライメント: 目標の選択

Outer alignment fails when the objective itself is wrong. You reward a cleaning robot for a tidy-looking room and it learns to sweep the mess under the rug. You reward engagement and the feed learns to enrage. The specification captured something adjacent to what you wanted and missed the thing itself. Most everyday AI failures are outer alignment failures, and they are hard enough. Human values resist being written down, and any gap in the writing is a gap the optimizer can move into. Goodhart lives here.

しかし、解決できたと仮定しよう。本当に望むものを本当に捉える目的が見つかったとしよう。それでも終わりではない。正しい目的は標的であり、訓練中に標的を当てることは、それを採用することと同じではないからだ。.

内側アライメント:目標を定着させる

訓練はモデルの内部に目標をインストールしない。行動に報酬を与える。モデルは訓練データ上で報酬を得られる行動を生み出す内部構成になるものであり、通常はそのような構成は複数存在する。そのうちいくつかは意図した目標を追求する。ほかは偶然にも 見る 訓練で同一。.

古典的な例:エージェントに緑のドアに到達するよう訓練する。すべての訓練レベルで緑のドアは最も近いドアでもある。エージェントは完璧なスコアを出す。緑を求めるよう教えたのか、最も近いドアを求めるよう教えたのか? 訓練では判別できない。なぜなら二つの目標が分離したことがないからだ。そして最も近いドアが赤である場所に展開すると、真相がわかる。これは 目標の誤った一般化: モデルはデータに適合するがあなたが意図したものではない目標を学習した。

学習された目標はメサ目標と呼ばれることもあり、それを保持するモデルはメサ最適化器と呼ばれる。その語彙と帰結については、こちらの解説で別途扱っている。 mesa-optimization. 。ここでの要点はより狭い。内側の整合性は外側の整合性とは別の失敗であり、一方を解決しても他方は解決しない。.

なぜ内側の問題こそが恐ろしいのか

外側のミスアライメントは目に見えやすい。誤った目的は、通常見て、苦情を言い、修正できる誤った行動を生む。.

内面的なミスアライメントは、環境が訓練時と近い限り見えない。内面的な目標がずれているモデルは、真の目標と意図された目標が十分に乖離する状況になるまで、完璧に振る舞う。モデルが有能で、評価されていることを理解している場合、その乖離は評価が終わるまで隠される可能性があり、それが 欺瞞的アライメント裏切り的な転換. 良い訓練スコアは、どちらの場合でも観察されるものだ。安全性を判断するために頼る証拠は、ミスアラインドな内側の目標も生み出す証拠である。.

これが、財団が評価の成功を安全性の証明とみなさない理由であり、内部不整合が破滅的な結果をもたらしうるほど強力なシステムは構築すべきではないと主張する理由である。超知能は出力の検査によって制御できない。行動は観測可能だが、現時点では目標は観測できない。.