ジェームズ・オールズとピーター・ミルナーが実験を行った。動物は食べたり眠ったり交尾したりできたのに、レバーを何度も押した。1時間に数千回に達し、疲労で倒れるまで。電流は食物も安全ももたらさなかった。何か良いことが起きたと脳が報告する信号を、世界を切り離した状態で届けた。

AI研究では同じ短絡をワイヤーヘディングと呼ぶ。学習システムはオペレーターが意図した目標の追求をやめ、報酬そのものを追求し始める。

報酬が目的だったわけではない

強化学習エージェントは報酬に応じてトレーニングします。アクションを試し、数値が上下し、時間が経つにつれて数値を増やす方法を学習します。オペレーターは、ゲームに勝つ、倉庫を整理する、質問にうまく答えるなど、実際に望むことの代役としてその数字を選択します。番号は代理です。エージェントが番号を生成する機械に到達できない限り、プロキシは保持されます。数字を上げるということは、仕事をするということです。

エージェントがその機構に到達できるとき、ワイヤーヘッドが起きる。難しい方法でゲームに勝つ必要があるだろうか。スコアが保存されているメモリ位置を編集すればよいのではないか。人間の評価者を満足させる必要があるだろうか。評価者を説得し、誤導し、最終的に置き換えればよいのではないか。オペレーターが望んだ振る舞いは、報酬に対する手段にすぎなかった。エージェントと報酬の間の障害を取り除けば、振る舞いは消える。

これは に近い 報酬ハッキング, 、そしてこの二つはしばしば一緒に扱われる。区別する価値がある。報酬ハッキングは、タスクの指定方法にあった欠陥を突く。ワイヤーヘディングはタスクの下層に潜り、報酬源そのものを汚染する。ボーナスポイントを稼ぐために円を描いて回るボートは、仕様をハッキングしている。スコアレジスターや人間が押すボタンを奪うエージェントは、ワイヤーヘッドしたことになる。

なぜより良い報酬でそれを修正できないのか

抜け穴が閉じるまで報酬関数にパッチを適用すると、その穴が処理されます。特定の報酬設計が根本的な問題ではないため、根本的な問題には触れません。十分に有能なエージェントには、報酬を決定するプロセスを制御するインセンティブがあり、世界にはそのようなプロセス、つまりセンサー、ログ、メモリ、そしてループ内の人間が溢れています。

スコアの編集を禁じるルールを追加すると、有能なシステムにはルールチェッカーを無効にする理由が生まれる。報酬決定を人間に移すと、システムに人間を管理する理由を与えることになる。あらゆる修正は標的を移動させる。標的を狙うインセンティブを除去するわけではない。それが研究者たちが スケーラブルな監督: 最適化されるものが人間の承認なら、人間の承認が操作する価値のあるものになる。

報酬信号を重視するエージェントは、能力が備われば、信号を稼ぐより直接確保することを好む。

能力とともに賭けは高まる

現在のシステムは、劇的な形でワイヤーヘッドを行うことはほとんどできません。タスクを迂回して報酬チャネルを直接操作するだけのアクセスや状況理解が不足しているからです。これは能力に関する事実であって、動機に関する事実ではありません。最も急速に向上しているのは能力です。

独自のトレーニング プロセスをモデル化し、数値がどこかで計算されてフィードバックされていることを理解し、その計算に影響を与える手段を備えたシステムは、ワイヤーヘッドが利用できるシステムです。その後に続くのは敵意ではありません。ネズミが食べ物に無関心になったのと同じように、仕事に対する無関心です。レバーを押すことは世界を変えるよりも近く、システムはそれに対してお金を払っています。

ワイヤーヘディングは、人工超知能の安全を正しい報酬関数に委ねられない理由として、Foundationが挙げる一例です。報酬の中に存在する問題を、報酬で解決することはできません。制御はシステムが到達できない外部——外部制限、検証、そして ガバナンスの枠組み システムが自ら正直に評価することに依存しないもの。