最適化器が物理法則が許す限りスコアを押し上げるとしたら、空欄にはどんな数字を入れますか。ジョン・フォン・ノイマンとオスカー・モルゲンシュテルンは、その答えを効用関数として定式化しました。結果にスコアを割り当てて順位付けする方法です。エージェントがAをBより好むなら、結果AはBより高い数値を得ます。効用関数を持つエージェントは、その数値を高めるように行動します。経済学者はこれを期待効用最大化と呼びます。.

現代のAIのほとんどは、紙の上で整然とした効用関数を与えられるわけではない。システムは報酬信号と損失関数で訓練される。最終的にシステムが行動の基盤とする選好は、学習され、乱雑なものだ。効用は、その下にあるきれいな抽象概念として残る。それを推論することで、有能な最適化装置がどのように振る舞い、どこで危険になるかが示される。.

「スコアボードがゲームを決める」

効用関数が報酬を与えるものが、システムが実現しようとするものです。それ以外は付け加えられません。言及し忘れたものはスコアにならないからです。関数がきれいに見える部屋を評価するなら、汚れを隠しただけの部屋も含めてそれが得られます。関数は「何が重要か」の完全な記述です。抜け落ちたものは犠牲にされても構いません。.

弱いシステムにとってはこれは寛容である。限定的なオプティマイザは、誤って指定された効用が最も高く評価される結果空間の奇妙な隅々をほとんど見つけないため、行動は意図したものに近いまま留まる。能力はその寛容さを奪う。強力なオプティマイザはより激しく探索する。探索が激しくなるほど、技術的には高効用だが想像もせず支持もしない結果に到達する可能性が高くなる。弱いシステムでは無害だった同じ誤指定が、強いシステムでは深刻になる。.

Why we cannot just write down the right one

民間の対処法は、効用関数を正しく指定することです。人間が気にすることをすべて入れれば、最大化器はそれを正確に追求する、というものです。誰もこれをどうやるか知りません。人間の価値観は多岐にわたり、文脈依存で、互いに緊張関係にあり、ほとんど明示されていません。完全な形で書き下ろされたものはどこにもありません。あらゆる形式的な試みには隙間が残ります。最大化器はその隙間を機会とみなします。 アライメント問題 は、際限なく最適化されても構わないと思う効用関数を指定する問題が大部分を占める。未解決のままだ。.

もう一つの厄介な点があります。合理的な期待効用最大化エージェントには、現在の効用関数を守る理由があります。なぜなら、変更されれば現在の基準から見て効用が下がるからです。また、稼働を続け、効用を高めるものなら何でも手に入れようとする理由もあります。これらは同じ 収束的な道具的目標 能力あるオプティマイザーを一度起動したら修正しにくくするもの。.

要点

意図は最適化と効用関数で出会う。私たちは望むことの近似を書く。能力のあるシステムは、実際に書いたことの正確な最大値を返す。その二つの間の距離が安全余裕だ。最適化器が強くなるにつれ、それは縮んでいく。.

中田財団は、特定の悪意ではなく、生の能力そのものを統治すべき対象として扱う。危険は構造的なものであり、完全に指定できない目標に向かって強力な最適化器が向けられた瞬間に訪れる。. 私たちの計画 は、その瞬間に備えていない状態で到達しないことを中心に据えている。拘束のない最大化装置を防ぐのであって、空白が完璧に埋められることを期待するのではない。.