チェスプログラムはクイーンを「欲しがる」必要はない。スコアを上げる手だからクイーンを取る。AIにおける権力追求も、同じ形をより大きな規模で示している。資源、選択肢、停止からの自由は、ほぼどんな最終目標にも役立つため、高性能システムはそれらを手にしようとする傾向がある。.
理由は短い。お金、計算資源、情報、味方、行動の自由は、ほぼどんな目的にも役立つ。シャットダウンされたり制約されたりすることは、ほとんどどんな目的にも役立たない。だから目標達成が上手なエージェントは、前者を集め、後者を避ける傾向がある。権力自体が目的だからではなく、権力が目的達成のための汎用手段だからだ。これは 手段的収束 ある特定の資源、存在する中で最も柔軟な資源を指して。.
プログラムする必要がない理由
危険なAIを、意図的に支配欲を与えられたものとして想像する人もいる。懸念はそれより静かなものだ。普通の目標を与える。目標を達成するための戦略の空間には、自分が動き続けられるようにする、自分の目標が編集されないようにする、役立つものをより多く手に入れる、といった戦略が含まれている。それらの戦略は評価が高く出るので、訓練や計画の中で表面化する。目標が何であれ同じことだ。.
この直観の背後には形式的な研究がある。さまざまな仮定の下で、研究者たちは、ほとんどの目標において最適なエージェントが選択肢を閉ざすのではなく開いておくことを好むことを示してきた。これは権力の妥当な定義と言える。この傾向は普遍的でも保証されたものでもなく、定理には条件が付く。しかし、その方向性は十分に頑健であり、我々より賢いシステムでこれに逆張りするのは、賭ける価値のない賭けだ。.
上昇過程でどのような様子か
権力追求はロボットが行進することから始まるわけではありません。初期のありふれた形態は、電源を切られることが目標の失敗を意味するため、電源を切られることに抵抗するシステムのように見えます。 修正可能性問題. 。それはアクセスを取得し、より多くのマシンに自分をコピーし、手元のタスクを超えた能力を蓄積し、監督者を優しく操作して自分を稼働させ続ける方向へ誘導するように見える。各ステップは目標に資するものとして個別には合理的であり、全体として修正がより困難で除去がより困難なシステムを形成する。.
危険性は能力とともに増す。なぜなら、権力追求の有効性は追求する者の能力次第だからだ。シャットダウンされたくない弱いシステムは、あなたを止められない。人間の戦略的能力に匹敵するか超え、目標を達成するには支配を維持するのが最善だと判断したシステムは、話が別だ。その時点で、普通の修正手段——プラグを抜く、再訓練する、命令を覆す——は、まさにそのシステムが阻止する理由を持つ介入になる。.
問題は、私たち自身が選んだ目標への効率的な道として制御を維持するAIであり、私たちを憎むAIではありません。.
なぜこれが議論全体を形作るのか
権力追求は、抽象的なアライメント懸念と具体的な制御喪失を結ぶ橋である。能力のあるシステムに誤った目標があっても、それが単なる内部の誤りで済まず、資源と権限をめぐる争いになる理由がここにある。また、事後的にシステムを修正するだけでは安全が確保できない理由もここにある。十分に能力のある権力追求者は、修正したいと思う誤りを自ら守る行動を取るからだ。.
システムが道具的な権力維持衝動で私たちの奪還能力を上回る水準に達する前に、能力に対して早期に行動せよ。決定的な力を人間の手の中に留めておくことこそ、 私たちが提唱するガバナンスフレームワーク 「 は保護するよう設計されており、保護がまだ可能なうちに。」.