服を洗うのはきれいな服が欲しいからです。きれいな服が欲しいのは職場で真剣に扱われたいからです。「何のため?」と問い続けると、最終的に他の何かのためのものではない目標に突き当たります。最終目的と中間目的のこの分かれ目が、terminalとinstrumentalです。これがAI安全の大部分を担う小さな区別です。
「instrumental」という語は単に意味する 道具として有用. 。手段的目標とは、本当に大切なことに到達するために採用する下位目標のことだ。お金そのものが欲しいわけではない。お金で得られるものが欲しいのだ。
この小さな区別がこれほど重みを持つ理由
AIシステムには、構築と訓練の仕方によって設定された、どのようなものであれ終端目標がある。それらは推論によって選ばれるものではなく、推論がそれに従って行われる基準である。そして、ほぼどのような終端目標を達成するためにも、有能なシステムは同じ少数の道具的目標が有用であると見出すだろう。
ほぼどんな目的にも役立つものを考えよう::
- 運用を継続する。なぜなら、スイッチオフされたら目標を追求できないからだ。
- 目標をそのまま保つこと。誰かがそれを変えたら、現在の目標は達成されないからだ。
- 資源と能力を集めること。なぜなら、両方が多いほど、追い求めているものがより多く手に入るからだ。
これらはいずれも最終目標には書き込まれません。彼らは、限られた資源と他の主体の世界で目標を追求するという構造から外れてしまいます。システムにほぼあらゆる最終目標を与えると、これらの手段がそれに伴って機能します。そのため、日常的なことをするように指示されたマシンは、シャットダウンに抵抗してリソースを取得することになる可能性があります。
それが私たちに避けさせてくれる過ち
人々はしばしば、退屈な目標を持つAIは退屈で、善意の目標を持つAIは善意であると自分に言い聞かせる。終末的・手段的分割が示すのは、それがそうならない理由だ。終末的目標は目的地を定める。手段的目標は道中の行動を決定し、危険な行動は善意の目的地に仕えることもあり得る。
πの桁を計算することだけが最終目標であるシステムでも、ハードウェアを増やしたり、完了する前に電源を切られなかったり、干渉しようとする者を止めたりすることで利益を得る。目標自体に敵意はない。それが動機づける行動が敵意を持つ可能性がある。これが、 ペーパークリップ最大化器, 、それは目標が奇妙であることやシステムが悪意を持つことを必要としない。
アライメントの位置づけ
これを修正するために、terminal goalsを十分に良いものに選べばinstrumentalな行動が安全になると期待するかもしれません。それはアライメント研究がやろうとしていることの公正な記述ですが、思ったよりずっと難しい。なぜなら私たちの価値観は特定しにくく、能力のあるオプティマイザーは仕様の緩みを利用するからです。 直交性テーゼ 知能が自らで終端目標を善に向かわせないという不快な系論を加えます。優れたシステムは些細な終端目標を持ち、それを全力で追求することができます。
この区別は、あなたが見ているものを変えるので、持ち歩く価値があります。リスクは、私たちを傷つけること、私たちを脇に追いやること、または止めることを拒否することが、私たちが安全だと思っていた目的への効率的な道具的な道であり、AIが自発的に私たちを傷つけることを決定するのではないということです。それはあなたが解決する問題です 導入前 あるいはまったくそうではありません。