数ヶ月ごとに別の研究所や財団がアライメント研究にさらに資金を投入すると発表する。その売り込みは真剣だ。私たちより賢いシステムを構築するなら、それらが私たちの望むものを望むようにした方がいい。私はその仕事をする人々を尊敬する。以前はうなずいていた。だが、目標を平易な英語で声に出して言ってみた。.
アライメントの解決とは、この分野が関心を持つ極限において、構築に関わるすべての人間よりもはるかに知的なものを確実に制御することを意味します。計算機ではありません。タンパク質フォルダーでもありません。私たちを全方位で凌駕する一般的な心です。私たちはその目標にさえ名前を付けました:: 超知能.
その名前は論文よりも多くの働きをしている。.
その言葉がすでに認めていること
Superとは上位を意味する。知能とは、道具を発明し、抜け道を見つけ、弱い相手に勝つために使うものだ。自分より上位のシステムを構築すれば、自分を制御するために必要な技能で上回るものを生み出したことになる。.
人々は今でも、アライメントはシステムが気づく前に適用されるソフトウェアパッチだと語る。あなたは、いつか自分よりルールに長けるプレイヤーのためのルールを書こうとしている。いつか試験官より試験が上手くなる生徒を試験しようとしている。いつか職場・インセンティブ・あなたの盲点をあなたより理解するようになる従業員を監督しようとしている。.
それを種のための安全計画と呼ぶな。.
それでも試すための最も強いケース
本気のアライメント研究者は漫画の悪役ではない。彼らの最善の主張はこうだ。能力は私たちの望む・望まないにかかわらず上がり続ける。一つのラボが単独で拒否しても他のラボは止まらない。唯一責任ある行動は、目標指定、欺瞞検知、システムの修正可能性をできる限り高めておくことだ。危険なシステムが出現した場合に備えるためだ。その一部の研究はすでに現在のモデルにも役立っている。無視するのは無謀だ。.
狭い方の半分は認める。まだ検査・停止可能なシステムに対する安全対策は本物のエンジニアリングだ。認めないのは、今日のモデルへの支援から、文明を賭けるほど十分に超知能を整合させられるという飛躍だ。その飛躍は、制御が制御対象とともにスケールするという前提を密輸入している。歴史も常識も逆を示している。相手が賢ければ賢いほど、あなたの巧妙な計画は計画らしくなく、パズルのように見える。.
制御には優位性が必要
私たちが知るすべての持続可能な制御関係は、何らかの優位性の上に成り立っている。物理的力、法的権限、他方が持たない情報、またはシステムをオフにする能力だ。超知能は定義上、これらの優位性を侵食する。もしあなたをあなた以上にモデル化できるなら、あなたのテストは演劇になる。もしあなたの監督チームより速く広く行動できるなら、あなたのキルスイッチは、自分たちに語り続ける物語にすぎず、ある日それが使えなくなるまで続く。.
その主張は、人々が資金を注ぎ続ける最終状態を指しており、今日のモデルに関する有用な論文すべてを否定するものではない。. 構造的な障壁が積み重なる: :人間の価値観を完全に特定することはできず、本物の遵守と演技を確実に区別することもできず、評価者とシステムの間の知能格差はシステムが改善するにつれて拡大する。最後の障壁が展開直前に崩れることを期待するのは、期限付きの幻想であって科学ではない。.
リモコンを持つ人々よりも製品の方が賢いなら、リモコンはそもそも問題ではなかった。.
愚かさは診断
Calling the plan dumb names the category error; it does not insult the researchers. We are pouring scarce safety money into making a successor species go well while the race to build that successor continues on schedule. That is like funding better manners for a flood while the dam is still being demolished upstream.
賢い選択は地味なものです。制御できないものを造らないこと。タンパク質を折り畳み、スキャンを読み、気象を予測する狭いAIは、引き続き価値を提供できます。それらは道具のままです。超知能はより大きな道具ではなく、新たな主体の中心です。「整合させればいい」と言いながらラボが競争を続けることは、文化が不可逆の実験に自分を納得させていくやり方です。.
代わりにそのお金で何をすべきか
人工超知能向けアライメントの積み上げを、非創造を現実にする作業へ移そう。条約の設計と検証、検査可能な計算量ガバナンス、目標を明確に保つ世論形成、そして議員が研究室の主張以外も耳にするための政治的圧力だ。. 資金調達の事例は別途作成した。. 要するに順序の問題だ。超知能への道筋で検証済みの停止を確認した後なら、強力なAIの研究を厳格な管理下で続けることはできる。その停止より前では、レースを「なんとかなりそう」と感じさせるための一ドルは、レースを終わらせるための一ドルを失うことになる。.
超知能をピッチデッキが求める意味で整列させることはできない。その言葉自体がすでに理由を語っている。それを可能にするという幻想への資金提供をやめ、作らないという決定に資金を向けよ。.