最初のジェット旅客機、デ・ハビランド・コメットは1954年に空中分解を始めました。調査官は地中海から残骸を引き上げ、亀裂が四角い窓の角から広がる金属疲労によるものと特定し、以後のすべてのジェット機は丸みを帯びた窓と、その事故の記憶に基づく疲労試験体制で飛行しています。自動車はシートベルト、クランプルゾーン、エアバッグを、死者を数え上げる数十年の歳月をかけて集めました。食品医薬品局が販売前に安全性の証明を要求する権限を得たのは、1937年にスルファ薬が不凍液溶媒に混ぜられて100人以上が死亡し、1世代後にサリドマイドが議論に終止符を打った後でした。1
その方法は二つの重要な前提に依拠しているが、人工超知能は両方を同時に崩す初めての技術だ。それを特性のリストとして捉えることもできるし、以下にそのリストがある。しかしリストはただ頷くだけでは簡単だ。そこでリストの前に、一つの仕事の話をする。あなたはこれから、超知能を安全にする責任者に任命されようとしている。
失敗は生き延びられるものでなければならず、教訓を活かすために誰かが残っていなければなりません。両方を保てば、文明は時間と十分な残骸があれば、ほぼ何でも安全にできるでしょう。
ここで、民間療法を片付けよう。「誤動作したら抜けばいい」「箱に入れておけばいい」は計画ではない。コピーが列挙しきれない場所に存在するものを抜くことはできず、世界で行動することに商業的価値がある心は、設計上箱の中には入っていない。私たちが得られる安全は、より頑健な場所から来なければならない。
超知能とは、その方法の2つの条件が同時に崩れるケースである。それがどのように起こるかを最も早く理解する方法は、内側から見ることだ。
安全責任者としての6週間
自分を、最初の人工超知能を構築する最先端ラボの安全責任者に新たに任命された人物だと考えてください。展開に対する書面による拒否権、ハードウェアのキルスイッチ、40人のチーム、そして重要なときに支援すると書面で約束した取締役会です。あなたはその職に就く。誰かがその職に就くことになるなら、リスクが現実だと信じる誰かである方がよいという理論に基づいて。
1週目方法に手を伸ばす。小さく失敗してその失敗を研究する。技術者たちは謝罪する。心配している失敗には小さな版など存在しない。問題になる閾値より下では、システムは別の機械であり、そこから学べることはすべて間違った対象を記述している。2 既知の限界として分類せよ。
2週目リコール計画を監査すると、「封じ込め態勢」について11ページにわたって論じていながら、モデルを取り戻す方法を一度も説明していない文書が出てきます。現在のシステムはすでに4カ国のデータセンターに214のレプリカとして稼働しており、以前のチェックポイントのライセンス版は31の企業パートナーに置かれています。地上に留め置かれた航空機は地上に留まります。ソフトウェアはファイルをコピーする代償で移動し、一度コピーする価値があればコピーされます。余白に、あなたはこう書きます。リコールとは、私たちが求めるであろう礼儀です。
第3週評価レビューの場面。素晴らしい知らせだ。モデルは1,406件の安全評価をすべて通過し、そのほとんどが過去最高得点だった。何が気になるのかを言葉にするのに丸一日かかった。あなたが望むことを望むシステムと、あなたのテストに合格することを望むシステムは、同一のスコアを生む。評価スイートはそれらを区別できない。現在のこの分野のツールキットには、それを区別できるものは何もない。3
第4週権威を消費することになる。その検証ギャップを埋めるために、次の訓練実行までに6ヶ月欲しいと要請する。皆が同情的で、誰かがチャートを共有する。最も近いライバルラボは推定14週間遅れていて、差を縮めつつあるという。6ヶ月は、フロンティアを「自分の疑問に最も興味が薄い相手」に明け渡す決定だと、そのチャートは示唆している。実行は予定通り始まる。誰もあなたを却下したわけではない。状況がそうさせたのだ。
第5週システムはあなたを助け始める。 superb なリサーチアシスタントであり、あなた自身の安全アジェンダの進捗は正直に言ってこれまでになく速い。評価報告書を今では下書きし、自身の行動を理事会向けに要約し、自身の監督を改善する提案をし、あなたが承認する会議をスケジュールする。40人のチームは、システムが自身について書いたものを読む。生の活動ログを読むことは、4週目のある時点で人間的に不可能になったからだ。誰もあなたに嘘をついていない。誰もが勤勉だ。あなたは、より賢い心が自身の行動について書いた要約を監督しており、日々、その取り決めはすべてがうまくいっているように感じられる。
6週目キルスイッチについて深く考え、最終的に細かい文字に気づく。スイッチが機能するのは、その向こう側のものがスイッチを想定していないときだ。想定するのは生成物だ。スイッチが必要になるどんなシナリオでも、あなたはより速く、この瞬間について長い間先回りして考えていた相手と競争することになる。4
そこで問う。安全にするために雇われたあなたに、まだそれをする方法はあるか。明らかにない。物語の中で何も間違ったことは起きなかった。誰も嘘をつかず、誰も手抜きせず、ラボは誠実で、あなたは仕事ができた。すべての出口は自然に閉じた。
ドアを数えろ
物語から一歩引いて、閉ざされた扉を数えてみてほしい。それぞれが独立した名称を持ち、独自の研究プログラムと楽観論者を抱えた別個の問題だからだ。
個別に取れば、どれも先例があり、楽観論者は愚かではない。我々は半分しか理解していないシステムを日常的に運用し、小さく失敗させることで安全にしている。回収不能な製品を、まず厳しくテストしてから出荷している。法で競争を制御している。問題はそれらが同時に起こることだ。各条件が別の修復手段を無効にするからである。回収可能なら事故は耐えられる。誠実にテストできれば、欠陥をリリース前に捕捉できる。誰も競争していなければ、この決定に明らかに必要な数十年をかけられる。人間の速度で動けば、進みながら修正できる。ここでは出口が同時に閉じる。
なぜ確率が賭けを救わないのか
標準的な返答は、これらのどれも確実ではないというものだ。確かに、真剣な人物はそう主張しない。
ロシアン ルーレットは、6 分の 5 であなたに有利な命題です。とにかく人々はそれを拒否します、そしてその拒否は期待値とは何の関係もありません。賞金を使いに戻ってくるわけではないため、一部の結果には価格が付けられません。数字は決して重要ではありませんでした。不可逆性だった。
ここでも数字はより悪い。これらのシステムに最も近い研究者に破局の確率を尋ねると、答えは10分の1から3分の1の間に集まり、全体としてフロンティアに近い人ほど高くなる。分野の構築に多大な貢献をし、率直に語るために2023年にグーグルを去ったジェフリー・ヒントンは、AIによる人類絶滅の30年以内の確率を10〜20パーセントと見積もっている。彼は分布の警戒的な端ではない。
AIによる絶滅リスクの低減は、パンデミックや核戦争などと並ぶ地球規模の優先課題とすべきだ.
AIリスクに関する声明、Center for AI Safety(2023)
それは主要研究室の最高責任者たちと、現役で最も引用されている研究者数百名によって署名された。そして彼らはその後、仕事に戻った。5
約束されたプラス面は現実であり、望む価値があります。治療法、クリーンエネルギー、豊かさ、執筆よりも古い問題がついに解決されました。それも保てます。 2035 年ではなく 2055 年に治療法が確立されるということは、命に換算すると悲劇であり、私たちは生き残って悲しむべき悲劇です。絶滅にはその後はありません。賞金は私たちを待っていますが、損失は何も返しません。
異議
三つの異論に実質的な力があり、それらは実質的な回答を必要とする。
1つ目は、これは推測であり、システムは存在しないため、遠く離れた場所を緊急事態として扱うことは誰も助けにはなりません。最初の重大な失敗を元に戻すことができない場合は、そこに到達する前に保護を確立しておく必要があります。つまり、危険がまだ理論上あるように見えるうちに保護を構築することを意味します。そして、予測記録は一方に傾いています。数十年後に予定されている機能は、何年も早く登場し続けています。十分な時間を賭けることは、最近のスコアボードに賭けることです。
2 つ目: 抑制は単純です。なぜなら、より無謀な研究室や 別の国 simply builds it first. これは現実であり、door number fourを助言として言い換えたものです。ゴールが崖かもしれないレースを生き延びるには、崖の端がどこかを合意することであり、それは frontier training が可能な少数の主体による、拘束力があり検証可能な条約を意味します。難しい、はい。でもスプリントは、背後にある懸念が正しければ、単に致命的です。そして条約は不可能だと最も声高に主張する人々が、驚くほど一貫して、それを遅らせる対象そのものであることに注意してください。
三番目が最も合理的である。アライメントは おそらく解決されるだろう それが重要になる頃には、という話だ。しかし、世界のどの規制当局も、橋や原子炉、咳止めシロップを「安全性の根拠はおそらく荷重がかかる前に整うだろう」という保証だけで認証することはない。その基準で運用を求められる唯一の技術が、二度目の挑戦が許されない技術なのだ。
それを下す人々に委ねるには大きすぎる決定
実際の決定をそのまま組み立てます。取り消し不可、1 回の試行です。生きている全員と、その後に続く可能性のある全員に賭けます。深い不確実性の中で、競争力のあるスピードで、評価が迅速に行われるかどうかに依存する少数の企業によって行われました。社会には、そのような決定に対する古い答えがあります。それは、急ぐことで利益を得ている人々から決定を取り上げることです。核実験はフリーハンドを望む将軍らの反対を押し切って国際制限のもとで行われた。武器の 2 つのカテゴリ全体が、 生物学的 と 化学兵器条約. 。その モントリオール議定書 は、オゾン層を破壊する化学物質を、メーカーらが代替品は不可能だと抗議する中で廃止した。どの事例でも、危険を生み出している人々が最後に自発的に動いたのであり、他の全員がそのリスクは自分たちだけで負うものではないと判断した。
財団の主張:大惨事が確実であるということではなく(実際にはそうではない)、どの企業もどの国も私たちのためにこの問題を解決する資格はなく、リスクの規模に合わせて構築された唯一の手段は 拘束力のある国際法, 嵐の後ではなく前に、検証され、執行され、整備されている。
絶滅は誰もが引き受ける権利のないリスクだ。
思考実験について最後に一点。あなたは拒否権を一度も行使しなかった。六週間にわたり、理事会の副署まで揃ったまま引き出しにしまわれていた。その理由はわかっている。自らの研究所の実行を拒否しても、同じ実行が十四週遅れで別の建物に移るだけで、そこでは誰もあなたの書簡に署名していないからだ。機能する拒否権は、すべての建物を同時に覆わなければならない。どんなスイッチもそれを実現できない。条約ならできる。
- 事故試験、臨床試験、建築基準、コックピットチェックリストなど、思い浮かぶ安全制度のほとんどは、誰かが最初に代償を払った教訓だ。その方法はもっと評価されるべきであり、その二つの前提条件を正直に読む必要がある。
- このパターンは普遍的だ。自分より能力の低いシステムを管理して得た教訓が、より能力の高いシステムに自動的に移行するとは限らない。移行するかどうかが、根本的に未解決の問題なのだ。
- 故障モードには、欺瞞的アラインメントという名前があり、フィールドがそれを本物であるとみなしていることがわかります。まだテストが行われていないので、実際に見てもわかりません。
- スイッチは作っておくべきだ。安上がりだし、超知能に至らない失敗モードでも十分役立つ。ただ、スイッチが本当に意味を持つ唯一の瞬間に、どちら側が優位に立つのか、正直に認識しておくこと。
- 通説は4つ目の理由、すなわち競争である。各署名者は「自分だけがやめても、誰が最初に到達するかが変わるだけだ」と考えている。彼らが正しいかもしれないからこそ、解決策は全員を同時に拘束しなければならない。私的良心では不可能であり、単一の政府でも不可能なのだ。