滅亡確率は正式論文の技術用語ではありません。2020年以前のほとんどの研究者が数値を付けることすら考えなかった確率推定の略として、オンラインのAI安全議論の中で生まれたものです。それを定量化しようとする姿勢(壊滅的なAIリスクを漠然と示唆される可能性ではなく、推定すべき確率として扱うこと)は、AI開発に最も近い人々の問題への考え方が意味ある形で変化した一例です。.

研究者や、整合性の難しさとガバナンスの速度をどう評価するかによって、数パーセントから50%超まで幅がある。この幅が示すこと、そして低い確率でも真剣に取り組むべき理由を以下に述べる。.

滅亡確率における「doom」は意図的に曖昧にされている。研究者によって、人類絶滅、人間の自律性の永久喪失、一つの主体への権力の永久集中、その他の文明的惨事などを指す。この不正確さは認められているが、用語の目的は、リスクが「現実的」か「投機的」かという直観に頼るのではなく、リスクについて明示的で定量的な推論を促すことにある。

インフォグラフィック:滅亡確率とは何か、専門家の推定範囲とガバナンスのギャップ
専門家の範囲と理由 小さな確率でも重要だ.

推定がどのようなものか

10-50%
ジェフリー・ヒントン
ノーベル賞受賞者、バックプロパゲーションの共同発明者。2023年にGoogleを離れ、AIリスクについて自由に発言している。設計者が意図しない目標をAIシステムが獲得することへの懸念を挙げている。.
5-40%
Joe Carlsmith
パワーシークイングAIによるリスクの形式的分析(2022年)。主要な不確実な中間段階に条件付き確率を分解して導出した。.
10-20%
ポール・クリスティアーノ
元OpenAI研究者、ARC Evals。AI debateとamplificationの提案を開発。典型的なML研究者より高く、安全重視の研究者よりは低い推定値。.
>95%
エリエザー・ユドコウスキー
機械知能研究所研究者、初期のAI安全提唱者。アライメント問題が危険な能力水準に達する前に解決される軌道にないと考えています。.

これらの研究者の間の幅は印象的だ。Hintonとユドコウスキーは数十パーセントポイントも離れている。Carlsmithの形式的な分解は一点推定ではなく広い範囲を生み出し、各中間段階での genuine uncertainty を反映している。推定値に共通するのは、非自明であるということだ。問題に真剣に取り組み、数値を出した安全志向の研究者で、約5%を下回った者はいない。.

自分で試してみよう

以下の各要点について自分の見解を設定し、それらが単一の推定値に集約されていく様子を観察してください。.

滅亡確率 計算機を開く →

なぜ幅広い範囲が存在するのか

滅亡確率という数字は、いくつかの不確実な中間質問を掛け合わせた結果である。AI能力はどれだけ急速に進むか? 我々が検証した能力水準を超えた場合、アライメント問題はどれだけ困難か? ある能力水準のミスアラインドAIが、封じ込め可能な被害ではなく壊滅的な被害を引き起こす確率はどれほどか? 重要な能力閾値に到達する前に、ガバナンスが効果的に対応できる確率はどれほどか??

研究者によってこれらの問いに対する確率分布は異なり、その推定値は複合的に作用する。整合性問題は解決可能だと考え、能力向上は比較的緩やかで、ガバナンスも間に合うと考える研究者は、各問いで逆の見方をする研究者よりも全体の推定値がずっと低くなる。この幅広い範囲は、各要因に関する本物の不確実性を反映しており、同じ証拠をより注意深く検討すれば解消されるような意見の相違ではない。.

期待値論証

非自明な滅亡確率推定に対するよくある反応はこうだ。「10%でも、社会を再編するほど高いとは思えない」。この反応は、他のリスク文脈では到底受け入れられない期待値推論の失敗に依拠している。.

毎年、数百万人が死亡する可能性のある大規模パンデミックの年確率は1%未満と推定されるが、パンデミック対策には多大な世界的投資と政策注意が払われている。USでの自動車事故による死亡の生涯確率は約1%であり、道路安全規制は完全に普通のことと見なされている。文明レベルの破局の確率が10%(あるいは5%)でも深刻な予防的投資を正当化しないという主張は、他の分野でリスクを扱う方法として一貫していない。.

規模の問題

期待値は確率と規模の積です。不可逆的で文明規模のリスク(悪い結果から回復できず、将来の価値がすべて失われる場合)では、確率が10%を大幅に下回っても、予防策の期待値は依然として非常に大きいままです。すべてを失う1%の可能性は、長期的な未来が含む規模全体の1%という莫大なコストであり、単なる「1%の問題」ではありません。.

滅亡確率を下げるもの

高い滅亡確率推定値を表明する研究者は、最も重要な仕事がどこにあるかを診断しているのであって、悪い結果に諦めているわけではない。ほとんどの研究者の推定値を引き下げる要因はよく理解されている。 解釈可能性ツール capable of verifying alignment in frontier systems; scalable oversight approaches that hold at capability levels beyond human experts; binding international governance frameworks with real enforcement; and capability development that proceeds more slowly than alignment research so that safety is established before dangerous capability levels are reached.

これが、財団が滅亡確率推定値を権威ある答えとして扱ったり、リスクを無視したりするのではなく、ガバナンス枠組みと整合性研究を主要な手段として重視する理由です。滅亡確率の不確実性は情報を待つ理由にはなりません。悪い結果は特定の能力閾値で到来するのであり、無期限に予防措置を先送りできるタイムラインではありません。.