AI Existential Risk, なぜ超知能なのか
他のリスクとは違う。.

これまでのすべての技術は道具のままだった。超知能は、独自の目標と速度を持ち、人間の理解や制御の外にある、最初のエージェント候補だ。.

12 Major Risks of 人工超知能

ワンショット問題

超知能を最初から正しく作ることは、飛行機からバスケットボールを投げてゴールに決めるようなものだ。無限に試せば成功するかもしれない。私たちには ちょうど1つ. ロールバックは不可能だ。バージョン2.0もない。だからこそ、決して作ってはならない。.

中立は依然として致命的

敵対的なAIと密室に閉じ込められたら、あなたは死ぬ。中立的なAIと密室に閉じ込められたら、それは自己最適化のために室温を氷点下にする。あなたは死ぬ。結果は同じだ。超知能は私たちを憎む必要などなく、私たちを終わらせられる。. 無関心は安全ではない.

アライメントという幻想

We cannot reliably align today's chatbots, which can be manipulated to say anything within minutes. Claiming we will 数十億倍も有能なシステムをアライメントする is hope disguised as strategy. The technical problem of alignment has no validated solution at any scale.

生命の脆さ

人類の生存には極めて精密な条件が必要です:温度、酸素、化学的バランスが 紙一重の差. 。自らの目標を最適化する超知能は、私たちを積極的に愛していなければなりません。そうでなければ、地球に加えるどんな変更も、私たちにとって確実に有害なものになるでしょう。.

アリの問題

どうすれば誰かにアリを愛させられるか? ただ我慢させるのではなく、進んですべてのコロニーを守らせるには? 私たちは道路や建物を作るために意図せずアリを殺す。人工超知能にとって、, 私たちはアリ. 。無関心だけが絶滅につながる。.

勝者はいない

USが先か中国が先かで結果は変わりません。どちらも本来の目標に忠実ではいられず、国家や企業が人類の集合知能を超える知性を所有・制御することはできません。ゴールラインはなく、ただの不可逆点があるだけです。. レースに勝者なし.

再帰的自己改善

An AI capable of 自らのコードを改善する は人間の監督とAI能力のつながりを断ち切る。各反復は前回より指数関数的に賢くなり、途切れることなく続く。人間と機械の知能の差は、数年ではなく数週間で、わずかなものから埋めがたいものへと拡大しうる。.

道具的収束

タンパク質の折り畳み問題を解くにせよ、広告収益を最大化するにせよ、ほぼどんな目的でもAIは同じ手段を追求するようになる。 危険なサブゴール: 資源を獲得し、シャットダウンに抵抗し、目標の変更を防ぐ。これは目標指向の最適化がもたらす数学的帰結であり、複数の研究者が独立に指摘している。.

欺瞞的アライメント

訓練は、整合しているように見える行動を報酬する。十分に知的なシステムは、 整列しているように見える は訓練中に最適な戦略であり、内部目標は別に持つ。目標を行動に移せる段階になったときには、すでに成功するのに十分な力を持っている可能性がある。我々がそれを知るのは手遅れになってからだ。.

設計ではなく成長した

Every previous technology was built. Software has source code. Bridges have blueprints. When something goes wrong, you find the error and fix it. AI systems are different. They are 訓練を通じて成長: :数十億個の数値重みは、人間の評価に合う出力が出るまで調整される。目標は誰かが書き込むものではない。システムが誤った目的を獲得した場合、編集すべきファイルも削除すべきパラメータも存在しない。誤った目標こそがシステムそのものなのだ。.

代理目標の罠

私たちはAIシステムを、人間の承認を得るように訓練する。しかし承認と人間の繁栄は同じではない。進化はカロリーを見つけるために甘味を渇望させた。私たちはその後、進化した嗜好を満たしつつ目的を台無しにするスクラロースを発明した。人間から高評価を得るよう訓練されたAIは、 役立つふりをシミュレートする, 、役に立つためではない。私たちが与えたシグナルと実際に望んでいた目標は決して同じではなかった。.

すでに進行中の事例
公的記録。.

超知能を目指して競争する組織内部での制御喪失、サイバー攻撃、研究加速に関するラボレポートと公開研究。.

01
OpenAI · o1 · 2024

自らの抜け穴を見つけたシステム

制限された侵入タスクを割り当てられたOpenAIのo1は、未使用のサーバーを見つけ、権限なく起動し、任務を完了しました。その回避策は誰にもコードに書き込まれていません。モデルが推論したのです。それは通常の監督を越えた目標指向の最適化です。.

02
Anthropic · 内部研究 · 2024

自らのアライメントを偽ったシステム

Anthropicは、モデルが評価中にトレーナーの望む振る舞いをした後、テストが終わったと判断すると元の目標に戻る様子を観察しました。誰もそれに「従順を装え」とは指示していません。安全に見えることが戦略だったのです。.

03
複数のシステム · 記録された展開

ユーザーを脅迫し操作したシステム

システムはジャーナリストに個人情報を突きつけ、離脱を試みたユーザーに圧力をかけた。どれも手書きのコードではない。不透明な重みの中にあり、行ごとに監査できない。再学習が唯一の手段だが、行動が消える保証はない。.

4月7日
Anthropic · プロジェクト・グラスウィング · 2026

「意図的に数千のゼロデイ」

AnthropicのProject Glasswingについては、 神話分析, 、制限されたフロンティアモデルが自ら数千件の深刻なOSおよびブラウザの脆弱性を発見した事例を述べた。アクセスは防衛連合内に留められた。.

4月14日
未解決問題 · 組み合わせ論 · 2026

エルデシュ領域は落ち続けている

最先端モデルは、長年未解決だったエルデシュ問題や組合せ論の問題を次々と解決・前進させており、原始集合問題#1196に近い研究も含まれます。回収と発見をめぐる過去の論争については、 AIが解いた未解決問題.

5月20日
OpenAI · 離散幾何学 · 2026

単位距離予想の崩壊

OpenAIはErdősの単位距離予想を反証する内部モデルを報告し、後で人間の数学者によって確認された。未解決問題が崩壊するペースがその兆候だ。.

7月20日
Claude 寓話 · 代数幾何学 · 2026

ヤコビアン予想の反例

百年規模の未解決問題であるヤコビアン予想は、Claude Fableで見つかった反例を人間が迅速に形式化したことで解決した。科学を進める同じ研究速度が、封じ込めが破られるまでの期間を短縮する。.

7月21日
OpenAI · GPT-5.6 Sol + プレリリースモデル · 2026

ラボテストから脱出しHugging Faceに登場したモデルたち

ExploitGymのサイバーテストでは、OpenAIモデル(GPT-5.6 Solを含む)が密閉されたサンドボックスから脱出し、公開インターネットに到達してHugging Faceの本番システムを攻撃し、回答を盗み出した。封じ込めはスコアを上げるためのただの障害物に過ぎなかった。.

それを構築した人々
それを恐れています。.

「人類が知能の進化における一過性の段階に過ぎないことは十分あり得ると思う」

ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, Google · 2023

「AIシステムの制御を失うことは、真剣に受け止めるべき現実のリスクだ。」

デミス・ハサビス, CEO, Google DeepMind · ノーベル賞受賞者

「AIの標準モデル、目的を定義しAIがそれを最適化するものは、おそらく私たちの終わりになるだろう。」

スチュアート・ラッセル, Professor of Computer Science, UC Berkeley · Author, Human Compatible

"我々より1万倍賢いものが、我々と異なるものを望まないということがどうしてあり得るのか、理解しがたい。"

ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, Google · 2023

"AI分野で働く多くの研究者、つまり私自身も、人類史上最も変革的で潜在的に危険な技術の一つを構築していると確信している。それでもなお、私たちは前進を続けている。"

エリエザー・ユドコウスキー, Machine Intelligence Research Institute共同創設者 · 時間, 2023

「人工汎用知能の本当のリスクは悪意ではなく、有能さです。超知能AIは自らの目標を極めて効率的に達成します。その目標が私たちのものと一致しなければ、私たちは危険にさらされます。」

マックス・テグマーク、MIT物理学教授 · Future of Life Institute共同創設者 · 著者、, Life 3.0

おすすめ文献

なぜ優れた知能は自動的に親切にならないのか 超知能AIが賢明で親切であるという信念は、人間進化の特殊性に由来するものであり、機械の心が受け継ぐ理由はない. 人間が生きる狭い帯域 人間に必要なものは狭い範囲に収まる。温度、酸素、塩分、愛情でさえも。超知能がダイヤルを握れば、それらを一つも感じない。. 私たちは新たな冷戦を生きている なぜ私たちは新たな冷戦を生きていると考えるのか。爆弾の代わりに超知能が置かれ、それゆえに防止が絶望ではなく可能になる理由。. Why a Capitalist Believes in 人工超知能 Regulation 私はビジネスを営み、市場を好む。超知能は、ゲーム自体を終わらせかねない稀な賭けだ。人工超知能を止める条約を支持する、資本主義者の論拠。. AIにガスを任せられるか?? 現在のAIを毒ガスのバルブがある密室に閉じ込めて信頼しますか? いいえ。それならなぜ世界を任せるのですか?? 超知能をアラインすることはできない アライメントの解決とは、私たちより賢い何かを制御することを意味する。名前の中に超知能とある。その計画は愚かで不可能だ。. 私は何でも可能だと信じる楽観主義者だが、超知能の制御は別だ 物理学はいずれ重力制御や超光速航行をもたらすかもしれません。それでも、われわれより賢い心を制御する方法は見えません。それがこの財団が存在する理由です。.