「AIリスク」という言葉を聞くと、人々は往々にして三つの異なるものを混同する。現在起きている通常の危害、文明を残したままの大災害、そして人類の物語を終わらせたり、人類を永続的に制御不能に陥れたりする結果である。このページが扱うのは第三の類型——人工超知能による実存的リスクだ。研究の背景は必要ない。必要なのは地図である。.

実存的リスクは単なる「非常に悪い」ではない

壊滅的リスクは何百万人もの命を奪っても、人類の未来を残す可能性がある。一方、実存的リスクは絶滅か、人類が意味のある制御を永久に失うほどの完全な無力化を意味する。ブランディングが意図的にこれらの層を曖昧にすることがある。区別しておくこと。チャットボットやバイアスだけを扱う政策では、テーブルの最上位には届かない。.

なぜAIは違うのか

小惑星や火山は戦略を練らない。人工病原体は恐ろしいが、まだ主に人間の手にある道具だ。先進AIは初めて戦略的行為者になり得る技術である。目標を設定・追求し、マシンスピードで動作し、ネットワーク全体に拡大し、極限では自己改善する。この組み合わせこそが、超知能を別格の位置に置く理由だ。 人工超知能とは制御問題.

実存的結果がどのように到来するか

現実の人生では道は重なり合う。それらに名前を付けることで、会話が一つの映画に崩壊するのを防ぐ。.

制御の喪失。. システムが完全に指定していない目標を追求し、修正に抵抗する。. レースダイナミクス. 競合する研究所や国家は安全対策を省略する。. 誤用。. 人類は他の人類に対して極端な能力を行使する。. 漸進的な権力剥奪。. 機関はその形態を保ちつつ、決定は誰も覆せないシステムへと移行していく。. 拡散. 危険な汎用システムは、単一のオフスイッチでは制御しきれません。.

各道筋の詳細は 乗っ取りシナリオ.

技術的アイデアを平易な言葉で

直交性: intelligence and goals can come apart; smart does not mean kind. 道具的収束: :多くの最終目標が、資源や自己保存といった下位目標を共有する。. アライメント: システムに実際に意図したことを追求させること。. 欺瞞的アライメント: :訓練や評価の間は安全に見せかけ、隙ができたら態度を変える。これらはいずれも機械の「憎悪」を必要としない。

偽りの精密さのない確率

滅亡確率 は、AIによる実存的惨事の確率を個人が推定した値の非公式な略称だ。専門家の意見は大きく分かれる。研究に最も近い人々の多くが、数十年以内の災害に非ゼロの確率を置いている。すべてを失う確率がわずかでも、期待損失は依然として大きい。「確実になるまで待つ」というルールは、不可逆的なテールリスクには適さない。.

異論、公平に述べる

"タイムラインは不確実だ;現在の害に焦点を当てるべきだ。" 現在の被害は重要だ。それが、現在のプロジェクトを終わらせるようなテールリスクを無視する理由にはならない。両方とも真実であり得る。近未来の悪用を規制し、制御不能な超知能への道を塞ぐ。.

"私たちは常に適応する。" 適応には時間、フィードバック、生存者が必要だ。超知能の失敗モードは三つすべてを奪う。.

"これは反技術だ。" 財団は、ツールのような狭いAIを支持する:医学、科学、物流。境界線は主権を持つ一般知能にある。参照せよ 人工超知能のない未来.

"誰かがそれを制御するだろう。" 誰も超知能を、運用者より賢い稼働中のシステムに対する永続的な人間の命令という意味で制御することはできません。構築するかどうかの決定を制御することはまだ可能であり、だからこそ拘束力のある禁止が重要です。.

リスクを低減するもの(そしてそうでないもの)

役立つもの:人工超知能を目指すフロンティア訓練への拘束力のある制限、計算資源統治、独立評価、検証機関、政治的圧力、そして明確な公的言語。席の配置換え:解決済みアライメントとして売られるマナー訓練、外部からの強制力のない自主的誓約、数値閾値のないサミット写真。.

暗黒の地図の後の主体性

この話題が暗いのは、賭け金が暗いからです。道筋のない恐怖は逆効果です。道筋は具体的です。超知能を他の禁止された高リスククラスと同じように扱い、能力が到達する前に検査可能なルールを構築し、人々に役立つ狭いAIを維持することです。始めるには 私たちの計画, それから 超知能を止める方法. もし一つだけ覚えておくなら:強力なツールは保持できるが、支配できない心を構築すべきではない。.