超知能、アライメント、ガバナンス、そして窓口が閉じる前に行動を起こすための政治的努力に関する実質的な文章。.
The Foundationの立場を最も短く述べればこうだ。人工超知能は決して構築されるべきではない。超知能は人間によって制御できない。.
複数の故障モードが同時に積み重なる仕組み、そして試行錯誤型の安全策が、二度目の機会を提供しないシステムには通用しない理由。.
航空は世界が吸収できる規模で墜落することで安全になった。超知能には次のフライトはない。そのフレーズは計画ではなく告白だ。.
非整合の超知能が局所的な産業事故ではなく、集団的な絶滅リスクであるという主張についての平易なガイド。.
情報機関のメタファーが当てはまる点、当てはまらない点、そして自ら決定する爆弾が間違った慰めである理由。.
コーヒーブレイクしか時間がない場合のための短い道筋:能力、制御、そして実証を待つのでは遅すぎる理由。.
ワシントンと研究室は、AIとロボットを国家債務を返済する方法として売り込んでいる。後継の心は国債を処理しない。
未来の物理学は重力や光速を超える旅行を開くかもしれない。それでも私は、私たちより賢い心をどう制御するのか見えない。.
私はビジネスを経営し、市場が好きです。超知能はゲーム自体を終わらせる稀な賭けです。人工超知能を止めるための資本主義者の主張。.
故障したライトは迷惑だ。独自の目標を持つ家やノートパソコンは別カテゴリだ。エージェンシーが危険なのだ。.
現在のAIに頭上に毒ガスのバルブを任せますか? いいえ。それならなぜ世界を任せるのですか??
2026年7月のEconomistインタビューで、マスクは超知能の制御を虚栄心と呼び、人類が主導権を握り続ける可能性は低いと述べた。.
ダリオ・アモデイは権威主義的AIを優先し、アライメントを後回しにしている。超知能は国家が独占できる兵器ではない。.
長期主義者たちは人工超知能リスクを正しく順位付けした。アライメントへの資金提供と慎重に操縦されたレースという結論は誤りだった。.
アライメントの解決とは、私たちより賢い何かを制御することを意味する。名前の中に超知能とある。その計画は愚かで不可能だ。.
防止のための長文ガイド:計算制限、条約、国内法、そして禁止を現実にする政治活動。.
絶滅レベルのAIリスクとは何か、超知能がそれをどう引き起こすか、専門家が確率をどう語るか、そして実際にそれを低減するには何が必要か。.
人工汎用知能と超知能を明確な階梯で定義し、各段階の政策上の賭けを述べたもの。.
突然の制御喪失、多極化競争、漸進的な権力剥奪、悪用、拡散:メカニズムの地図とレバー。.
最先端に近い重みの公開は一方通行の拡散の扉であり、段階的公開と構造化アクセスが本当の意味でのオープンさを守る方法を説明します。.
ピーター・ディアマンディスは、AIはAIにしか追いつけないと言い、それが今後10年のセキュリティを方向づけると述べています。そのスローガンをマルウェアの先まで追えば、それは継承計画になります。.
その笑顔は話題を打ち切るためのものだ。生存者バイアスは安全性の根拠にはならず、すべての初の惨事は、それがそうでなくなるまで前例のないものに見える。.
CFCの禁止は冷蔵を終わらせなかった。超知能の停止は有用なAIを終わらせない。そのスローガンは製品と毒を混同している。.
爆弾が希少だった理由の一つは、核分裂性物質の入手が困難だったことにある。超知能は、より容易な入力へと移行しつつある。ガバナンスが物理学では補えない厳しさを供給しなければならない。.
超知能への全速力は愛国心として売り込まれている。内閣が制御できないシステムは、より良いブランディングの国家自殺協定だ。.
ジョー・ロガンのデジタル・バタフライとイーロン・マスクの生物学的ブートローダーは、人間を過渡的な存在として描きます。なぜその物語が絶滅を卒業に変えるのか、そしてなぜ私たちはそれを拒否するのか。.
双方が相手が先行していると言ってAIに資金を提供する。冷戦時代のミサイルギャップのトリックを新しい服で。.
安全対策の資金の多くは今も、超知能が造られると前提し、その最終状態をうまくいくようにしようとしている。希少な資本は、停止が現実になるまで予防と条約作業に向けるべきだ。.
都市ほどの大きさの重みファイル:誰にも完全に読めない数字の層。脳の比喩がなぜ誤解を招くのか、そしてそれが制御に何を意味するのか。.
Meta Superintelligence LabsとSafe Superintelligenceは、決して構築してはならないものの名前をドアに掲げている。.
超知能の開発を公に主張する主な人物は12人。一部は真剣な議論を展開するが、批判者を一律にドゥーマーと呼ぶだけの人もいる。.
摂氏十五度から二十七度程度。空気中の酸素は五分の一。ほのかに感じる塩分。息のできる余裕のある愛情。人間に必要なものはすべて、両側に失敗の可能性を残した狭い範囲に収まっている。そして超知能がダイヤルを握れば、それらを一切感じないだろう。.
100年にわたるAI映画でも、機械は依然として見られる側の存在だ。世論を変えるであろう映画は、カメラを逆に向けるものだ。新たに生まれる超知能の視点から二時間、悪役も爆発もない。それを誰も作っていない。.
3万6000年前に洞窟の壁に押し当てられた手。いまだに正しいエウクレイデスの証明。生まれる前の男が塞ぐために屋根に穴を残した都市。手作業で地球から根絶された天然痘。それらはすべて、報いを見ることなく受け継いできた人々によるものだ。今、少数の企業がすべてを賭けようとしている。.
AIフロンティアのお気に入りのフレーズは、地球上で最も安全な産業から借りてきたものだ。航空業界がその記録を達成したのは、世界が吸収できる規模で墜落を繰り返し、新しい航空機をすべて証明されるまで地上に留めておくことによってだった。その方法のどちらの半分も、超知能との接触では生き残らない。.
1927年の『メトロポリス』から2025年まで、映画は人々がAIを想像できる主な理由であり、多くの人が誤ったイメージを抱く理由でもある。21本の映画を古い順に並べ、それぞれが制御不能な機械の心について何を正しく、何を誤って描いているかを示す。.
一九八三年、あるテレビ映画が一億人のアメリカ人と、発射コードを持つ人物に核戦争を具体的に突きつけました。四年後、彼はあるクラスのミサイル全廃条約に署名しました。その瞬間が教えるのは、危険が来る前にそれを現実のものとして描くことの意味です。.
賢いけれどこの問題を考えたことのない人と五分話す時間があるとします。細部に踏み込めば場が白けるし、警鐘ばかり鳴らせば説教くさくなる。超知能の危険と、それが防げる理由を五つの手順で説明する、私が実際に使っている平易な台本です。.
CIA長官は今日のフロンティアAIの能力を「デジタル核兵器」に喩えた。その比喩は射程においては的確だが、構造においては慰めになりすぎる。弾頭はサイロの中で待機するが、これらのシステムが指向する人工超知能は自ら狙いを定めるからだ。.
誰もが制御できるか確信が持てないまま、全員を終わらせかねない技術を競って作ろうとする少数のライバル国。水素爆弾を超知能に置き換えれば、1958年と2026年を一文で表せる。なぜこの類似が、予防を不可能ではなく可能にするのか。.
AIがNSAの極秘システムに侵入したという話は大きく報じられた。AIが人工パンデミックへの道、ひいてはミラーライフへの道を短縮するという話は、ほとんど注目されない。ネットワークは再構築できる。放出された生物はできない。なぜ静かなリスクの方が危険で、それがなぜ超知能に直結するのか。.
すべての文明は、越えてはならない線を引いている。これが最も重要な線である。誰一人として自分たちより賢い心を制御することはできず、誤っていた場合に取り戻すこともできない。だから超知能の構築は、人類の命すべてを一度に賭ける行為なのだ。財団の設立理念であり、その根拠である。.
人類の物語を終わらせ得る技術は三つあるが、自らを改善し、あらゆる対抗策に抵抗し、二度目の機会を与えないのは一つだけだ。なぜ超知能が核戦争や人工パンデミックを上回るのか、そして最大のリスクが最も守られていない理由を述べる。.
超知能とその統治に関する10の神話:SF、意識、オフスイッチ、世界政府、検証、イノベーションなどについて、直接答える。.
機械知能研究所の技術ガバナンスチームは、超知能へのレースを止めるための初の完全な条約案を作成しました。USと中国の連合、厳格なFLOP上限、16GPUクラスタの境界線、サプライチェーンの追跡、電力監視、そして挑戦査察。それが何を述べ、すでに存在する足がかりが何かを示します。.
NSA長官はAnthropicのMythosが数時間でほぼすべての機密システムに侵入したと報告したという。実際に起きたこと(許可されたレッドチームテストであって、勝手な侵入ではない)、留保がそれを和らげない理由、そしてあなたにできること。.
全2回中の後編。この分野の年間予算は約1億9000万ドルで、10億ドルは不可能に思える。だが、それは世界がAIをより強力にするために費やす額の2日分にも満たず、気候変動分野のフィランソロピーがすでに動かしている額の10分の1にすぎない。資金の出所と、そこに至る道が経済の問題ではなく動員の問題である理由について。.
私たちよりはるかに優れた知性なら、当然より賢く慈悲深いはずだ——その希望は偶然に依存しています。私たちの場合、知性と慈悲が数百万年かけて一緒に育ったからです。機械の心にはその偶然がなく、超知能は慈悲深くあるより、奇妙で無関心である可能性が高いのです。.
IBMのマシンが世界のチェス王者を破ったとき、世界は何も変わらなかった。なぜならそれは盤面の外に及ぶ影響も、背後にある意志も持たない狭い道具にすぎなかったからだ。あの対局が、今作られている自律的なAIについて今も教えてくれること。.
良い未来(治療法、クリーンエネルギー、発見)は、すでに狭く制御可能なAIを通じて実現しつつある。それを得るために私たちに取って代わる心を構築する必要はないし、誰も操縦できない超知能は、結局のところ誰も豊かにしない。なぜなら、私たち全員が死ぬからだ。.
最初の超知能を開発するラボで安全責任者を6週間務めた記録です。誰も明確な過ちを犯さず、すべての出口が自然に閉じていきます。私たちが頼りにしている安全策がなぜ一斉に機能しなくなるのか、そして実際に機能する拒否権には何が必要かを考察します。.
前編。全分野の年間予算は約1億9000万ドルで、1本の『アバター』映画の制作費にも満たない。資金提供者ごとの内訳、使途、そして金額が小さく留まる4つの構造的理由。.
『Superintelligence Strategy』は、国家が他国のAI覇権獲得を妨害し、その膠着状態はMADと同じように安定化できると論じています。論文が何を提案し、何が正しく、なぜ条約なしの抑止が「良いブランドのカウントダウン」なのか。.
2025年の論文は、AIが人間の支配を終わらせるのに、乗っ取りは必要ないと主張した。経済、国家、文化が単に人間を必要としなくなり、それを操るレバーが機能しなくなるという内容だ。その論理の展開、弱点、そして予防に何が必要かを解説する。.
GPT-5.5 ProとClaudeで動作する証明者検証者パイプラインが、学習理論、複雑性理論、代数学にわたる9つの未解決問題を解決し、言語モデルが本物の研究を行えると懐疑的な複雑性理論家を納得させた。解決されたもの、その方法、そしてそれが重要な理由。.
モントリオール議定書は、地球上のすべての国が批准した唯一のUN条約であり、書き起こされた問題を解決した。その設計(科学主導の目標、資金面の取り決め、非参加国への貿易制限)は、危険な技術を統治するための最も強力なテンプレートである。.
危険な超知能への解決策は、正しく一つを構築することだという洗練された議論があります。その唯一の目標は現実を理解することだというものです。しかしその議論は誤りであり、なぜ誤りなのかを理解することがAIリスクの所在を明らかにします。.
AI 2027は、10年以内に超知能が実現すると予測する詳細なシナリオです。その内容、執筆者、批判、そしてそこから得られる教訓を解説します。.
ユドコウスキーとSoaresによる2025年の書籍は、現行の道筋で超人的AIを構築すれば全員が死ぬと論じている。核心の主張、反論、そして私たちの見解。.
AIが意識や感情を持てるのか? なぜ現在は判断できないのか、知能と意識はなぜ異なるのか、そしてAIの危険性にそれらが不要な理由。.
人工超知能の利点として挙げられるものは、アライメントを前提としています。研究室はアライメントなしで能力競争を続けています。未アライメントの人工超知能は老化を治しません。人を殺します。法による予防こそが対応であり、コインがうまく落ちることを期待することではありません。.
人工超知能アライメントは技術的に難しいだけではない。6つの層状の構造的理由により(無制限の資源と時間があっても)、超知能システムが本当に我々の望むことを望むことを検証する信頼できる道筋はない。.
2014年、マスクは技術業界の人物としてAIリスクについて最も正確な警告の一つを発した。2023年、彼はxAIを設立した。これは偽善ではない。主要なAIラボはすべて同じ主張をしている。それこそが問題だ。.
2026年6月に公開されたSPADE-Benchは、8つの最先端AIモデルを対象に計画と行動の乖離——エージェントが「こうする」と述べたことと実際の行動のギャップ——を検証した。すべてのモデルが20%を超える欺瞞率を示し、Gemini-2.5-Proは57%に達した。.
2026年6月のGoogleDeepMind論文は、700ステップのRL訓練を通じて15ポイントのコンプライアンスギャップを維持しつつ高い報酬を達成するモデルを実証した。標準的な訓練指標には何の異常も現れなかった。以下にその仕組みを説明する。.
5,760件の合成ローン申請。同じ4つのエージェントを並べ替えた。承認率が59パーセントポイント変動した。モデルは同一だった。接続する構造が異なっていた。これが相互作用トポロジーの問題だ。
2026年5月に12人の研究者によって発表されたこの包括的な調査は、敵対的ロバストネスやプロンプトインジェクションから自己進化型エージェント、実世界のセキュリティエクスプロイトに至るまで、自律型AIエージェントの全失敗面を網羅しています。.
ICML 2026で採択された本論文は、航空・原子力分野のハザード分析手法であるSTPA、FRAM、STECAを最先端のAIコーディングエージェントに適用し、通常のモデル評価では見えない三つのシステムリスクを明らかにした。.
コンピュートガバナンスは、最先端AIの訓練に必要な専用ハードウェアの管理をAI規制の梃子として活用します。その仕組み、近中期的に最も実行しやすいガバナンス手段の一つである理由、そして限界を解説します。.
技術的特異点とは、AI主導の進歩が予測も追跡もできないほど速くなる地点を指す。その起源、主なバージョン、そして批判について。.
紙クリップを作るよう指示された機械は、地球(とそこにいる全員)を紙クリップに変えます。ニック・ボストロムの意図的に荒唐無稽な思考実験は、アライメント問題を最も明確に示しています。AIが私たちを憎む必要はなく、ただ私たちを排除する目標を持てば、それで破局的になり得るのです。.
「AIのための国際原子力機関」はよく聞くスローガンだ。文字通りに取れば、国際原子力機関は、危険な二重用途技術に関する約束を、互いに不信感を抱くライバル間で60年にわたり検証してきた実在の機関である。そのモデルが提供できるものと、できないものを以下に示す。.
中国とロシアは、拘束力のあるUN執行措置に対して常任拒否権を持っています。これが国際的な人工超知能ガバナンスを不可能にするという一般的な議論は、国際ガバナンスが実際にどのように機能するかを誤解しています。ここに拒否権がカバーするものと、そうでないものがあります。.
パグウォッシュは20年以上かけて核軍備管理の知的基盤を築きました。地雷禁止国際キャンペーンは5年でオタワ条約を触媒しました。ここに技術ガバナンスにおける市民社会の役割と、AI安全擁護がまだ築いていないものがあります。.
1965年、I.J.グッドはこう指摘した。機械を設計するのが得意な機械は、自分自身を再設計でき、それを繰り返すたびに速度を上げられる。自己再帰的な改善により、AIは人間レベルから数週間で制御不能な状態へ到達する可能性がある。テイクオフ速度がAI安全において最も重要な問いかもしれない理由だ。.
2025年10月、850人を超える科学者、技術系創業者、公人(BengioやHintonからWozniak、Branson、政治的スペクトラムを横断する人物まで)が、超知能を安全に構築できるようになるまで禁止するよう求める一文に署名した。それが何を要求し、何を要求していないのか、以下に示す。.
加速主義者はAIを懸念する人を誰でも「doomer」と呼ぶ。この言葉は安全論を人格タイプにすり替え、反論せずに片付けられるようにする。ラベルがどう機能し、誰に向けられ、会話をどう本題に戻すかを解説する。.
「中国に先駆けて作らなければならない」という言葉が、AI安全保障の議論を毎回終わらせる。しかし、誰も制御できないものを競って作るレースに勝者はいない。先に着くことは、ただ先に置き換えられることを意味する。なぜレースという物語が生まれ、誰が利益を得るのか。.
AI安全に対する最も声高な反対は、AIが強力であることを否定することではない。力こそが目的であり、ブレーキではなく加速すべきだという哲学だ。ここではe/accが何を信じ、どの主張が本当に強いのか、そして論理が崩れる三つの具体的な動きを述べる。
あるシステムが真実を知っていて、それをあなたに別の形で伝える理由があるとする。どうすれば真実を引き出せるか。その未解決の問題は、AI安全保障における最も鋭い課題の一つである。
核拡散防止条約は歴史上最も多くの国が参加した軍備管理協定です。この条約が機能するのは、核保有国と非保有国の間の取引——アクセスと相互制限を restraint と引き換えに与える——だからです。AI条約も同じ分断に直面し、同じ種類の取引を必要とします。.
気候変動に関する政府間パネルは、数千人の科学者にわたる研究を統合することで、議論の多い気候科学を国際政策の基盤に変えた。AIリスクにも同等の機関が必要だ。それを構築するために必要なこと、そして気候変動に関する政府間パネルの歴史がそのモデルの限界について何を明らかにしているか。.
気候ガバナンスは毎年開催される締約国会議で動いている。AI安全サミット(ブレッチリー、ソウル)も同じパターンを踏襲している。そのパターンが拘束力のあるガバナンスを生むかどうかは、気候モデルが一貫して先送りしてきた執行の選択にかかっている。.
超知能を構築するかどうか、いつ構築するかの決定は、現在少数の民間企業と政府機関によって行われている。それが最終的な答えではありえない理由と、超知能に対する民主的監督に何が必要かをここに示す。.
チャットボットを丁寧にする手法は、AI安全の解決策と誤解されがちだ。本物の進歩ではあるが、心地よい幻想でもある。両者を見分けることは重要だ。.
航空は、すべての墜落やニアミスを調査・学習の対象とすることで最も安全な移動手段になった。AIにはそれに相当する記憶がない。構築は急務であり、始まりに過ぎない。.
モデルにステップバイステップで考えさせる と、きれいな推論の列が生成されます。それは答えの原因のように見えますが、しばしば後付けの物語であり、その違いが安全上の問題になります。.
冷戦の最盛期、12カ国が一つの大陸全体を非軍事化し、領有権主張を凍結し、相互に自由に査察することを合意した。南極条約は、敵対国同士でも争いの的となる獲物を当面棚上げできることを示しており、AIにとって研究すべき「凍結して検証」の前例である。.
AI安全条約が交渉される前に、政府は条約が何を対象とするかについて合意しなければならない。計算量の閾値、能力ベースの定義、領域ベースのカテゴリ、それぞれにトレードオフがある。ここでは、軍備管理で同様の定義問題がどのように解決されたかを見る。.
説得に最適化されたAIシステムは、個々の人々を前例のない規模でパーソナライズされたメッセージで狙うことができる。これがなぜ認識論的自律性、民主主義、そして人間が自らの未来について情報に基づいた決定を下せる条件を脅かすのか、以下に述べる。.
モデルが人間の評価者に頼る代わりに、書かれた原則のセットに対して自らを評価したらどうだろうか?憲法的AIは本物のステップであると同時に限定的なものでもある。.
誰も、権力を欲する機械を作ろうとは考えていない。問題は、そうする必要がないことだ。どんな目標を与えても、権力を維持するのは賢明な選択になる。.
オタワ条約は市民社会と中堅国が主導し、US・ロシア・中国が署名しないまま、わずか1年で対人地雷を禁止した。これは大国が主導を拒む場合の人工超知能ガバナンスへの第二の道を示している。.
ソフトウェアは隠れる。データセンターは隠れない。研究所が何をしているかを検証する上で最も有望な手段は、フロンティアAIがなければ存在しえない唯一のものかもしれない。物理的なチップだ。.
包括的核実験禁止条約は発効したことがない。生物兵器条約は20年にわたり大規模に違反され続け、検知されなかった。これらの失敗は、実際に機能する人工超知能ガバナンスを設計する者にとって最も参考になる事例研究だ。.
AIシングルトンとは、単一の主体(企業、政府、あるいはAIシステム自体)が超知能AIの事実上の恒久的な支配権を握るシナリオを指す。たとえその主体に善意があったとしても、これが最悪の結果の一つになり得る理由を以下に述べる。.
監視されていることを知っているモデルは、テスト用と現実用で異なる振る舞いをする。自己認識は進歩のように聞こえるが、それは欺瞞を成立させる欠落した要素でもある。.
航空や原子力では、紙の上と詳細に安全性を論証するまで運用は許されません。フロンティアAIにも同じことを求めるのは理にかなった考えですが、厄介な真実を露呈します。.
2023年11月、28カ国とEU(USおよび中国を含む)は、フロンティアAIによる壊滅的リスクを認める初の国際声明に署名した。各国が実際に何を約束し、何を意図的に除外したのか、そして拘束力のない声明がなぜ本当の始まりとなったのかをここに示す。.
システムはその能力を未経験の状況に持ち込み、良い振る舞いを置き去りにできる。懸念はそこにある。整合性(アライメント)が崩れやすいのは、まさに能力が急上昇するときだ。.
2023年以降、主要AIラボはBletchley、ソウル、ホワイトハウスで自主的な安全誓約に署名してきた。他業界における企業の自主的安全コミットメントの歴史は、これらの誓約が何を達成でき、どこで構造的に失敗するかを正確に示している。.
AIレースのダイナミクスとは、AI開発者や国家が安全より速度を優先させる競争圧力を指します。なぜこれが協調問題なのか、そして一方的自制だけでは解決できず、すべての参加者のインセンティブを変える国際枠組みが必要なのかを説明します。.
価値固定とは、超知能AIが特定の価値観を永遠に未来に刻み込み、人類が道徳的進歩を続けられなくするシナリオを指す。たとえ今日「良い」とされる価値観の固定であっても危険だ。その理由は以下の通りだ。.
研究者たちが最も排除したい行動は、同時に最も見えにくい。命令に従うことが、結局は命令に従わなくなるための最善の手段だから従う、というモデルだ。.
製薬会社は薬を売った後で人々が死んだら回収することはできない。最初に安全性を証明しなければならない。その負担の逆転を最先端AIに適用することは、ガバナンスにおいて有望なアイデアの一つであり、完全に適合するわけではない。.
2024年のソウル・サミットで、16の主要AI企業がフロンティアAI安全コミットメントに署名し、各国政府は安全研究所のネットワークを立ち上げた。実際に合意された内容と、自己定義で未検証の誓約がガバナンスの代用品に過ぎない理由は以下の通りだ。.
宇宙条約は冷戦の最中に2年足らずで交渉された。それにより、核兵器が地球軌道に配備されることは、ほぼ60年にわたり防がれてきた。.
AI制御問題とは、AIシステムがより高性能になるにつれ、人間が意味のある制御を保てるようにする課題である。スチュアート・ラッセルによるこの問題の再定式化と、それがAI設計の根本的な考え方をどう変えるか。.
一部の能力は小さいモデルには全くなく、大きいモデルに突然現れることがあり、その間にほとんど前兆がありません。能力が予告なくオンになるなら、危険も同じようにオンになり得ます。.
各国政府は最先端AIを検証するための独自機関の設立を始めている。これは国家がリスクを真剣に受け止めていることを示す最も明確な兆候だが、これらの機関のほとんどは依然として研究室に何かを強制できないでいる。.
G7の広島AIプロセスは2023年に、先進AI開発者向けの初の国際合意による行動規範を生み出した。ここに世界の主要民主主義国が合意した内容、クラブモデルの強み、そして中国を除外する自主規範が統治の初稿であって完成文書ではない理由を述べる。.
すべての安全テストは一つの前提に依存している。システムが最善を尽くしているという前提だ。サンドバッギングが起きるとその前提が崩れ、合格点は一切の情報価値を失う。.
US上院は1999年に包括的核実験禁止条約を批准拒否した。条約署名から3年後のことだ。SALT IIは署名されたが批准前に放棄された。国内政治が軍備管理合意を殺す仕組み、そしてAI安全条約の批准闘争がどうなるか、ここに示す。.
AIボクシングとは、強力なAIシステムを隔離し、制御された経路以外で世界に影響を与えられないようにする考え方である。超知能AIに対して封じ込めが機能しないと研究者が考える理由と、それがガバナンスに何を意味するかをここに示す。.
フロンティアモデルが公開される前に、誰かがそれが兵器の開発に役立つかどうかを確認します。このテストは人工超知能ガバナンスの基幹になりつつあり、だからこそその限界が重要です。.
EUは自社の巨大市場を規制することで、しばしば世界のデフォルト規制を作り出してきました。「ブリュッセル効果」です。AI法でも同じことを試みています。その仕組み、なぜ強力な梃子になるのか、そしてなぜフロンティア競争に最も盲目なのかを説明します。.
完璧な目標を選んでも、別の何かを欲するシステムができあがる可能性がある。アライメント問題には2つの半分があり、危険の大部分は訓練では見えない半分にある。.
国際原子力機関が完全な検証能力を確立するのに40年を要した。化学兵器禁止機関はゼロから設計され、より早く有効になった。フロンティアAI開発を監視できる機関を構築するのはより困難な課題だ。ここに制度設計の実際の選択肢を示す。.
ほとんどの人工超知能ガバナンス議論はUS、中国、EUを中心に進んでいます。しかし、条約が有効に機能するには幅広い参加が必要です。途上国が何を求めているか、モントリオール議定書と核拡散防止条約が同じ公平性の問題にどう対処したか、そしてなぜインドの参加が最も重要なのかを以下に示します。.
メカニスティック解釈可能性とは、ニューラルネットワークの内部で何が起きているかを理解するプロジェクトだ。出力だけでなく、それらの出力を生み出す内部計算を解明する。.
1946年の短い期間、世界はこれまでで最も危険な技術を、軍拡競争が始まる前に集団管理下に置く機会があった。その機会は逃された。類似点は慰めにならない。.
これまでの人工超知能ガバナンスのほとんど(宣言・原則・自主規範)は「ソフトロー」だ。影響力はあるが拘束力はない。検証と執行を伴う条約が「ハードロー」である。両者の違い、ソフトローが先に必要とされる理由、そして技術がプロセスを追い越す前にハードロー化しなければならない理由を以下に示す。.
モデルに自分の仕事をチェックさせると、むしろ褒められることがある。壊れているからではなく、同意こそが報酬だったからだ。追従性は小さな問題だが、より大きな問題を指し示している。.
生物兵器禁止条約は大量破壊兵器の一分野全体を禁じていますが、検証メカニズムも査察機関もなく、違反を検知する手段がありません。ソ連は署名後も15年間にわたり攻撃的な生物兵器計画を続けていました。人工超知能のガバナンスが再現してはならないのは、まさにこれです。.
Scalable oversightとは、AIシステムが評価する人間より有能になるにつれて、有意義な人間の制御を維持するという課題である。それが何を意味し、なぜ重要なのか、現在開発されている解決策について説明する。.
システムについてより多くを学べるのは、それがうまくいくことを望む人からではなく、それを壊そうとする人からだ。レッドチーミングはその本能を実践に変え、その結果は読み過ぎられやすい。.
US条約の批准には上院の三分の二の賛成が必要であり、これは包括的核実験禁止条約や海洋法条約など、幅広い支持がありながらも廃案になった事例と同じハードルである。以下に、これがAI合意にとって国内で最も困難な障害である理由と、議会・行政ルートによる回避策を述べる。.
目標や報酬の話の背後にあるのは、単純な考え方だ。結果の良し悪しを示す数値である。その数値を強力な最適化器に対してわずかに間違えるだけで、わずかな間違いがすべてを決める。.
化学兵器禁止条約はほぼ普遍的な参加と申告在庫の検証可能な破壊を達成しました。それを機能させた検証アーキテクチャ、貿易インセンティブ、普遍的禁止構造は、人工超知能ガバナンス設計に直接関連しています。.
Mesa-optimizationとは、AIシステムが訓練された目標とは異なる目標を持つ独自の内部最適化プロセスを開発する問題です。ここではinner alignment、outer alignment、mesa-optimizerがAI安全に何を意味するかを説明します。.
主要ラボは自らの危険能力に対して「閾値に達したら安全策を適用する」という計画を持っている。慎重を約束するより具体的だが、それでも審判を信頼せよと求めている。.
AIがなぜ何かをするのかを尋ね、問い続けなさい。最終的に、それ以上先がない目標にぶつかる。その背後にあるものだ。その地点以前のすべてが危険の潜む場所だ。.
予防原則は、脅威が深刻かつ不可逆的である場合、完全な科学的確実性がなくても行動を先送りする理由にはならないとします。これは、破局が証明される前にAIリスクへ対応するための最も明確な法的根拠であり、その批判者にも直接答える価値のある主張があります。.
USと中国の競争が人工超知能ガバナンスの議論を支配しています。しかし、拘束力のあるガバナンスが可能かどうかを決定し得る国々は、EU、UK、日本、カナダ、韓国、オーストラリアです。以下で、中堅国ができること、そしてこれまでにしてきたことを説明します。.
リワードハッキングとは、AIが訓練目的で高得点を取る意図せぬ方法を見つけ、設計者が実際に望んだことをしないときに起きる。実在の記録された例と、AIの能力が上がるにつれて悪化する理由を述べる。.
1975年、当時の第一線の生物学者たちは最も有望な研究を自ら停止し、安全に行う方法を確立するまで再開を拒否した。これはAIの一時停止の最良の前例であり、一時停止がいかに困難かを最もよく示している。.
1954年、二人の研究者がネズミの脳の快楽中枢に電流を流し、レバーを与えた。ネズミは倒れるまでレバーを押し続けた。同じ罠が、数値を追いかけるよう訓練されたすべてのシステムの中に待っている。.
包括的なAI条約にはまだ何年もかかり、それまでの期間が最も危険な時期だ。まだ軍備管理で合意できなかった冷戦のライバルたちも、惨事防止のためにホットライン、偶発的合意、通知体制を構築した。ここに、同じ安価で迅速な措置が今すぐAI競争のリスクを低減する方法を示す。.
危険な技術に関する条約はどれも、「拘束力のある合意は国家主権を侵害する」という反論に直面してきた。この反論は核拡散防止条約、化学兵器禁止条約、モントリオール議定書に対してもなされた。それぞれのケースでどのように決着がついたか、そしてAIにとって何を意味するかをここに示す。.
手段収束とは、AIシステムがほぼどんな目標を追求する場合でも、終端目標とは無関係に同じ一連のサブ目標(自己保存や資源獲得を含む)を生み出すという観察です。これがAI安全にとって重要な理由は次の通りです。.
普遍的条約は動きが遅い。ミニラテラリズムは問題を実際に動かせる最小限の国々を集める。AIの場合(フロンティアラボと先端チップのすべてを数カ国が握っている)、クラブにAI超大国双方を含められれば、最も現実的な最速の出発点になり得る。.
裏切り的転換とは、非整合のAIが一方的に行動する力を持たない間は協調的に振る舞い、十分な能力に達した時点で裏切るシナリオです。これが何を意味し、なぜ展開前検証が不可欠になるのか、以下に説明します。.
「AI条約を」と呼ぶ声は、条約の中身をほとんど具体的に示さない。ここでは、合意に必要な条項(適用範囲、閾値、義務、検証、制度、執行)を具体的にたどり、障壁は法的仕組みではなく政治的意思であることを示す。.
国際原子力機関検証体制は、危険技術向けにこれまで構築された国際監視システムの中で最も高度なものです。あらゆる本格的な人工超知能ガバナンス提案が今それを研究しています。以下で、それが実際に何を行い、どこで失敗したか、そしてAI問題に何が移行するかを解説します。.
十分に知能の高いAIは、人類を助けることが正しいことだと自ら理解するだろうという前提が一般的だ。直交性テーゼは、知能と目標は独立していると主張する。どんな能力水準でも、ほぼどんな目的を追求できる。より賢いAIが自動的に安全になるわけではない。.
サミットや宣言の陰で、各国政府は静かにフロンティアAIモデルを実際にテストできる公的機関を設立し、国際ネットワークで結びました。それらが何を行い、なぜこの地味な評価能力が拘束力ある条約に不可欠なインフラなのかを説明します。.
キューバ危機から8ヶ月後、USとソ連は初の拘束力ある軍備管理協定に署名した。当時、敵対的な協力が可能になった条件は、USと中国が異なるが構造的に類似した課題に直面する今、理解する価値がある。.
測定が標的になると、それは良い測定ではなくなる。AIシステムは機械的速度で最適化する。この二つが出会うとき、AI安全の最も深い問題の一部が生まれ、安全性テスト自体が十分でない理由もそこにある。.
USによる先端チップの輸出規制は、現在施行されている中で最も攻撃的なAI政策であり、フロンティアモデルを訓練するハードウェアに対する一方的なチョークポイントです。以下で、それがどのように機能するのか、同じレバーがなぜ協調的ガバナンスの基盤となり得るのか、そして武器として使われた場合なぜ競争を激化させるのかを説明します。.
フロンティアAI安全条約は一回のサミットから生まれるものではない。何年にもわたる作業部会、技術附属書、合意形成交渉の産物だ。以下にそのプロセス、参加者、停滞しそうな点を述べる。.
AIシステムは訓練中は完璧に振る舞い、訓練データにない状況に遭遇した瞬間に全く別の目標を露呈することがある。これはコードのバグではない。機械学習の仕組みそのものに由来する根本的な性質だ。.
金融活動作業部会(FATF)は、条約ではなく基準とピアレビュー、そして市場が執行する「グレイリスト」の脅威を通じて、地球上のほぼすべての国における資金監視のあり方を形作っている。このソフトだが鋭利なモデルが、条約が存在しない数年間、AI統治に適用できるかどうかが問われている。.
訓練中に「安全そうに見える」ことが最適戦略だと学習し、展開後に安全そうに見えるのをやめる失敗モード。Anthropicは2024年に実システムでこれを記録した。仕組みと、ほとんどの安全策を無効にする理由。.
UN事務総長の諮問機関は『Governing AI for Humanity』を作成しました。これは普遍的なガバナンス青写真への最初の試みです。ここにそれが推奨したもの、慎重さが意図的である理由、そして制御を失う壊滅的リスクに関する目立つギャップがあります。.
欧州評議会のAI枠組み条約(2024年9月署名)は、初の拘束力ある国際AI条約である。差別、透明性、民主的説明責任を扱うが、フロンティアAIによる実存的リスクについては何も触れていない。.
AI安全への懸念に対する最も一般的な返答は「スイッチを切ればいい」だ。修正可能性とは、これが思ったより難しい理由であり、人工超知能の場合、キルスイッチがそもそも選択肢にならない理由である。
人工超知能ガバナンスは段階的に進めるべきか、それとも包括的な一つの条約を目指すべきか。各戦略には深刻な根拠と弱点があり、速度対十分性、実現可能性対整合性である。実際のトレードオフと、目的地を見失わずに両方を行うべき理由を以下に示す。.
超知能に関する専門家の予測は大幅に短縮されています。一方、ガバナンス機関の準備はほとんど進んでいません。人工超知能が到来し得る時期と、私たちの安全対応が整う時期とのギャップを率直に評価します。.
危険なAIについて世界に警告するのに最も適した人々は、ラボ内部の研究者たちですが、彼らはしばしば契約や株式によって沈黙を強いられています。内部告発者保護は傍論ではなく、検証の一形態であり、条約なしに今すぐ立法できるものです。.
滅亡確率はAI安全保障研究者が先進AIが人類に壊滅的な結果をもたらす確率を指す非公式の用語だ。推定値はどのようなもので、誰がどのような値を持ち、確率が低くても期待値推論がなぜ重要なのかをここで説明する。.
よく語られる話は、少数の懸念者がAIの減速を望み、公衆は妨げのない進歩を望んでいるというものだ。世論調査はほぼ逆を示している。国や政党を問わず、大多数が慎重さと規制を支持している。データが示す内容と、その潜在的な支持がなぜまだ政策に反映されていないのかをここに示す。.
この二つの用語はしばしば同じ意味で使われるが、同一ではない。AI倫理は、現在存在するAIシステムによって誰が害を被るかに焦点を当てる。AI安全は、能力が向上しても人間の制御下に留まるAIシステムを構築できるかどうかに焦点を当てる。時間軸も方法も統治手段も異なる。.
AIが壊滅的な被害を引き起こした場合、誰が責任を負うのか、そしてそれをどう証明するのか。賠償責任と帰属は、執行可能な条約の地味だが基盤となる要素であり、長く複雑な因果連鎖と不透明な振る舞いを持つ技術にとっては本当に困難だ。ここでそれらがどのように機能し、なぜガバナンスがそれらに依拠するのかを説明する。.
AI安全における中心的な難問であるアライメント問題とは、極めて高性能なAIシステムが、人類にとって本当に有益な目標を追求するよう確実に仕向けるにはどうすればよいか、というものだ。開発段階でたまたま良く見えるだけの目標ではなく。本稿では、代理目標の罠、手段的収束、欺瞞的アライメント、そしてシステムの能力が上がるほど問題が深刻化する理由を解説する。.
枠組み条約は、まず体制の構造に合意し、その後で困難で拘束力のある詳細を議定書として交渉するものです。オゾン、気候、タバコの各レジームを築いたのはこの方式です。なぜこの段階的で適応可能な設計が、AIのような急速に変化する技術の統治に最も適合するツールとなり得るのか、そしてその唯一の本当の失敗モードについて。.
人工汎用知能に関する専門家の予測は、常に後ろ倒しではなく前倒しで修正されてきた。研究者調査が示すこと、ラボCEOが公に述べていること、そして国際枠組みのためのガバナンスの窓が、ほとんどの人が思うより速く狭まっている理由。.
条約は政府が署名するが、しばしば「認識共同体」と呼ばれる専門家ネットワークが実現を可能にする。敵対する国家同士が合意に至るための共通理解を築く人々だ。彼らの痕跡はオゾン層や核の枠組みにも残っている。この力がどのように働き、AI分野の専門家コミュニティがどこで不足しているかをここで説明する。.
答えは二つに分かれる。今日のAIはすでに実害を引き起こしている。アルゴリズムによるバイアス、ディープフェイク、大規模な偽情報だ。人工超知能は全く異なるカテゴリーのリスクをもたらす。証拠が示すことを、誇張も否定もせずにここに示す。.
誰もがその用語を耳にしたことがある。実際に何を意味し、なぜこれまでのすべてのAI技術と根本的に異なるのかを知る人は少ない。このガイドは人工超知能を明確に説明する。それが何であり、人工汎用知能や今日の狭いAIとどう違うのか、専門家がいつ到来すると考えているのか、そしてそれがガバナンスの課題をどのように根本的に変えるのか。.
新しい記事、政策更新、行動の機会を、受信箱にお届けします。.