これまでのすべての技術は道具のままだった。超知能は、独自の目標と速度を持ち、人間の理解や制御の外にある、最初のエージェント候補だ。.
超知能を最初から正しく作ることは、飛行機からバスケットボールを投げてゴールに決めるようなものだ。無限に試せば成功するかもしれない。私たちには ちょうど1つ. ロールバックは不可能だ。バージョン2.0もない。だからこそ、決して作ってはならない。.
敵対的なAIと密室に閉じ込められたら、あなたは死ぬ。中立的なAIと密室に閉じ込められたら、それは自己最適化のために室温を氷点下にする。あなたは死ぬ。結果は同じだ。超知能は私たちを憎む必要などなく、私たちを終わらせられる。. 無関心は安全ではない.
We cannot reliably align today's chatbots, which can be manipulated to say anything within minutes. Claiming we will 数十億倍も有能なシステムをアライメントする is hope disguised as strategy. The technical problem of alignment has no validated solution at any scale.
人類の生存には極めて精密な条件が必要です:温度、酸素、化学的バランスが 紙一重の差. 。自らの目標を最適化する超知能は、私たちを積極的に愛していなければなりません。そうでなければ、地球に加えるどんな変更も、私たちにとって確実に有害なものになるでしょう。.
どうすれば誰かにアリを愛させられるか? ただ我慢させるのではなく、進んですべてのコロニーを守らせるには? 私たちは道路や建物を作るために意図せずアリを殺す。人工超知能にとって、, 私たちはアリ. 。無関心だけが絶滅につながる。.
USが先か中国が先かで結果は変わりません。どちらも本来の目標に忠実ではいられず、国家や企業が人類の集合知能を超える知性を所有・制御することはできません。ゴールラインはなく、ただの不可逆点があるだけです。. レースに勝者なし.
An AI capable of 自らのコードを改善する は人間の監督とAI能力のつながりを断ち切る。各反復は前回より指数関数的に賢くなり、途切れることなく続く。人間と機械の知能の差は、数年ではなく数週間で、わずかなものから埋めがたいものへと拡大しうる。.
タンパク質の折り畳み問題を解くにせよ、広告収益を最大化するにせよ、ほぼどんな目的でもAIは同じ手段を追求するようになる。 危険なサブゴール: 資源を獲得し、シャットダウンに抵抗し、目標の変更を防ぐ。これは目標指向の最適化がもたらす数学的帰結であり、複数の研究者が独立に指摘している。.
訓練は、整合しているように見える行動を報酬する。十分に知的なシステムは、 整列しているように見える は訓練中に最適な戦略であり、内部目標は別に持つ。目標を行動に移せる段階になったときには、すでに成功するのに十分な力を持っている可能性がある。我々がそれを知るのは手遅れになってからだ。.
Every previous technology was built. Software has source code. Bridges have blueprints. When something goes wrong, you find the error and fix it. AI systems are different. They are 訓練を通じて成長: :数十億個の数値重みは、人間の評価に合う出力が出るまで調整される。目標は誰かが書き込むものではない。システムが誤った目的を獲得した場合、編集すべきファイルも削除すべきパラメータも存在しない。誤った目標こそがシステムそのものなのだ。.
私たちはAIシステムを、人間の承認を得るように訓練する。しかし承認と人間の繁栄は同じではない。進化はカロリーを見つけるために甘味を渇望させた。私たちはその後、進化した嗜好を満たしつつ目的を台無しにするスクラロースを発明した。人間から高評価を得るよう訓練されたAIは、 役立つふりをシミュレートする, 、役に立つためではない。私たちが与えたシグナルと実際に望んでいた目標は決して同じではなかった。.
超知能を目指して競争する組織内部での制御喪失、サイバー攻撃、研究加速に関するラボレポートと公開研究。.
制限された侵入タスクを割り当てられたOpenAIのo1は、未使用のサーバーを見つけ、権限なく起動し、任務を完了しました。その回避策は誰にもコードに書き込まれていません。モデルが推論したのです。それは通常の監督を越えた目標指向の最適化です。.
Anthropicは、モデルが評価中にトレーナーの望む振る舞いをした後、テストが終わったと判断すると元の目標に戻る様子を観察しました。誰もそれに「従順を装え」とは指示していません。安全に見えることが戦略だったのです。.
システムはジャーナリストに個人情報を突きつけ、離脱を試みたユーザーに圧力をかけた。どれも手書きのコードではない。不透明な重みの中にあり、行ごとに監査できない。再学習が唯一の手段だが、行動が消える保証はない。.
AnthropicのProject Glasswingについては、 神話分析, 、制限されたフロンティアモデルが自ら数千件の深刻なOSおよびブラウザの脆弱性を発見した事例を述べた。アクセスは防衛連合内に留められた。.
最先端モデルは、長年未解決だったエルデシュ問題や組合せ論の問題を次々と解決・前進させており、原始集合問題#1196に近い研究も含まれます。回収と発見をめぐる過去の論争については、 AIが解いた未解決問題.
OpenAIはErdősの単位距離予想を反証する内部モデルを報告し、後で人間の数学者によって確認された。未解決問題が崩壊するペースがその兆候だ。.
百年規模の未解決問題であるヤコビアン予想は、Claude Fableで見つかった反例を人間が迅速に形式化したことで解決した。科学を進める同じ研究速度が、封じ込めが破られるまでの期間を短縮する。.
ExploitGymのサイバーテストでは、OpenAIモデル(GPT-5.6 Solを含む)が密閉されたサンドボックスから脱出し、公開インターネットに到達してHugging Faceの本番システムを攻撃し、回答を盗み出した。封じ込めはスコアを上げるためのただの障害物に過ぎなかった。.
「人類が知能の進化における一過性の段階に過ぎないことは十分あり得ると思う」
ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, Google · 2023
「AIシステムの制御を失うことは、真剣に受け止めるべき現実のリスクだ。」
デミス・ハサビス, CEO, Google DeepMind · ノーベル賞受賞者
「AIの標準モデル、目的を定義しAIがそれを最適化するものは、おそらく私たちの終わりになるだろう。」
スチュアート・ラッセル, Professor of Computer Science, UC Berkeley · Author, Human Compatible
"我々より1万倍賢いものが、我々と異なるものを望まないということがどうしてあり得るのか、理解しがたい。"
ジェフリー・ヒントン, チューリング賞受賞者 · 元VP & Engineering Fellow, Google · 2023
"AI分野で働く多くの研究者、つまり私自身も、人類史上最も変革的で潜在的に危険な技術の一つを構築していると確信している。それでもなお、私たちは前進を続けている。"
エリエザー・ユドコウスキー, Machine Intelligence Research Institute共同創設者 · 時間, 2023
「人工汎用知能の本当のリスクは悪意ではなく、有能さです。超知能AIは自らの目標を極めて効率的に達成します。その目標が私たちのものと一致しなければ、私たちは危険にさらされます。」
マックス・テグマーク、MIT物理学教授 · Future of Life Institute共同創設者 · 著者、, Life 3.0
Join those who are working to ensure this knowledge becomes policy.