2026 年 8 月 18 日、論文が「人工超知能 ベンチ: 人工超知能の夜明け」というターゲットを隠さないタイトルで arXiv に掲載されました。 40 人以上の専門家が、11 の科学分野にわたって 60 のプロジェクト レベルの研究タスクを構築しました。著者らは、人的コストは 31,000 時間を超えると見積もっています。このテストは、既知の事実に関する別のクイズではありません。人間の指示が外れたときに、AI システムが探索し、方法を選択し、新しいアイデアを確認できる結果に変えることができるかどうかが問われます。
最先端のエージェントおよびモデル構成18件において、完全な方法論ガイダンスを与えた場合の平均スコアは50.91だった。方法名のみを指定した場合は29.10に低下し、エージェント自身に方法を選択させた場合は26.62に低下した。著者らはこの低下を、教師が読むように解釈した。現在のシステムは依然として、作業の進め方を知っている人間に依存している。
この急激な低下は、現在のシステムが依然として人間のガイダンスに大きく依存しており、自律的にプロジェクトレベルの科学研究をエンドツーエンドで実施する段階には程遠いことを示している。
人工超知能-Bench · arXiv:2608.17271 · 2026
ベンチが実際に測定するもの
既存のテストのほとんどは、モデルがすでに圧縮された知識から正しい答えを導き出せるかどうか、または人がメソッドを保持している間にモデルがタスクを完了できるかどうかを尋ねます。 人工超知能-Bench は、革新的な探査と自律的な科学的実行という 2 つのことを同時に評価しようとします。同じ研究プロジェクトについて、システムが独自にどこまで進むかを確認するために、段階的に方法論的な指導を撤回している。
タスクは専門家によるレビュー、監査、サンドボックス実行、スコアラー検証を経た。これはリーダーボードのスクリーンショットよりも慎重な扱いである。それでもなおベンチマークである。数値は超知能ではない。本論文は超知能が到来したと主張していない。
著者らは研究者や建設者にタスクを追加し、今日のシステムに挑戦し、人工超知能に向けた人類の集合的な道を加速するよう呼びかけています。著者ら自身のスコアはシステムが存在しないことを示しているが、招待状では研究者らに超知性への道を加速するのに協力するよう求めている。
一般的な解釈は、時間的余裕があるというものだ
A collapse from 51 to 27 looks like distance. Distance is real. It is also the wrong comfort. The same August, オープンAI said it could not rule out Critical cyber capability in Astra: finding and using holes in hardened systems, given a goal, without a person on every step. A research agent that still needs a method and a cyber agent that does not can exist in the same industry at the same time. One number does not cancel the other.
「時間的余裕がある」という声より静かな第二の誤りがある。それは残されたギャップを単なる作業リストとして扱うことだ。一度分野が超知能にベンチマークを名付ければ、残された作業は得点表を持つことになる。研究所はすでに得点表の最適化を行っている。本論文の枠組み「夜明け」は、滑走路の言葉であり、停止の言葉ではない。
同じプロジェクト上のメソッドの撤回が実際のテストです。人がすでに実験を選択し、手段に名前を付け、成功条件を記述している場合、モデルは強力に見えます。これが今日のエージェントのデモのほとんどです。 人工超知能-Bench は、これらのギフトが削除されたときに何が残るかを尋ねます。システムは何を試行するかを決定し、作業を実行し、スコアラーがチェックできるものを返すことができるかどうかです。 50.91から26.62の下落は贈り物の大きさです。
これらすべてを理解するために、著者らの夜明けの比喩を信じる必要はない。科学研究の最後の人間の段階に向けた公開トラックを研究コミュニティが立ち上げ、世界にその埋め合わせを求めたことに気づく必要がある。
ベンチマークが目指すものを構築してはならない
中田財団 does not read a low 人工超知能-Bench score as permission to keep going. Artificial superintelligence should never be built. Superintelligence cannot be controlled by humans. A test that withdraws the last human method is a test of the last human role. Current agents failing that test is not a safety case for building agents that pass it.
科学分野で働くなら、この道筋を加速させることが公共の利益だと誰が決めたのか問いかけてほしい。政府で働くなら、本論文を研究所が埋めようとするものの地図として扱ってほしい。リスクに見合う対応は、目的地を閉じる法律である。