チャットボットが間違えた場合、通常は気づいて聞き直せる。自律エージェントが間違えた場合、そのミスは誰かが気づく前にステップ、ツール、メモリを横断して積み重なる可能性がある。このギャップこそ、2026年5月のエージェント失敗調査が実データと実金銭でエージェントを運用する人々にとって重要である理由だ。.

Jinhu Qi率いる12人の研究者(Irwin Kingを含む)が発表した "Towards Trustworthy Agentic AI: A Comprehensive Survey of Safety, Robustness, Privacy, and System Security" (arXiv:2605.23989; Academia AI and Applications, 2026)。エージェントシステムの失敗パターン、存在する防御策、そしてまだ残る穴を整理しています。.

システムが答えるだけでなく行動するようになったら何が変わるか

標準的なモデルはプロンプトを受け取りテキストを返す。エージェントは目標を受け取り、計画を立て、ツールを呼び、中間結果を保存し、行動を連鎖させ、環境からのフィードバックに適応しながら実行する。.

その設計は、プロンプト応答テストが見逃す失敗を生む。1回の悪いツール呼び出しが以降のすべてのステップを毒する。メモリは誤った信念を保存し続け、それに基づいて行動する。無害に見えるステップが組み合わさって害になる。世界はエージェントの行動とともに変化し、その変化が次の決定を左右する。

安全性と堅牢性

ここでのリスクはエージェント自身の軌道にある。攻撃はユーザープロンプトだけではない。タスク途中でエージェントが読む悪意ある文書が、ユーザーの知らないうちに残りの実行を誘導できる。それが環境からのプロンプトインジェクションだ。.

分布シフトはチャットボットよりもエージェントにとって深刻だ。見慣れないケースに遭遇したチャットボットはより悪い回答を出す。同じ状況に置かれたエージェントは、一連の確信的な行動を取り、状況を一歩ごとに悪化させる可能性がある。.

指標のギャップ

ほとんどのエージェントベンチマークは、タスクが完了したかどうかを問う。制約が途中で守られたかを問うものははるかに少ない。システムは「成功」しつつ、すべての実行でルールを破ることができる。この調査の統一メトリクスハブが有用なのは、結果とプロセスの両方を追跡するからだ。タスク成功、制約違反、不完全なトレース、攻撃成功率。.

プライバシーとシステムセキュリティ

ここでは敵が環境の一部を支配している。調査は、オープンソースのエージェントスタックにおける実際の失敗を記録したものであり、おもちゃの攻撃だけではない。.

長期記憶はチャットボットが主に避けているプライバシーの問題だ。セッションを越えて調査するエージェントは秘密を蓄積し、ツール呼び出しやインジェクションを通じて漏洩する可能性がある。メモリポイズニング(後の行動を操るために保存されたコンテキストを破損させること)には、クリーンなシングルターンの同等物はない。

マルチエージェントの設定は穴を広げる。1つの侵害されたエージェントが通常のピアチャネルを通じてゴミを押し込むことができる。ユーザー入力用に構築されたフィルターは、デフォルトでピアエージェントを信頼するかもしれない。.

まだ解決していないこと

1
自己進化するエージェント。. 経験から自らの振る舞いを書き換えるシステムは、初期の安全特性を失う可能性がある。固定システム向けのテストでは動く標的を捉えられない。継続的な検証はまだ薄い。.
2
ランタイム監視。. 展開されているエージェントのほとんどは、安全ルールに対する実行トレースの継続的なチェックを欠いています。リリース時の一点テストでは、セッションをまたぐドリフトを捉えられません。.
3
漏洩の心配のない有用な記憶。. エージェントが役立つには文脈が必要だ。現在の設計の多くは、記憶を捨てる(実用性を失う)か、悪用されやすい記憶を保持するかのどちらかだ。.

世間の異論

最も強い反論は、これは「昨日のソフトウェアセキュリティに新しいラベルを貼っただけ」だというものだ。ツールをサンドボックス化し、行動をログに記録し、出荷する——部分的には正しい。サンドボックスとログは重要だ。調査の要点は、エージェントが長期的な複合リスク、環境由来の攻撃、ピア間の信頼といった、通常のアプリセキュリティチェックリストでは過小評価されがちな要素を加える点にある。エージェントリスクを「ただのもう一つのAPI」として扱うことが、チームがスタック全体を見逃す原因になる。.

地図をどうするか

顧客データ、金銭、外部ツールにエージェントを接続し始めているチームには、デモタスクの完了を問うリリース時評価だけでなく、プロセス指標、実行時監視、ツール・メモリ設計の独立レビューが必要です。.

For the Foundation, agent failure maps are a near-term layer. They do not replace the larger job. A world racing toward artificial superintelligence still needs 拘束力のある制限、計算ルール、および検証 能力が制御を上回らないようにするためだ。調査結果を活用して、今展開するエージェントを強化してほしい。条約の枠組みを活用し、誰も覆せないエージェントが最終状態にならないようにしてほしい。全文はこちら:: arXiv:2605.23989.