商用旅客機の型式が乗客を運ぶことを認証される前、規制当局は構造化された安全論証を要求する。主張・推論・証拠が、却下できるほど厚いものでなければならない。英国では、原子力サイトの許認可は依然として、運用開始前に原子力規制事務所が受理する安全ケースを通じて行われる。多くの医療機器も同じ負担を負う。運用者は先に走って後で説明することはできない。許可は、敵対的審査に耐えたケースの後に与えられる。.

AI安全ケースはその形を借りています。特定のシステムが、特定の状況下で訓練または展開するのに十分安全であるという、構造化され、証拠に基づいた主張です。最先端モデルに適用すれば、開発者に肯定的な立証を強いることになります。危険性を証明しなくてもブレーキをかけられるようになるのではなく、開発者が安全性を示せなければ止まる、という形になります。.

本物のAI安全ケースに含まれるべき内容

真剣な事例はチェックリスト以上のものである。それは形を持っている。.

  • 主張:このモデルをこのように使用した場合、指定された危害の容認できないリスクは生じない。.
  • 主張を支える論理:証拠と主張を結びつける推論。特定されたリスクをどう扱い、なぜ安全策で十分と言えるのかを含む。.
  • 証拠: からの結果 能力評価, red-teaming, security measures, および議論が依存する分析。.

前提と失敗点を明記しなければならない。良い主張は反証可能だ。結論が成り立つために何が真でなければならないかをレビュアーに示し、実際にその条件が成立しているかを確認できるようにする。それがなければただの演技だ。.

その規律が価値ある理由

主張を書き下ろすことで、自信たっぷりのリリースノートが隠していたギャップが表面化します。リスクは、それに対処する明示的な推論を構築しなければならないとき、簡単に片付けにくくなります。この手法は、他の高リスク分野が安全性を高めてきた方法——運用前にハザードについて推論するのであり、事故を数えるだけではない——と一致します。また、 責任あるスケーリングポリシー, 、能力の境界線を超えた場合、次のステップを正当化するのに十分な強いケースを引き起こすべき場所。.

一般的な異論、その名称

反論は実務的だ。評価と解釈可能性の研究をあと数年続ければ、安全ケースは自然に書けるようになる。今それを義務化すれば有用なシステムの開発が遅れるだけだという立場だ。この見方では、文書化は証拠に追随すべきで、先回るべきではない。.

航空分野では、成熟した科学、既知の故障率、理解された物理学、そして数十年にわたる運航データに依拠できる。最先端モデルでは、正直な主張は現在証明できることの少なさに突き当たる。まだ、有能なモデルが欺瞞的に整合していないことを示せない。誰もテストしようと思わなかった能力を排除できない。評価時の振る舞いが展開時にも維持されることを示せない。特にシステムが サンドバッギング.

十分に先進的なモデルの厳密な安全ケースには、現在の科学が提供できない保証が必要です。そのため正直な試みは、しばしば「このシステムがまだ安全であると示せない理由」を明確に述べる結果になります。書類がその役割を果たしたのは、ギャップをそのままゴム印で承認しなかったときです。.

安全ケースの価値は拒否する許可にある。.

なぜ財団がそれらを支持するのか

安全ケースに基づく統治体制は、危険を証明できないことを「進めてよい」という許可とはみなさない。負担は開発者側にある。開発者がそれを満たせないなら、次の能力ジャンプを訓練して希望的観測に賭けるのではなく、拒否するのが答えだ。安全ケースは必須とし、自己評価ではなく独立した審査を受け、製品発売後ではなく最大規模の訓練実行前に要求されるべきである。.

その形で拘束力を持たせれば、利用可能な手段の中でも特に強力なものの一つになる。だからこそ「 私たちの計画.