アンソロピックは2023年9月に最初のResponsible Scaling Policyを公表しました。文書を開けば、修辞より先に目次構造がわかります。能力レベルが事前に定義され、各レベルごとに、評価で閾値を超えたと判断された場合に発動するはずの安全策——より厳格な重み管理、より厳しい展開ルール、より深いレッドチーミング、上位層では指定された保護措置が整うまで訓練や公開を行わないという書面によるコミットメント——が紐づけられています。業界での略称はRSPです。その論理はしばしば「if-thenコミットメント」と呼ばれます。

最先端のフロンティアラボが最もよく知られた版を公表し、その形式が広まった。ティアは通常、今日のシステムに近いものから、生物兵器や重大なサイバー攻撃、危険な自律性を意味ある形で支援し得るモデルまでを段階的に示す。この文書は緊急事態が起きる前に、単純な問いへの答えを示すためのものだ。能力が上昇したとき、企業は具体的に何をするのか。?

なぜその形式が真の改善なのか

一般的な「安全を真剣に考える」という約束と比べると、RSPはより具体的です。あらかじめ能力、閾値、対応を明記することで、ムードを外部から指し示せるものに変えます。それは先を見越したものです。ラボは発見の興奮と報道の波が同時に訪れる前に、危険な能力が自らに何をもたらすかを決めなければなりません。

この形式はまた、言葉をテストに結びつける 危険な能力の評価, しきい値には、スローガンではなく運用上の意味があります。一部の政策はさらに進んでおり、セーフガードが能力に追いつけない場合は開発を停止することを約束しています。それを公開文書に掲載することは、真の進歩と見なされます。

草案は憲法ではない

業界が成熟するためには、公開された、具体的な、事前に約束されたルールが必要です。 RSP はドラフトにすることができます。同じ会社がテストを作成し、採点し、テストから利益を得ている間は、それらは憲法ではありません。ドラフトを奨励します。それを従うべき法律として扱ってはいけません。

その通りで、弱点は依然として構造的である。同じラボが政策を書き、閾値を定義し、評価を実施し、ラインが越えられたかを判断し、自らの安全策で十分かを決め、条文改訂の権限も握っている。出荷を急ぐ商業的圧力と、ラボ自身が起草・運用するコミットメントが衝突したとき、独立した第三者が警鐘を鳴らす仕組みはない。

歴史は楽観的に読むことを好まない。の記録 中国の規則はすでに人工超知能を禁止していない。という前提 噛み始めると柔らかくなる基準の記録です。 if-then ルールは then と同じくらい強力であり、then はそれを弱めることで利益を受ける側によって強制されます。自分で設定し、測定し、修正できるルールは、意図の表明です。それは制約ではありません。

文書の背後にはさらに二つのギャップがあります。RSPは閾値超過を評価で検知するため、評価を制限するすべての要因( サンドバッギング, 未知の能力と安全性の証明の難しさは、そこに依拠する政策を制約する。またRSPはそれを採用した研究室だけを拘束する。採用を拒否する競合他社や、この文化圏外の国家プログラムには何の影響もない。単一の企業だけではその調整問題を解決できない。

財団がそれらをどう読むか

良い仕組みは残せ。閾値の論理、if-then構造、評価との連動は再利用せよ。ペンを持ち、停止を執行する者を変えよ。それらのトリガーを自主的な方針から、独立した機関と の支援を受けた拘束力のある法律へ移せ。 コンピュート・ガバナンス, 、したがって研究室は、天井が不便になったときに自らの天井を静かに修正することはできない。

ポリシーを施行可能な規則のドラフトとして扱い、ラボ外で作業を完了します。 拘束力のある法律、独立した執行、コンピューティングコントロール.