Anthropicは2023年9月に最初のResponsible Scaling Policyを公表しました。文書を開けば、修辞より先に目次構造がわかります。能力レベルが事前に定義され、各レベルごとに、評価で閾値を超えたと判断された場合に発動するはずの安全策——より厳格な重み管理、より厳しい展開ルール、より深いレッドチーミング、上位層では指定された保護措置が整うまで訓練や公開を行わないという書面によるコミットメント——が紐づけられています。業界での略称はRSPです。その論理はしばしば「if-thenコミットメント」と呼ばれます。.

最先端のフロンティアラボが最もよく知られた版を公表し、その形式が広まった。ティアは通常、今日のシステムに近いものから、生物兵器や重大なサイバー攻撃、危険な自律性を意味ある形で支援し得るモデルまでを段階的に示す。この文書は緊急事態が起きる前に、単純な問いへの答えを示すためのものだ。能力が上昇したとき、企業は具体的に何をするのか。?

なぜその形式が真の改善なのか

一般的な「安全を真剣に考える」という約束と比べると、RSPはより具体的です。あらかじめ能力、閾値、対応を明記することで、ムードを外部から指し示せるものに変えます。それは先を見越したものです。ラボは発見の興奮と報道の波が同時に訪れる前に、危険な能力が自らに何をもたらすかを決めなければなりません。.

この形式はまた、言葉をテストに結びつける 危険な能力の評価, 、したがって閾値はスローガンではなく運用上の意味を持つ。政策によっては、安全策が能力に追いつかない場合に開発を停止すると明記するものもある。その一文を公的文書に書くことは、実質的な前進である。.

一般的な異論、その名称

RSPを最も強く支持する主張はこうだ。公開され、具体的で、事前に約束されたルールこそが産業を成熟させる方法であり、内部ポリシーができる前に外部法を要求するのは、進歩を凍らせる cynicism だ。この見方では、RSPはフロンティア安全保障の憲法草案であり、著者たちを退けるのではなく、もっと増やすのが正しい動きだ。.

その通りで、弱点は依然として構造的である。同じラボが政策を書き、閾値を定義し、評価を実施し、ラインが越えられたかを判断し、自らの安全策で十分かを決め、条文改訂の権限も握っている。出荷を急ぐ商業的圧力と、ラボ自身が起草・運用するコミットメントが衝突したとき、独立した第三者が警鐘を鳴らす仕組みはない。.

楽観的な解釈を歴史は裏付けない。競争圧力下での企業の自主的な安全誓約の実績については、当サイトの記事で詳述している。 自主的なコミットメント, は、歯止めがかかり始めると緩む基準の記録です。if-thenルールはthenの部分と同じ強さしかなく、そのthenは緩めることで利益を得る当事者によって執行されます。自分で設定し、測定し、修正できるルールは意図の表明に過ぎず、制約ではありません。.

文書の背後にはさらに二つのギャップがあります。RSPは閾値超過を評価で検知するため、評価を制限するすべての要因( サンドバッギング, 未知の能力と安全性の証明の難しさは、そこに依拠する政策を制約する。またRSPはそれを採用した研究室だけを拘束する。採用を拒否する競合他社や、この文化圏外の国家プログラムには何の影響もない。単一の企業だけではその調整問題を解決できない。.

財団がそれらをどう読むか

良い仕組みは残せ。閾値の論理、if-then構造、評価との連動は再利用せよ。ペンを持ち、停止を執行する者を変えよ。それらのトリガーを自主的な方針から、独立した機関と の支援を受けた拘束力のある法律へ移せ。 コンピュート・ガバナンス, so a lab cannot quietly revise its own ceiling when the ceiling becomes inconvenient.

政策を執行可能な規則の草案として扱い、ラボの外で仕事を完了させてください。拘束力のある法律、独立した執行、計算資源の管理です。その移行こそが 私たちの計画 のためです.