Constitutional AIはAnthropicが開発した訓練手法である。アイデアは、モデルの振る舞いが人間による有害出力の手動ラベル付けに依存する度合いを減らし、代わりにモデルが自らの応答を「憲法」と呼ばれる書かれた原則のセットに対して評価するようにすることだ。.

実際には二段階で機能する。第一に、モデルが応答を生成し、次にその応答を憲法に照らして批評し、修正する。自らの修正から学習する。第二に、モデルは応答のペアを比較し、どの原則により適合するかを判断し、その判断が人間のランキングと同様に訓練に用いられる。 人間フィードバックによる強化学習. 。フィードバックが人間ではなくモデル自身による憲法適用から得られるため、この手法はAIフィードバックによる強化学習と呼ばれることもある。.

それが正しい点

本当の利点があり、それらは率直に認める価値がある。.

  • 原則は明示的だ。何千もの個別の人ラベルが示唆する価値観ではなく、読んで議論し改訂できる文書がある。それは評価の山より透明性が高い。.
  • 有害コンテンツのフィードバック生成を拡大する。人間によるラベル付けは遅く、コストがかかり、ラベラーにも負担が大きい。モデルにその作業を任せることでボトルネックを解消できる。.
  • 一貫性を向上させられる。統一的に適用される文書化された基準は、異なる人間の評価者が日によって生むノイズやブレをある程度避けられる。.

これらは本物の工学的進歩であり、憲法的AIは役立つ度合いが高く、明らかな害も出にくいモデルを生み出している。当財団は有用な取り組みを否定するつもりはない。.

解決しないこと

より難しい質問は方法を無傷で生き残り、そしてなぜそうなのかを見ることは重要だ。.

この手法は依然として、モデルがモデルによって判断される明示された基準を満たすよう最適化する。人間を応答ごとのループから外し、根本的な問題の形状——システムが目標に対して高得点の出力を生み出すよう訓練されている——を変えることはない。憲法が不完全であったり、誰も予想しなかった状況で原則が衝突したりすれば、モデルは書かれた文字通りに最適化する。 グッドハート 以前と同じ圧力。価値観を憲法として書き下ろしても、価値観を特定する難しさから逃れられるわけではない。それは文書の中に移されるだけだ。.

さらに深い限界が二つ残っている。手法は行動を形作るが、モデルの内部目標については何も保証しない。外見上整列していることと、本当に整列していることの間の隔たり、すなわち 内部アライメント 問題は依然として未解決だ。そしてそれはモデルの出力に対するモデル自身の判断に依存しているが、その判断が信頼できるのは、モデルが正直で、かつ判断能力を持つ場合に限られる——まさに超知能に近づく、または超えるシステムには前提にできないことだ。.

憲法AIは行動を制御するより良い方法だ。行動の制御は、アライメントの中で私たちがやり方を知らなかった部分ではなかった。.

適切なバランスを保つ

Constitutional AIは、Foundationが注視しているパターンの好例です。現実的で価値ある安全性の進歩でありながら、実際以上に過大評価されやすいものです。このような手法は現在のモデルをより制御しやすくし、基準をより透明にします。それは価値あることです。しかし、それらは我々を上回る知能を持つシステムを整列できることを示すものではなく、我々の主張全体が依拠する検証ギャップを埋めるものでもありません。訓練手法の進歩は歓迎しますが、それが残りの問題を自動的に解決するという前提で能力のスケーリングを続ける理由にはなりません。それが 私たちの計画.