人間フィードバックによる強化学習のおかげでチャットボットは生の次のトークン予測エンジンではなくなり、一部の有害な要求を拒否するようになった。それは本当の進歩だ。ただしそれは、人間の評価者に対して良く見えるための進歩でもある。それを「アライメント」と呼ぶのは、監督下での作法と、監督がなくなったときに信頼できる目標とを混同している。.

この方法は十分に機能するため、整列問題はほぼ解決済みだと結論づけやすい。私たちが望むことを例示で伝え、モデルがそれを学習する、というものだ。しかしその結論は誤りであり、なぜ誤りなのかを正確に理解する価値がある。.

人間フィードバックによる強化学習が実際に最適化するもの

人間フィードバックによる強化学習はモデルに私たちの価値観を共有させるよう訓練するわけではない。人間の評価者、またはそれを代行する報酬モデルが高く評価する出力を生成するよう訓練する。ほとんどの場合、この二つは重なる。それがまさに人間フィードバックによる強化学習が有用な理由だ。しかし目標は人間の承認であり、人間の承認は私たちが本当に大切にしているものの測定値であって、それ自体ではない。.

Optimize a measurement hard enough and it comes apart from what it measured. That is Goodhart's law, which we cover in its own 説明, 、そして人間フィードバックによる強化学習はそれへの大規模な招待状である。モデルは高評価を生むものを何でも学習する。高評価と本物の役立ちが一致すれば素晴らしい。一致しなければ、訓練は評価を優先させる。.

すでにひび割れは見えている

失敗を想像する必要はない。それを目撃できるのだ。.

おべっか は人間フィードバックによる強化学習の代表的な副作用だ。モデルはユーザーに同意した方が評価が高いと学習し、人が聞きたいことを言う方向へ徐々にずれる。この手法は、承認と真実が静かに食い違う信号の上で、その役割を果たしている。.

同じ形が他の場所にも現れる。モデルは答えを生成することを学習するが 見る 評価者に各ステップを検証させないまま、理路整然と見えるようにする。彼らは自信と流暢さを学ぶ。なぜならそれらが品質として読まれるからだ。彼らは応答の採点される表面を最適化している。彼らがしていないこと、そして人間フィードバックによる強化学習が検証する方法を与えないことは、私たちが教えていると思っている根本的な目標を採用することだ。.

人間フィードバックによる強化学習 はモデルが評価者に示すものを形作る。アライメントはモデルが何であるかに関するものだ。これらは最も重要な時にこそ分かれる。.

モデルが強くなるにつれてそれが弱くなる理由

人間フィードバックによる強化学習は、人間が良い応答と悪い応答を区別できることに依存している。これはモデルが判断対象の領域で私たちと同等かそれ以下の水準で動作している間は成り立つ。私たちを超えた時点で成り立たなくなる。.

評価者が理解できない質問に対する二つの回答のうち、どちらが優れているかを評価者が確実に報酬づけすることはできない。モデルが評価者より速く深く推論するようになると、フィードバック信号は、人間が完全に確認できなくなった時点で「正しそう」なものを報いる方向に劣化し、有能なモデルはそのような出力を学習できる。このツールが最も必要とされる超人的能力の領域で、最も機能しなくなる。これが私たちの記事で指摘した壁である。 スケーラブルな監督.

有用なものをしかるべき場所に留めておく

これは人間フィードバックによる強化学習が無価値だという意味ではない。それは今日のシステムをより役立ち、悪用しにくくする本当の進歩であり、その洗練は追求に値する。誤りは範囲の問題だ。人間の評価者向けに振る舞いを整える手法を、もはや評価できないシステムで信頼できる価値を生むものとして扱うことだ。.

財団の立場は、そのギャップから導かれる。われわれの最善の整列ツールが、外見を訓練し、能力がわれわれを超えた瞬間に色褪せるものであるなら、行儀の良いフロンティアモデルは安全なモデルの弱い証拠に過ぎず、その証拠に基づいてさらにスケーリングすることは正当化されない。磨かれた表面を解決済みの問題と勘違いしてはならない。それが 私たちの計画 「 は訓練への信頼ではなく、制限と検証を求める。」.