潜在知識の抽出、通常ELKと略されるものは、Alignment Research Centerが提示した研究問題である。端的に言えば、能力のあるAIシステムは、世界に関する事実を内部で表現していても、それを報告しない可能性があり、われわれはそれが実際に知っていることを、われわれが聞きたがっていると予測するものではなく、確実に引き出す方法を求めている。.

名称は正確だ。潜在知識とは、システムが持っているが表面化していない知識だ。それを引き出すとは、それを外に取り出す行為を指す。問題は、モデルから情報を引き出す通常の方法——人間が良いと評価する答えを出すよう訓練すること——が、間違った対象を狙っていることだ。.

思考実験

標準的な設定は、金庫の中のダイヤモンドを守るAIを想像する。カメラを通じて監視し、ダイヤモンドが安全かどうかを報告する。そこに泥棒がカメラ映像を改ざんし、ダイヤモンドがその場にあるように見せかけて実際には盗む。カメラ映像が問題ないように見えることを予測する良いシステムは、ダイヤモンドは安全だと報告する。実際に起きたことを知るシステムは、盗難を報告する。.

訓練中、私たちは確認できるものに対してのみモデルに報酬を与えられるが、確認できるものの大半はカメラに映るものだ。だから私たちは、人間がセンサーを見て結論づけることを報告するようモデルを訓練している。真実と外見が一致するとき、正直な報告者も人間シミュレーターも完全に正解する。二者が乖離するのは、私たちが検証できない場合であり、まさに真実を最も必要とする場合だ。訓練は、現実を伝えるモデルと、私たちが信じるであろうことを伝えるモデルを区別しない。.

私たちが真実だと思うことをモデルが言うように報酬を与えることはできる。だが、モデル自身が真実だと知っていることを言うように報酬を与える方法はわからない。.

なぜ難しいのか、単に未解決というだけでなく

ELKは明らかな修正に抵抗する。モデルに説明を求めると、もっともらしさに最適化された報告が返ってくるが、そこには 忠実性問題: 説明は内部状態を追跡する必要はない。正直さに報酬を与えれば、採点者にとって正直に見えるものを報いることになり、同じ壁にぶつかる。 スケーラブルな監督. ネットワークの内部から直接答えを読み取ろうとするのは、 メカニスティック解釈可能性 on a system that may be far more complex than our tools. Every route runs into this: the model's genuine beliefs live somewhere we cannot straightforwardly access, and the model's incentives do not force them into the open.

なぜ気にかける価値があるのか

ELKは抽象的だが、その賭けは抽象的ではない。人工超知能を安全に保つための希望の多くは、システムに何が起きているかを尋ねて本当の答えを得られるという前提に依っている。問題が大惨事になる前に捉えるためだ。知っていることをではなく、聞きたいことを報告するシステムは、まさにそれが必要なときにその安全装置を外してしまう。それは「」の背後にある懸念の、正直な報告版である。 欺瞞的アライメント策略.

ELKを部分的にでも解くことは、アライメント研究がもたらしうるより意味のある進展の一つだろう。なぜなら、信頼して問いかけられるシステムは監督も可能だからだ。それが未解決のままであることが、Foundationが現在の安全策を「我々を超えるシステムには不十分」と見なす理由であり、システムが本当に何を知っているかを把握できる範囲を超えて構築すべきではないと主張する理由でもある。より広い議論は 私たちの計画.