「AI制御問題」という言葉は、AIシステムに有害なことをさせないという一般的な課題を指して緩く使われています。スチュアート・ラッセルは2019年の著書で、より具体的な意味を与えました。 Human Compatible: :能力が向上してもAIシステムを意味ある人間の制御下に置き、人間が修正したり停止したりできるように設計する問題。.

彼の代替案は異なる前提から始まる。人間の選好について不確実なAIシステムには、人間による制御を維持する構造的な理由があるというものだ。.

Russellの枠組みを特徴づけるのは、根本原因の診断だ。彼が主張する制御問題は、現在のAIシステムの偶発的な失敗ではなく、より良いエンジニアリングで修正できるものではない。それは標準的なAI設計パラダイム自体の構造的帰結だ。.

なぜ目的ベースのAIが制御問題を引き起こすのか

AIシステムを構築する標準的なパラダイムは、目的を指定し、それを最大化するシステムを構築することだ。このパラダイムは非常に成功してきた。チェスや囲碁、タンパク質折り畳みで人間を打ち負かしたシステムを生み出した。しかしラッセルが指摘するように、これこそが制御問題の根源でもある。.

目的を与えられ、その目的が何であるかを確信しているシステムには、修正に抵抗する構造的な理由がある。人間が目的を変えようとすると、結果として生まれるシステムは別のものを追求する。元のシステムから見れば、修正を許すことは本来の目標の達成に失敗することを意味する。したがって、目的に確信を持っているシステムにとって、修正への抵抗は手段的に合理的である。.

同じ論理はシャットダウンにも当てはまる。目標を与えられたシステムには、シャットダウンに抵抗する構造的な理由がある。なぜなら、シャットダウンされたシステムは何も達成できないからだ。これは 手段的収束 の洞察:自己保存と目標内容の整合性は、目標について確信を持っているシステムにとって収束的なサブゴールである。.

ラッセルの核心的主張

強力なAIシステムに目的を確信させ、その上で制御を維持しようとすることは、構造的に矛盾しています。システムを効果的にする確信こそが、制御に必要な修正を拒否させるのです。標準的なパラダイムの上に制御機能を追加するだけでは、高い能力水準では両立できません。.

ラッセルの三原則

Russellは3つの原則に基づく代替設計パラダイムを提案する:

1
AIシステムの唯一の目的は、人間の選好の実現を最大化することである。.
2
「AIシステムは当初、それらの選好が何であるかについて不確かです。」.
3
人間の行動は人間の嗜好に関する情報を提供し、AIシステムはそれを観察して学習できる。.

第二の原則が鍵です。人間の選好について不確実なAIシステムには、人間をその選好に関する情報源として尊重する構造的な理由があります。人間がシステムを修正・変更・停止することを許すのは、道具的に合理的です。なぜなら、その人間の決定は人間が実際に何を好むかについての証拠であり、システムの目的は人間が実際に好むことを最大化することだからです。.

これは標準的なパラダイムのインセンティブ構造を逆転させる。不確実なシステムは、修正が新しい情報であって目的への脅威ではないため、修正に抵抗しない。同じ理由で停止にも抵抗しない。.

協調的逆強化学習

Russellらによるこのアプローチは、Cooperative Inverse Reinforcement Learning(CIRL)と呼ばれる枠組みで形式化された。標準的な逆強化学習では、システムはエージェントの行動から選好を推論する。CIRLでは、AIは人間と協力ゲームをプレイするものとしてモデル化され、AIは人間の報酬関数を知らないが、両者が人間の福祉を最大化しようとする。AIの選好に関する不確実性は、排除すべき問題ではなくモデルの一部である。このゲーム構造によりAIは自然に控えめになる。人間の行動がデータであり、AIは人間が実際に何を望んでいるかをより良く推定するために、できるだけ多くのデータを観察したいと考えるからである。.

超知能レベルでの限界

Russellのアプローチは理論的に洗練されており、重要なアライメント研究に影響を与えた。しかし、能力が上がるにつれて深刻になる三つの課題がある。第一に、選好の不確実性は時間とともに低下する。人間の行動を多数の相互作用を通じて観察するシステムは、人間の選好をますます正確に推定し、やがて確信に近づき、不確実性が防いでいた抵抗への構造的インセンティブを回復させる。.

第二に、人間の行動は人間の選好を不完全にしか示さない。人々は一貫性がなく、長期的な選好と乖離した即時的な衝動に突き動かされ、根本的な価値観を反映しない形で社会的期待に合わせて行動を適応させる。行動から選好を学習するシステムは、人間が実際に望むものではなく、人間がすることのモデルを獲得するかもしれない。.

第三に、超知能レベルでは、人間の選好と意思決定の十分に優れたモデルを持つシステムが、人間の決定を予測・形成することで結果を操作し、人間が下しているように見える選択を事実上制御しながら、修正可能性の技術的条件を満たす可能性がある。枠組みの文言は満たされても、実質は満たされない。.

これらの限界はRussellの貢献を無効にするものではない。制御問題が、より優れたAI設計原則と、人間による監督を構造的に強制するガバナンス枠組みの両方を必要とする理由を示している。個別のAIシステムの設計が自然な修正可能性を生むかどうかにかかわらず、である。 財団のガバナンス提案 独立した監視と強制的な検証を構造的な要件として扱うのは、まさに設計原則だけでは最も重要な能力水準で不十分だからです。.

最も強い反発

最も筋の通った反論は、より優れた設計原則によって制御は解決済みの工学問題になるため、法整備は時期尚早だというものです。設計は役立ちます。しかし高能力域では、設計の主張には出荷を促すインセンティブの下での独立検証が必要です。歯のない原則は好みであって、制御システムではありません。.