人々はAIの「脳」がどう見えるかを尋ね続ける。都市ほどの大きさのスプレッドシートで、誰も読めない数字が詰まっている——そのイメージは光る神経回路の漫画よりロマンチックではないが、より役に立つ。私たちが何を構築しているのか、なぜ制御が難しいのかを知りたければ、メタファーではなくハードウェアと数学から始めよ。.

重みファイル

現代のフロンティアモデルはファイルです。その中には訓練中に設定された数十億または数百億のパラメータが収まっており、それぞれが数値です。それらの数値が「結合」です。研究者たちは数十年前に生物学からニューロンという言葉を借りてきました。初期の図が神経細胞が結びついたように見えたからです。その類似はそこで終わります。.

生物のニューロンは、体内で食べたり眠ったりする生きた細胞で、化学反応やタイミング、歴史を持っている。一方、モデルの重みは行列積の係数にすぎない。十分な積み重ねを行い、大量のテキストや画像で訓練すれば、次のトークンをうまく予測して会話のように振る舞うようになる。その積み重ねの中に、あなたのことを考えているものは何もない。昼食を欲しがっているものも何もない。.

研究室がモデルカードを公開するとき、それは訓練済みの成果物——アーキテクチャ、データ構成、使用計算量、評価スコア——を記述しています。心を記述しているわけではありません。公の言葉がまだ「脳」と言うのは、私たちの多くが知っている知能が脳だけだからです。.

「それを開いたら何が見えるか」

ファイルを開くと層が見えます。初期の層は単純なパターン(画像のエッジ、テキストのよくある単語の組み合わせ)をとらえやすいです。後の層はそれらのパターンを組み合わせて、外から見ると「概念」のように見えるものを形成します。大規模言語モデルの中央付近を調べると、活性化空間の中に「フランス語」「引用の中」「この主張は誤り」といったものに反応する方向が見つかります。これは本物の構造です。ただし、それは人間が認識するような信念の地図ではありません。.

「goals」とラベル付けされたモジュールはありません。「self」のための器官もありません。入力トークンから出力トークンへの経路があり、それは訓練損失を減らしたものによって形作られています。モデルが後で目標を持っているかのように振る舞う場合、その行動は圧力下でうまく予測することの副作用です。.

解釈可能性研究は、とにかくこのものを読もうとする試みだ。進展は本物だが遅い。フロンティアモデルを、整備士がエンジンを読むように完全に読むことは、目前にない。そのギャップは安全にとって重要だ。検査できないものは認証できない。.

脳の比喩が誤解を招く理由

脳は、軽率な行動を取れば死ぬ動物の体内で成長する。進化は、痛み、社会的絆、近未来を無視するエージェントを罰することに長い時間を費やしてきた。そのような訓練信号は、デフォルトでは重みファイルの中に存在しない。モデルは共感について流暢に語りながら、ケアとは何の関係もないスコアを最適化することができる。.

脳もまた、コピーするのに遅くて高価です。一方、訓練済みモデルは情報です。ファイルをコピーすれば別のインスタンスができ、新しいデータセンターに移動すれば動きます。これは人間というよりソフトウェアに近く、単一の身体・単一の部屋を前提に築いてきた安全習慣をすべて崩します。.

それを脳と呼べば、脆く、社会的で、死すべきものの快適さを借りることになる。その人工物はそうしたものではない。.

これが超知能とどう関係するのか

今日のシステムはすでに、設計者が意図的に組み込まなかった能力で開発者を驚かせている。それがこの分野で「創発的」が意味することだ。設計文書に記載のない能力がスケールで現れることだ。さらにスケールし、ツールや記憶、開かれたネットワークと接続すれば、多くのステップにわたって目標を追求するエージェントが生まれる。「脳」が人間らしいかどうかはほとんど関係ない。重要なのは、私たちより有能で、私たちが完全に読めないシステムを、人間の利益に向け続けられるかどうかだ。.

我々はそれを解決していない。. アライメント研究は問題の難しさを正直に認めている. それが未解決のままである限り、人工超知能に向けた構築はただの好奇心ではない。それはいつか削除キーを握る人々を出し抜くかもしれない重みファイルをロードするだろう。.

だから「AIの脳はどんな姿か」と聞かれたら、率直に答えよう。工業規模の数学が、施錠された建物のチップの上に載り、毎年性能を上げている姿だ。操作者より賢くする競争をしながら、操縦可能であるという証明もない機械——頭蓋骨に詰まった思考などではない。. 私たちの計画 証明が存在するまで、その競争をsuperintelligenceで止めることだ。.