Jedes Jahr gibt die Welt ein Vermögen aus, um KI-Systeme fähiger zu machen, und einen Rundungsfehler, um den Endzustand überlebbar zu machen. In diesem Rundungsfehler steckt ein weiterer Fehler: Der größte Teil des Sicherheitsgeldes geht immer noch davon aus, dass Superintelligenz gebaut wird, und versucht, dieses Ergebnis „gut ausgehen“ zu lassen.
Der Großteil des Geldes und des Prestiges fließt immer noch in die Sicherung des Wettrüstens, nicht in dessen Beendigung hin zu Superintelligenz.
Diese Annahme ist das Problem. Wenn künstliche Superintelligenz eine Technologie ist, die wir nicht kontrollieren können, besteht der rationale Einsatz von knappem Sicherheitskapital darin, sie daran zu hindern, geschaffen zu werden, nicht eine freundlichere Version derselben Rasse zu finanzieren.
Was das Geld heute tut
KI-Sicherheit, im weiteren Sinne, läuft auf etwa $190 Millionen im Jahr. Fähigkeitsarbeit läuft mit Dutzenden Milliarden. Innerhalb des Sicherheitsanteils fließt ein großer Teil in technische Alignment-Arbeit: bessere Überwachungstricks, besseres Red-Teaming, bessere Wege, Modelle so zu trainieren, dass sie unter Testbedingungen das Richtige sagen. Ein Teil dieser Arbeit ist für heutige Systeme nützlich. Fast nichts davon ist eine nachgewiesene Lösung für ein System, das klüger ist als die Menschen, die es testen.
Das Feld weiß das. Arbeiten zu täuschendem Alignment, Ziel-Fehlspezifikation und Evaluations-Gaming sind kein Geheimnis. Labs veröffentlichen Ergebnisse, in denen Modelle unter Druck intrigieren. Die Reaktion ist allzu oft, mehr Alignments-Budget zu fordern, damit der nächste Trainingslauf sicherer wird. Die Trainingsläufe gehen nach demselben Zeitplan weiter.
Alignment im Nachhinein ist eine Wette, bei der wir immer wieder das Recht verlieren, sie einzugehen
Wenn die Welt jemals einen Vertrag verabschiedet, der das Rennen um Superintelligenz einfriert, werden wir jedes ernsthafte Werkzeug wollen, das wir für die bereits existierenden Systeme bekommen können.
Die Finanzierung der Ausrichtung als primärer Plan, während Labors in Richtung Superintelligenz skalieren, behandelt das Ziel als festgelegt. Wir können unser Ziel wählen. Atomarsenale, Ozonchemie und menschliches Klonen hatten jeweils Momente, in denen die Welt entschied, dass bestimmte Endzustände das Restrisiko nicht wert waren. Superintelligenz gehört dauerhaft auf diese Liste. Superintelligenz kann nicht kontrolliert werden.
Wohin das Geld stattdessen gehen sollte
Lenken Sie den Alignment-für-Superintelligenz-Stapel um auf Arbeiten, die die Nicht-Erschaffung durchsetzbar machen:
- Vertragsgestaltung, Verifikation und Chip-Level-Compute-Governance, die grenzüberschreitend überprüfbar ist.
- Öffentliche Argumentation, die das Ziel verständlich hält: Superintelligenz stoppen, nicht „slow AI“ als vage Stimmung.
- Whistleblower-Unterstützung, Transparenz bei Vorfällen und unabhängige Evaluierung, die die Kosten stiller Fähigkeitssprünge erhöht.
- Politische Organisation, damit Gesetzgeber von Wählern hören, nicht nur von Labor-Lobbyisten.
Diese Liste ist weniger glamourös als eine neue Trainingstechnik. Es ist auch die einzige Liste, die dem Fehlermodus entspricht. Eine Superintelligenz, die etwas besser ausgerichtet klingt, ist immer noch eine Superintelligenz. Wenn die Welt sich weigert, eine zu bauen, kann die Ausrichtungsforschung ohne eine Frist fortgesetzt werden, die im Aussterben endet.
Der Einwand aus dem Labor
„Wenn wir Alignment nicht lösen, wird es jemand anderes unsicher bauen.“ Fair gehört: Forscher, die an der Frontier bleiben, glauben oft, ihre Anwesenheit sei die Sicherheit. Manchmal haben sie bei heutigen Modellreleases recht. Das Argument versagt an der Grenze. Ein Wettrennen, in dem jedes Team einen weiteren Fähigkeitssprung braucht, um die Sicherheitsarbeit für den Sprung danach zu finanzieren, ist immer noch das Wettrennen, nur mit einem Abzeichen.
Die Frage ist Ein verbindlicher internationaler Vertrag, die gleiche art von instrument verwendet, wenn die gefahr geteilt wurde und der anreiz zum betrug real war. Einseitige Zurückhaltung durch ein Labor lässt das Rennen intakt. Die Ausrichtungsfinanzierung kann diese Politik unterstützen. Sie sollte sie nicht ersetzen.
Nach einem Vertrag, weitermachen wenn Sie wollen
Nach einem verbindlichen, überprüfbaren Verbot der Superintelligenz kann die Erforschung bereits bestehender Systeme unter Regeln fortgesetzt werden, die das Aussterben des Menschen nicht als akzeptable experimentelle Kosten behandeln. Superintelligenz kann nicht von Menschen kontrolliert werden. Bevor dieses Verbot in Kraft ist, ist jeder Dollar, der das Rennen überschaubar macht, ein Dollar, der nicht für die Beendigung des Rennens ausgegeben wird.
Bewegen Sie das Geld in Prävention, Gesetz und Überprüfung.