Anthropic veröffentlichte seine erste Responsible Scaling Policy im September 2023. Öffnet man das Dokument, zeigen sich die Strukturen bereits in den Überschriften, bevor die Rhetorik einsetzt. Capability-Stufen werden im Voraus benannt. Jede Stufe ist mit Safeguards verknüpft, die einspringen sollen, wenn Evaluierungen zeigen, dass das Modell die Linie überschritten hat: härtere Gewichtssicherheit, strengere Deployment-Regeln, tieferes Red-Teaming und auf den oberen Stufen eine schriftliche Zusage, nicht weiter zu trainieren oder freizugeben, bis bestimmte Schutzmaßnahmen stehen. Der Branchen-Kurzname lautet RSP. Die zugrunde liegende Logik wird oft als If-Then-Commitments bezeichnet.

Die führenden Frontier-Labs veröffentlichten die bekanntesten Versionen, und das Format verbreitete sich. Die Stufen reichen typischerweise von Systemen, die in etwa heutigen ähneln, bis zu Modellen, die sinnvoll bei einer Biowaffe, einem schweren Cyberangriff oder gefährlicher Autonomie helfen könnten. Das Dokument soll vor dem Notfall eine einfache Frage beantworten: Wenn die Fähigkeit steigt, was genau tut das Unternehmen dann?

Warum das Format eine echte Verbesserung ist

Im Vergleich zu einer allgemeinen Zusage, Sicherheit ernst zu nehmen, ist ein RSP konkreter. Er benennt Fähigkeiten, Schwellenwerte und Reaktionen im Voraus, wodurch eine Stimmung in etwas verwandelt wird, auf das Außenstehende zeigen können. Er ist vorausschauend. Das Labor muss entscheiden, was eine gefährliche Fähigkeit es kosten wird, bevor der Entdeckungsrausch und der Pressezyklus gemeinsam eintreffen.

Das Format verknüpft Wörter außerdem über Bewertungen gefährlicher Fähigkeiten, Schwellenwerte haben also eher eine operative Bedeutung als einen Slogan. Einige Strategien gehen weiter und verpflichten sich, die Entwicklung zu stoppen, wenn die Sicherheitsvorkehrungen nicht mit den Fähigkeiten Schritt halten können. Das in ein öffentliches Dokument aufzunehmen, zählt als echter Fortschritt.

Ein Entwurf ist keine Verfassung

Öffentliche, spezifische, vorab festgelegte Regeln sind, wie Industrien reifen. RSPs können ein Entwurf sein. Sie sind keine Verfassung, während die gleiche Firma schreibt, bewertet und vom Test profitiert. Ermutigen Sie den Entwurf. Behandle es nicht als das Gesetz, das folgen sollte.

Stimmt, und die Schwäche ist dennoch strukturell. Dasselbe Labor schreibt die Richtlinie, definiert die Schwellenwerte, führt die Evaluationen durch, beurteilt, ob eine Linie überschritten wurde, entscheidet, ob seine Safeguards ausreichen, und behält die Macht, den Text zu überarbeiten. Wenn kommerzieller Druck zu liefern mit einer Verpflichtung kollidiert, die das Labor selbst verfasst und verwaltet, hält keine unabhängige Partei die Pfeife.

Die Geschichte begünstigt nicht die optimistische Lektüre. Die Aufzeichnung von freiwillige Unternehmenssicherheitszusagen unter Wettbewerbsdruck ist eine Aufzeichnung von Standards, die weicher werden, wenn sie anfangen zu beißen. Eine Wenn-Dann-Regel ist nur so stark wie das Dann, und das Dann wird von der Partei durchgesetzt, die davon profitiert, sie zu schwächen. Eine Regel, die Sie selbst festlegen, messen und ändern können, ist eine Absichtserklärung. Es ist keine Einschränkung.

Zwei weitere Lücken liegen unter dem Dokument. RSPs hängen von Evaluierungen ab, um eine überschrittene Schwelle zu erkennen, daher alles, was Evaluierungen einschränkt (einschließlich Sandbagging, unbekannte Fähigkeiten und die Schwierigkeit, Sicherheit zu beweisen) schränkt die darauf aufbauende Politik ein. Und ein RSP bindet nur das Labor, das es übernimmt. Ein Konkurrent, der ablehnt, oder ein staatliches Programm außerhalb dieser Kultur, bleibt unberührt. Kein einzelnes Unternehmen kann dieses Koordinationsproblem allein lösen.

Wie die Foundation sie liest

Behaltet die gute Mechanik. Wiederverwendet die Schwellenlogik, die If-then-Struktur und den Bezug zu Evaluations. Ändert, wer den Stift hält und wer den Stopp durchsetzt. Verschiebt diese Trigger von freiwilliger Policy in bindendes Recht, gestützt von einer unabhängigen Stelle und von Rechen-Governance, sodass ein Labor seine eigene Obergrenze nicht stillschweigend anpassen kann, wenn die Obergrenze unbequem wird.

Behandeln Sie die Richtlinien als Entwürfe von durchsetzbaren Regeln und beenden Sie dann den Job außerhalb des Labors: verbindliches Recht, unabhängige Durchsetzung, Compute Controls.