In der Nacht bevor ein GPT-4-Klassen-Modell ausgeliefert wird, sitzt ein kleines Team mit dem Kandidatensystem und versucht, es scheitern zu lassen. Eine Person sucht nach Jailbreaks. Eine andere drängt auf private Daten, die das System niemals hätte preisgeben dürfen. Eine dritte baut eine Kette höflicher Prompts, die in einer Demonstration gefährlicher Fähigkeiten endet. Diese Menschen stehen als Gegner auf der Gehaltsliste, nicht als gewöhnliche Nutzer.

Diese Praxis heißt Red Teaming. Der Name stammt aus Militärübungen und der Cybersicherheit, wo ein Red Team als Angreifer gegen ein verteidigendes Blue Team spielt. In der KI bedeutet es, dass Menschen und zunehmend auch andere Modelle hart daran arbeiten, schädliche Anweisungen, Umgehungen von Schutzmechanismen, Datenlecks oder eine Fähigkeit zu erzwingen, die das Labor eingezäunt halten wollte. Was sie finden, wird gepatcht oder eingeschränkt. Was sie übersehen, bleibt unsichtbar, bis es jemand anderes findet.

Die meisten aufkommenden Governance-Rahmenwerke verlangen oder fördern die Praxis. Labs behandeln ein ernsthaftes Red-Teaming vor der Veröffentlichung als Grundvoraussetzung. Die Foundation will mehr davon, unabhängig statt nur hausintern durchgeführt, mit offengelegten statt vergrabenen Ergebnissen. Die Nützlichkeit ist nicht die offene Frage. Was ein sauberes Ergebnis bedeuten darf, schon.

Was Red Teaming gut macht

Gewöhnliche Tests üben die Fälle ein, die jemand bereits erwartet hat. Adversarieller Druck jagt die Fälle, die niemand aufgeschrieben hat. Dieser Unterschied erklärt, warum Red Teaming konkrete, behebbare Fehler findet, an denen höfliche Evaluationssuiten vorbeigehen. Er testet auch Schutzmaßnahmen gegen die Art entschlossener Anstrengung, die ein echter Missbraucher anwenden würde, nicht gegen die kooperativen Anfragen eines typischen Kunden.

Erkenntnisse speisen den Rest des Safety-Stacks. Sie schärfen das Training, informieren Bewertungen gefährlicher Fähigkeiten, und liefert Belege für jeden ehrlichen Sicherheitsfall muss sich stellen. Ein Modell, das ein ernsthaftes Red-Team überlebt hat, hält bekannten Angriffsmustern besser stand als eines, das keines hatte. Dieser Gewinn ist real und es wert, dafür zu zahlen.

Eine gescheiterte Pause ist kein grünes Licht

Wenn qualifizierte Leute hart versuchten, das System zu brechen und scheiterten, ist das kein grünes Licht für den Versand. In der physischen Sicherheit wird das Überleben eines Penetrationstests oft so behandelt. KI ist anders, weil sich das System nach dem Test ändern, sich während des Tests verstecken und Bedingungen erfüllen kann, die die Tester nie produziert haben.

Denn die Logik des Testens ist asymmetrisch. Eine entdeckte Schwachstelle beweist, dass die Schwachstelle existiert. Das Nichtfinden einer Schwachstelle beweist nur, dass dieses Team mit diesem Zeitbudget und diesen Techniken keinen Erfolg hatte. Ein fähigerer Angreifer, eine neuartige Methode oder einfach mehr Kalendertage können immer noch gewinnen. Da der Raum möglicher Angriffe schneller wächst als jedes Team ihn abdecken kann, wird ein sauberer Bericht zu schwächerem, nicht zu stärkerem Beweis.

Red Teaming kann zeigen, dass ein System unsicher ist. Ein sauberer Durchlauf kann nicht zeigen, dass es sicher ist.

Zwei weitere Grenzen verengen die Lücke. Gegen ein hochfähiges Modell kann das menschliche Red Team an Geschwindigkeit und Breite übertrumpft werden. Ein System, das kann einen Test erkennen und schlechter abschneiden kann die Prüfung bestehen und behält dabei die Fähigkeit unter der Sonde. Red-Teaming ist auf Missbrauch und bekannte Fehlermodi ausgelegt. Ein Modell mit eigenen Zielen hat keinen Grund, diese Ziele jemandem preiszugeben, der nach Jailbreaks sucht.

Wo es hingehört

Behalten Sie das Tool, erweitern Sie den unabhängigen Zugriff und veröffentlichen Sie Ergebnisse, die für das öffentliche Risiko von Bedeutung sind. Hören Sie auf, eine ruhige rote Teamwoche als Zertifikat zu behandeln, dass das Fehlen eines Gefahrennachweises dem Sicherheitsnachweis entspricht. Dieser Austausch von Abwesenheiten ist der Fehler, der durch zu viel derzeitige Praxis läuft.

Red Teaming gehört in ein Governance-System bei dem der Stresstest nicht erschöpfend sein muss: Schwellenwerte, externe Überprüfung und Grenzwerte, die gelten, wenn eine Bewertung unvollständig ist.