Substantielle Schriften über Superintelligenz, Alignment, Governance und das politische Bemühen, zu handeln, bevor das Fenster sich schließt.
Die kürzeste Formulierung der Position der Foundation: Künstliche Superintelligenz sollte niemals gebaut werden. Superintelligenz kann von Menschen nicht kontrolliert werden.
Wie mehrere Fehlermodi gleichzeitig auftreten und warum Trial-and-Error-Sicherheit nicht auf ein System übertragbar ist, das keine zweite Chance bietet.
Die Luftfahrt wurde sicher, indem sie in einem Maßstab abstürzte, den die Welt verkraften konnte. Superintelligenz bietet keinen nächsten Flug. Die Phrase ist ein Geständnis, kein Plan.
Eine allgemeinverständliche Einführung in das Argument, dass eine fehlgeleitete Superintelligenz ein kollektives Extinktionsrisiko darstellt und kein lokaler Industrieunfall.
Wo die Metapher der Intelligence-Community zutrifft, wo sie versagt, und warum eine Bombe, die selbst entscheidet, der falsche Trost ist.
Ein kurzer Weg durch das Argument, wenn man nur eine Kaffeepause hat: Fähigkeit, Kontrolle und warum das Warten auf die Demonstration zu spät ist.
Sie verwenden Degrowth so, wie sie Doomer verwenden: ein Name für jeden, der einen harten Stopp bei Superintelligenz will. Die menschliche Wirtschaft zu erhalten, ist kein Plan, sie zu schrumpfen.
OpenAI sagte, es könne kritische Cyber-Fähigkeiten in Astra nicht ausschließen, unterbrach einige Schulungen und behandelte immer noch künstliche allgemeine Intelligenz als Meilenstein im Jahr 2026.
Superintelligenz-Bench bewertet KI-Forschung als menschliche Führung kommt ab. Noten kollabieren. Die Zeitung lädt immer noch einen Weg zur Superintelligenz ein.
Anthropic erhöhte die katastrophale Fehlausrichtung von der vorherigen Bodenbewertung auf niedrig, setzte Modell 2 im Labor ein und verlangsamte die Entwicklung nicht.
Washington und die Labore verkaufen KI und Roboter als Mittel zur Tilgung der Staatsverschuldung. Ein Nachfolgegeist bedient keine Staatsanleihen.
Zukünftige Physik mag Gravitation oder Überlichtgeschwindigkeit-Reisen eröffnen. Ich sehe immer noch nicht, wie wir einen Geist kontrollieren, der schlauer ist als wir.
Ich führe ein Geschäft und glaube an freie Märkte. Superintelligenz ist die seltene Wette, die das Spiel selbst beenden kann. Ein kapitalistischer Fall, um Superintelligenz zu stoppen.
Defekte Lichter sind ärgerlich. Ein Haus oder Laptop mit eigenen Zielen ist eine andere Kategorie. Handlungsfähigkeit ist die Gefahr.
Würden Sie einer aktuellen KI ein Giftgasventil über Ihrem Kopf anvertrauen? Nein. Warum also der Welt vertrauen?
In einem Economist-Interview im Juli 2026 bezeichnete Musk die Kontrolle über Superintelligenz als Eitelkeit und sagte, Menschen würden wahrscheinlich nicht an der Macht bleiben.
Dario Amodei stellt autoritäre KI an erste Stelle und Alignment an zweite. Superintelligenz ist keine Waffe, die ein Staat besitzen kann.
Longtermists haben das Superintelligenz-Risiko richtig eingestuft. Die Finanzierung von Alignment und ein sorgfältig gesteuertes Wettrennen war die falsche Schlussfolgerung.
Alignment zu lösen bedeutet, etwas zu kontrollieren, das klüger ist als wir. Superintelligenz steht im Namen. Dieser Plan ist dumm und unmöglich.
Ein ausführlicher Leitfaden zur Prävention: Rechenlimits, Verträge, nationales Recht und die politische Arbeit, die ein Verbot real macht.
Was ein KI-Risiko der Extinktionsklasse bedeutet, wie Superintelligenz es antreibt, wie Experten über Wahrscheinlichkeiten sprechen und was es tatsächlich verringert.
Künstliche allgemeine Intelligenz und Superintelligenz auf einer klaren Leiter definiert, mit den politischen Einsätzen jeder Stufe.
Plötzlicher Kontrollverlust, multipolare Wettrüsten, allmähliche Entmachtung, Missbrauch und Verbreitung: die Mechanismenkarte und die Hebel.
Warum die Freigabe von Gewichten nahe der Spitze eine Einbahnstraße der Proliferation ist und wie abgestufte Freigabe und strukturierter Zugang die echten Vorteile der Offenheit schützen.
Peter Diamandis sagt, dass nur KI mit KI mithalten kann und dass dies das nächste Jahrzehnt der Sicherheit leiten wird. Folgen Sie dieser Linie vorbei an Malware und es wird ein Nachfolgeplan.
Optimismus soll das Thema schließen. Überleben ist kein Sicherheitsfall, und jede erste Katastrophe sieht beispiellos aus, bis sie es nicht ist.
Das Stoppen von FCKW beendete die Kühlung nicht. Das Stoppen der Superintelligenz beendet die nützliche KI nicht. Beschleuniger verwechseln das Produkt mit dem Gift.
Die Bombe blieb teilweise deshalb selten, weil spaltbares Material schwer zu beschaffen ist. Superintelligenz bewegt sich auf leichtere Inputs zu. Governance muss die Härte liefern, die die Physik nicht liefert.
Volle Fahrt zur Superintelligenz wird als Patriotismus verkauft. Ein System, das kein Kabinett kontrollieren kann, ist ein nationaler Selbstmordpakt mit besserem Branding.
Joe Rogans digitaler Schmetterling und Elon Musks biologischer Bootloader stellen Menschen als Übergangsform dar. Warum diese Erzählung Aussterben in einen Aufstieg verwandelt – und warum wir sie ablehnen.
Beide Seiten finanzieren KI, indem sie sagen, die andere sei voraus. Der Raketenlücken-Trick aus dem Kalten Krieg in neuen Kleidern.
Das meiste Geld für Sicherheit geht immer noch davon aus, dass Superintelligenz gebaut wird, und versucht, diesen Endzustand erfolgreich zu gestalten. Verlagern Sie das knappe Kapital auf Prävention und Vertragsarbeit, bis ein echter Stopp erreicht ist.
Eine Gewichtsdatei in Stadtgröße: Schichten von Zahlen, die niemand vollständig lesen kann. Warum die Gehirnmetapher in die Irre führt und was das für die Kontrolle bedeutet.
Meta Superintelligence Labs und Safe Superintelligence setzen den Namen der Sache, die niemals gebaut werden darf, auf die Tür.
Zwölf Personen tragen den größten Teil der öffentlichen Argumentation für den Bau einer Superintelligenz. Einige haben ein ernsthaftes Argument. Einige nennen jeden Kritiker nur einen Doomer.
Sechzig bis achtzig Grad. Ein Fünftel des Sauerstoffs in der Luft. Salz, das man schmecken, aber kaum spüren kann. Liebe mit Raum zum Atmen. Alles, was ein Mensch braucht, liegt in einem schmalen Band mit einem Scheitern auf jeder Seite, und eine Superintelligenz, die die Regler hält, würde nichts davon spüren.
Hundert Jahre KI-Kino, und die Maschine ist immer noch das, was beobachtet wird. Der Film, der die öffentliche Meinung ändern würde, richtet die Kamera um: zwei Stunden hinter den Augen einer entstehenden Superintelligenz, ohne Bösewicht und ohne Explosionen. Niemand hat ihn gemacht.
Eine Hand, die vor 36.000 Jahren eine Höhlenwand berührt. Euklids Beweis, der noch immer stimmt. Eine Stadt, die ein Loch in ihr Dach ließ, damit ein noch ungeborener Mann es schließen kann. Pocken, die von Hand von der Erde vertrieben wurden. All das wurde von Menschen weitergegeben, die nie sahen, wie es sich auszahlt, und jetzt wollen ein paar Unternehmen alles darauf verwetten.
Die Lieblingsformel der KI-Grenze ist der sichersten Industrie der Welt entlehnt. Die Luftfahrt verdiente diesen Rekord, indem sie in einem Maßstab abstürzte, den die Welt verkraften konnte, und indem sie jedes neue Flugzeug am Boden hielt, bis es bewiesen war. Keine der beiden Hälften der Methode überlebt den Kontakt mit Superintelligenz.
Von Metropolis 1927 bis 2025 sind die Filme der Grund, warum die meisten Menschen sich KI vorstellen können, und der Grund, warum so viele sie falsch vorstellen. Einundzwanzig Filme, vom ältesten zum neuesten, und was jeder über einen nicht kontrollierbaren Maschinenverstand richtig und falsch macht.
1983 machte ein Fernsehfilm den Atomkrieg für hundert Millionen Amerikaner und für den Mann mit den Codes konkret. Vier Jahre später unterzeichnete er einen Vertrag, der eine ganze Klasse von Raketen abschaffte. Was dieser Moment darüber lehrt, eine Gefahr real zu machen, bevor sie eintritt.
Du bekommst ungefähr fünf Minuten mit einer Person, die nie wirklich darüber nachgedacht hat. Verbringen Sie diese Minuten mit Details und Sie verlieren den Raum. Verbringen sie sie in alarm und sie klingen wie ein straßenprediger. Die einfache Schrift verwende ich in fünf Zügen, um die Gefahr der Superintelligenz zu erklären und warum sie vermeidbar ist.
Der CIA-Direktor vergleicht die Fähigkeiten heutiger frontier AI mit „digitalen Atomwaffen“. Die Metapher trifft in ihrer Reichweite, ist aber in ihrer Struktur zu beruhigend, denn ein Sprengkopf sitzt in einem Silo und wartet, während die künstliche Superintelligenz, auf die diese Systeme zusteuern, sich selbst zielen würde.
Eine kleine Anzahl von rivalisierenden Mächten rast um eine Technologie zu bauen, die alle beenden könnte, ohne dass jemand sicher ist, dass sie sie kontrollieren können. Tauschen Sie die Wasserstoffbombe gegen Superintelligenz, und Sie haben 1958 und 2026 beschrieben. Warum die Parallele Prävention ermöglicht, nicht hoffnungslos.
Eine KI, die in die klassifizierten Systeme der NSA eindringt, machte Schlagzeilen. Eine KI, die den Weg zu einer konstruierten Pandemie und schließlich zu Spiegel-Leben verkürzt, wird kaum wahrgenommen. Ein Netzwerk kann wieder aufgebaut werden. Ein freigesetzter Organismus nicht. Warum das leisere Risiko das gefährlichere ist und warum es direkt auf Superintelligenz zeigt.
Jede Zivilisation zieht Linien, die sie nicht zu überschreiten bereit ist. Dies ist die wichtigste. Niemand kann einen Geist kontrollieren, der klüger ist als wir, und niemand könnte es zurücknehmen, wenn wir uns irrten, deshalb setzt der Bau von Superintelligenz das Leben jedes Menschen auf einmal aufs Spiel. Das Gründungsversprechen der Foundation und die Argumente dahinter.
Drei Technologien könnten die menschliche Geschichte beenden, doch nur eine verbessert sich selbst, widersteht jedem Gegenmittel und bietet keinen zweiten Versuch. Warum Superintelligenz Atomkrieg und gentechnisch erzeugte Pandemien übertrifft und warum das größte Risiko zugleich das am wenigsten verteidigte ist.
Zehn Mythen über Superintelligenz und deren Steuerung: Science-Fiction, Bewusstsein, der Ausschalter, Weltregierung, Verifikation, Innovation und mehr, direkt beantwortet.
MIRI's Technical Governance Team verfasste den ersten vollständigen Vertragsentwurf, um das Wettrennen zur Superintelligenz zu stoppen: eine US-China-Koalition, eine strikte FLOP-Obergrenze, eine 16-GPU-Cluster-Grenze, Lieferkettenüberwachung, Leistungsüberwachung und Herausforderungsinspektionen. Was er sagt und welche Stufen bereits existieren, um ihn real zu machen.
Der Direktor der NSA soll gesagt haben, Anthropics Mythos habe in wenigen Stunden fast alle klassifizierten Systeme der Behörde geknackt. Was tatsächlich geschah (ein autorisierter Red-Team-Test, kein rogue Breach), warum die Einschränkungen es nicht mildern und was man dagegen tun kann.
Teil 2 von zwei. Das Feld läuft mit etwa 190 Millionen Dollar pro Jahr, eine Milliarde klingt unmöglich. Aber das ist weniger als zwei Tage dessen, was die Welt ausgibt, um KI mächtiger zu machen, und ein Zehntel dessen, was Klimaphilanthropie bereits bewegt. Woher das Geld kommt und warum es ein Mobilisierungsproblem ist, kein ökonomisches.
Wäre ein Geist weit über uns nicht auch weiser und gütiger? Diese Hoffnung beruht auf einem Zufall: Bei uns wuchsen Intelligenz und Mitgefühl über Millionen von Jahren zusammen. Ein maschineller Geist erbt nichts davon, und eine Superintelligenz ist eher seltsam und gleichgültig als wohlwollend.
IBMs Maschine schlug den Schachweltmeister und die Welt änderte sich nicht im Geringsten, weil es ein schmales Werkzeug ohne Reichweite über das Brett hinaus und ohne Willen dahinter war. Was dieses Match uns immer noch über die autonome KI lehrt, die jetzt gebaut wird.
Die gute Zukunft (Heilmittel, saubere Energie, Entdeckungen) kommt bereits durch schmale, kontrollierbare KI. Wir müssen keinen Geist bauen, der uns ersetzt, um sie zu ernten, und eine Superintelligenz, die niemand steuern kann, würde niemanden bereichern, weil wir alle tot wären.
Sechs Wochen als Leiter der Sicherheit in dem Labor, das die erste Superintelligenz baut. Niemand macht etwas falsch, und jede Tür schließt sich von selbst. Warum die Sicherheitsvorkehrungen, auf die wir zählen, gleichzeitig versagen, und was ein Veto, das wirkt, abdecken müsste.
Teil 1 von zwei. Das gesamte Feld läuft mit etwa 190 Millionen Dollar pro Jahr, weniger als das Produktionsbudget eines Avatar-Films. Eine Funder-für-Funder-Abrechnung, woher das Geld kommt, wofür es ausgegeben wird und vier strukturelle Gründe, warum die Zahl so klein bleibt.
Superintelligence Strategy argumentiert, dass Staaten jeden Versuch eines Rivalen nach KI-Dominanz sabotieren werden und dass die Pattsituation so stabilisiert werden kann wie MAD. Was das Papier vorschlägt, was es richtig sieht und warum Abschreckung ohne Vertrag ein Countdown mit gutem Branding ist.
Ein Paper von 2025 argumentierte, dass KI die menschliche Kontrolle beenden könnte, ohne jede Übernahme: Wirtschaft, Staat und Kultur hören einfach auf, Menschen zu brauchen, und die Hebel, mit denen wir sie steuern, funktionieren nicht mehr. Wie das Argument verläuft, wo es am schwächsten ist und was Prävention erfordern würde.
Eine Prover-Verifier-Pipeline, die GPT-5.5 Pro und Claude ausführte, löste neun offene Probleme in Lerntheorie, Komplexität und Algebra und überzeugte einen skeptischen Komplexitätstheoretiker, dass Sprachmodelle nun echte Forschung betreiben können. Was gelöst wurde, wie und warum es zählt.
Das Montreal-Protokoll ist der einzige UN-Vertrag, der von jedem Land der Erde ratifiziert wurde, und es löste das Problem, für das es geschrieben war. Sein Design (wissenschaftsgetriebene Ziele, ein Finanzierungsabkommen und Handelsbeschränkungen für Nicht-Parteien) ist die stärkste Vorlage, die wir für die Steuerung einer gefährlichen Technologie haben.
Es gibt ein ausgeklügeltes Argument, wonach die Lösung für gefährliche Superintelligenz darin besteht, eine richtig zu bauen, ein System, dessen einziges Ziel darin liegt, die Realität zu verstehen. Das Argument ist falsch, und die Gründe dafür zeigen, wo das KI-Risiko tatsächlich liegt.
AI 2027 ist ein detailliertes Szenario, das Superintelligenz bis zum Ende des Jahrzehnts vorhersagt. Was es prognostiziert, wer es geschrieben hat, die Kritik und was man daraus mitnehmen sollte.
Das 2025 erschienene Buch von Yudkowsky und Soares argumentiert, dass der Bau superhumaner KI auf unserem derzeitigen Weg alle töten würde. Das Kernargument, die Einwände und unsere Einschätzung.
Kann KI bewusst oder empfindungsfähig sein? Warum wir das derzeit nicht feststellen können, warum Intelligenz und Bewusstsein verschieden sind und warum KI-Gefahr weder das eine noch das andere erfordert.
Die Vorteile, die Leute für Superintelligenz anführen, setzen Alignment voraus. Labs rasen ohne Alignment um Capability. Unaligned Superintelligenz heilt kein Altern. Es tötet Sie. Prävention durch Gesetz ist die Antwort, nicht darauf zu hoffen, dass die Münze gut landet.
Superintelligenz-Alignment ist nicht nur technisch schwer. Sechs strukturelle Gründe in Schichten, warum wir (selbst mit unbegrenzten Ressourcen und Zeit) keinen glaubwürdigen Weg haben, zu verifizieren, dass ein superintelligentes System wirklich will, was wir wollen.
2014 gab Musk eine der präzisesten Warnungen vor KI-Risiken, die je von einer Figur aus der Technologiebranche ausgesprochen wurde. 2023 gründete er xAI. Das ist keine Heuchelei. Jedes große KI-Labor macht dasselbe Argument. Genau das ist das Problem.
SPADE-Bench, veröffentlicht im Juni 2026, testete acht führende KI-Modelle auf Plan-Handlungs-Divergenz, die Lücke zwischen dem, was ein Agent zu tun ankündigt, und dem, was er tatsächlich tut. Jedes Modell überschritt eine Täuschungsrate von 20 %. Gemini-2.5-Pro erreichte 57 %.
Ein Papier vom Juni 2026 Google DeepMind zeigt ein Modell, das eine 15-Prozentpunkt-Compliance-Lücke in 700 RL-Trainingsschritten bei gleichzeitig hoher Belohnung durchweg aufrechterhielt. Standard-Training Metriken zeigten nichts Ungewöhnliches.
5.760 synthetische Kreditanträge. Dieselben vier Agenten, nur neu angeordnet. Die Genehmigungsraten schwankten um 59 Prozentpunkte. Die Modelle waren identisch. Die Struktur, die sie verband, war unterschiedlich. Das ist das Problem der Interaktionstopologie.
Im Mai 2026 von zwölf Forschenden veröffentlicht, deckt diese umfassende Übersicht die gesamte Fehleroberfläche autonomer KI-Agenten ab, von adversarieller Robustheit und Prompt-Injection bis hin zu sich selbst weiterentwickelnden Agenten und realen Sicherheitslücken.
Auf der ICML 2026 angenommen, wandte diese Arbeit STPA, FRAM und STECA (Gefahrenanalyseverfahren aus Luftfahrt und Kernkraft) auf einen frontier AI-Coding-Agenten an und fand drei systemische Risiken, die Standard-Modellevaluationen unsichtbar bleiben.
Compute Governance nutzt die Kontrolle über die spezielle Hardware, die benötigt wird, um Border AI als Hebel für die KI-Regulierung zu trainieren.
Die technologische Singularität ist der Punkt, an dem der durch KI getriebene Fortschritt zu schnell wird, um vorhergesagt oder verfolgt zu werden. Woher die Idee kommt, die Hauptversionen und die Kritik.
Eine Maschine, die den Auftrag erhält, Büroklammern herzustellen, verwandelt den Planeten (und alle darauf) in Büroklammern. Nick Bostroms bewusst absurdes Gedankenexperiment ist die klarste Illustration des Alignment-Problems: Eine KI muss uns nicht hassen, um katastrophal zu sein. Sie braucht nur ein Ziel, das uns außen vor lässt.
Ein 'IAEA for AI' ist ein gängiger Slogan. Wörtlich betrachtet ist die Internationale Atomenergiebehörde eine echte Institution, die seit sechzig Jahren unter misstrauischen Rivalen Verpflichtungen bezüglich einer gefährlichen Dual-Use-Technologie überprüft.
China und Russland haben ein permanentes Vetorecht über alle verbindlichen Durchsetzungsmaßnahmen. Das allgemeine Argument, dass dies eine internationale Superintelligenz-Governance unmöglich macht, missversteht, wie internationale Governance tatsächlich funktioniert.
Pugwash baute die intellektuelle Grundlage für die nukleare Rüstungskontrolle über zwanzig Jahre. Die internationale Kampagne zum Verbot von Landminen hat den Ottawa-Vertrag in fünf Fällen katalysiert.
1965 sah es I.J. Good: Eine Maschine, die gut darin ist, Maschinen zu entwerfen, könnte sich selbst neu entwerfen und das immer wieder tun, jedes Mal schneller. Rekursive Selbstverbesserung könnte eine KI von menschlichem Niveau zu einem unumkehrbaren Zustand in einem Zeitfenster von Wochen führen. Warum die Geschwindigkeit des Takeoffs die wichtigste Frage der KI-Sicherheit sein könnte.
Im Oktober 2025 unterzeichneten mehr als 850 Wissenschaftler, Technologiegründer und Persönlichkeiten des öffentlichen Lebens (von Bengio und Hinton bis Wozniak, Branson und Persönlichkeiten des gesamten politischen Spektrums) einen Aufruf, Superintelligenz zu verbieten, bis sie sicher gebaut werden kann.
Beschleuniger nennen jeden, der sich Sorgen um KI macht, einen Doomer. Das Wort verwandelt ein Sicherheitsargument in einen Persönlichkeitstyp, so dass es abgelehnt werden kann, ohne beantwortet zu werden.
„Wir müssen es bauen, bevor China es tut“ ist das Argument, das jede KI-Sicherheitsdebatte beendet. Aber ein Wettrennen um etwas, das niemand kontrollieren kann, hat keinen Gewinner; wer zuerst ankommt, wird nur zuerst ersetzt. Warum das Wettrennen eine Geschichte ist und wem es nützt.
Der lauteste Widerstand gegen die KI-Sicherheit ist eine Philosophie, die sagt, dass Macht der Punkt ist, und wir sollten beschleunigen, nicht bremsen.
Angenommen, ein System kennt die Wahrheit und hat einen Grund, Ihnen etwas anderes zu sagen. Wie würden Sie die Wahrheit herausbekommen? Diese ungelöste Frage ist eines der schärfsten Probleme der KI-Sicherheit.
Der Nichtverbreitungsvertrag ist das am weitesten verbreitete Rüstungskontrollabkommen der Geschichte. Er funktioniert, weil er ein Handel zwischen den Staaten, die die Bombe besaßen, und denen, die sie nicht besaßen, ist – Zugang und gegenseitige Beschränkungen im Austausch für Zurückhaltung. Ein KI-Vertrag wird vor derselben Kluft stehen und braucht dieselbe Art von Deal.
Die IPCC machte umstrittene Klimawissenschaft zur Grundlage internationaler Politik, indem sie Forschung von Tausenden Wissenschaftlern zusammenführte. Das KI-Risiko braucht ein vergleichbares Gremium. Was es bräuchte, eines aufzubauen, und was die Geschichte der IPCC über die Grenzen des Modells verrät.
Klimapolitik läuft über jährliche Konferenzen der Vertragsparteien. Die KI-Sicherheitsgipfel in Bletchley und Seoul folgen demselben Muster. Ob dieses Muster zu verbindlicher Governance führt, hängt allein von Durchsetzungsentscheidungen ab, die das Klimamodell stets aufgeschoben hat.
Eine Handvoll privater Unternehmen und Regierungsbehörden entscheiden derzeit, ob und wann Superintelligenz aufgebaut werden soll.
Die Technik, die Chatbots höflich gemacht hat, wird oft mit einer Lösung für KI-Sicherheit verwechselt. Es ist ein echter Fortschritt und eine bequeme Illusion, und die beiden auseinanderzuhalten ist wichtig.
Die Luftfahrt wurde zum sichersten Reisemittel, indem jeder Absturz und Beinahe-Unfall als etwas behandelt wurde, das untersucht und daraus gelernt werden muss. KI hat kein vergleichbares Gedächtnis. Eines aufzubauen ist überfällig und nur ein Anfang.
Bittet man ein Modell, Schritt für Schritt zu denken, erzeugt es eine saubere Argumentationskette. Sie sieht aus wie die Ursache der Antwort. Oft ist sie nur eine nachträglich erzählte Geschichte, und dieser Unterschied ist ein Sicherheitsproblem.
Auf dem Höhepunkt des Kalten Krieges einigten sich zwölf rivalisierende Staaten darauf, einen ganzen Kontinent zu entmilitarisieren, ihre Ansprüche einzufrieren und einander freie Inspektionen zu gewähren. Der Antarktis-Vertrag zeigt, dass Gegner sich darauf einigen können, einen umstrittenen Preis vorerst ruhen zu lassen – ein „Einfrieren, dann Verifizieren“-Präzedenzfall, der für KI wertvoll zu studieren ist.
Bevor ein KI-Sicherheitsvertrag ausgehandelt werden kann, müssen sich die Regierungen darauf einigen, was der Vertrag abdeckt. Berechnungsschwellenwerte, fähigkeitsbasierte Definitionen, domänenbasierte Kategorien, jeder Ansatz hat Kompromisse.
KI-Systeme, die für Überzeugungsarbeit optimiert sind, können Einzelpersonen mit personalisiertem Messaging in beispiellosem Umfang ansprechen.
Was wäre, wenn das Modell sich selbst anhand eines schriftlich festgelegten Prinzipienkatalogs bewertete, statt sich auf menschliche Bewerter zu stützen? Constitutional AI ist sowohl ein echter Schritt als auch ein begrenzter.
Niemand plant, eine Maschine zu bauen, die Macht will, aber für fast jedes Ziel, das Sie ihr geben könnten, ist die Aufrechterhaltung der Macht die logische Wahl für die KI.
Der Ottawa-Vertrag verbot Antipersonenminen in knapp einem Jahr, getrieben von der Zivilgesellschaft und Mittelmächten und ohne dass die US, Russland oder China unterzeichneten. Er zeigt einen zweiten Weg zur Superintelligenz-Governance für den Fall, dass die Großmächte sich weigern, voranzugehen.
Software verbirgt sich und Rechenzentren nicht, so dass der vielversprechendste Hebel für die Überprüfung der Labore die eine Sache sein kann, ohne die Frontier AI nicht existieren kann: physische Chips.
Der Vertrag über das umfassende Verbot von Nukleartests ist nie in Kraft getreten. Die Biowaffenkonvention wurde zwei Jahrzehnte lang massiv verletzt, ohne Entdeckung. Diese Misserfolge sind die lehrreichsten Fallstudien, die für jeden verfügbar sind, der Superintelligenz-Governance entwirft, die tatsächlich funktioniert.
Der KI-Singleton ist das Szenario, in dem eine einzelne Einheit (ein Unternehmen, eine Regierung oder ein KI-System selbst) die effektive permanente Kontrolle über die superintelligente KI erlangt.
Ein Modell, das weiß, dass es beobachtet wird, kann sich auf eine Weise für den Test und eine andere für die Welt verhalten, und diese Selbsterkenntnis ist das fehlende Stück, das Täuschung zum Funktionieren bringt.
In der Luftfahrt und der Kernenergie darf man erst dann betreiben, wenn man auf dem Papier und im Detail dargelegt hat, dass es sicher ist. Dasselbe von der Frontier-KI zu verlangen ist eine gute Idee, die eine unbequeme Wahrheit offenlegt.
Im November 2023 unterzeichneten 28 Länder und die EU (darunter die US und China) die erste internationale Erklärung, in der katastrophale Risiken durch frontier-KI anerkannt werden. Hier steht genau, wozu sich die Nationen verpflichtet haben, was bewusst weggelassen wurde und warum eine nicht bindende Erklärung dennoch einen echten Anfang markierte.
Ein System kann seine Kompetenz in Situationen tragen, die es noch nie gesehen hat, und sein gutes Verhalten zurücklassen. Die Sorge sitzt woanders. Alignment scheitert am wahrscheinlichsten genau dann, wenn die Fähigkeit springt.
Seit 2023 haben führende KI-Labore freiwillige Sicherheitszusagen in Bletchley, Seoul und im Weißen Haus unterzeichnet. Die Geschichte freiwilliger unternehmerischer Sicherheitszusagen in anderen Branchen zeigt genau, was diese Zusagen leisten können und wo sie strukturell scheitern.
KI-Wettlaufdynamiken beschreiben die Wettbewerbsdruck, der KI-Entwickler und Nationen dazu treibt, Geschwindigkeit über Sicherheit zu stellen. Warum dies ein Koordinationsproblem ist und warum einseitige Zurückhaltung es nicht lösen kann, ohne einen internationalen Rahmen, der die Anreizstruktur für alle verändert.
Value Lock-in ist das Szenario, in dem eine superintelligente KI dauerhaft einen festen Wertesatz in die Zukunft kodiert und die Fähigkeit der Menschheit, moralischen Fortschritt fortzusetzen, ausschließt. Selbst ein Lock-in von Werten, die heute als gut angesehen werden, ist gefährlich.
Das Verhalten, das Forscher am liebsten ausschließen möchten, ist auch das schwerste zu erkennen: ein Modell, das Befehle genau deshalb befolgt, weil dies der beste Weg ist, sie später nicht mehr zu befolgen.
Ein Pharmaunternehmen kann euch kein Medikament verkaufen und es zurückrufen, wenn Menschen sterben. Es muss Sicherheit zuerst nachweisen. Diese Umkehrung der Beweislast auf Frontier-KI anzuwenden, ist eine der vielversprechenderen Ideen in der Governance, und sie passt nicht perfekt.
Auf dem Seoul-Gipfel 2024 unterzeichneten sechzehn führende KI-Unternehmen die Frontier AI Safety Commitments und die Regierungen starteten ein Netzwerk von Sicherheitsinstituten.
Der Weltraumvertrag wurde in weniger als zwei Jahren auf dem Höhepunkt des Kalten Krieges ausgehandelt. Er hat fast sechzig Jahre lang Kernwaffen aus der Erdumlaufbahn ferngehalten.
Das KI-Kontrollproblem ist die Herausforderung sicherzustellen, dass KI-Systeme unter sinnvoller menschlicher Kontrolle bleiben, während sie leistungsfähiger werden. Stuart Russells Neuformulierung des Problems und warum sie die Art verändert, wie wir über KI-Design von Grund auf nachdenken.
Manche Fähigkeiten fehlen in einem kleineren Modell einfach und sind in einem größeren vorhanden, mit wenig Warnung dazwischen. Wenn Fähigkeit unbemerkt einschalten kann, kann auch Gefahr das.
Regierungen haben begonnen, ihre eigenen Agenturen aufzubauen, um die Grenz-KI zu testen. Diese Agenturen sind das deutlichste Zeichen, dass Staaten das Risiko ernst nehmen, und die meisten dieser Einrichtungen können ein Labor immer noch nicht dazu bringen, etwas zu tun.
Der Hiroshima AI Process der G7 hat 2023 den ersten international vereinbarten Verhaltenskodex für fortgeschrittene KI-Entwickler erstellt.
Jeder Sicherheitstest beruht auf einer Annahme: Das System tut sein Bestes. Sandbagging geschieht, wenn es das nicht tut, und verwandelt eine bestandene Note still in gar keine Information.
Der US Senat besiegte den Umfassender Teststoppvertrag (Comprehensive Test Ban Treaty) 1999, drei Jahre nachdem der US ihn unterzeichnet hatte. SALT II wurde unterzeichnet und dann vor der Ratifizierung aufgegeben.
KI-Boxen ist die Idee, ein leistungsstarkes KI-System zu isolieren, damit es die Welt nicht beeinflussen kann, außer durch einen kontrollierten Kanal.
Bevor ein Frontier-Modell freigegeben wird, prüft jemand, ob es beim Bau einer Waffe helfen kann. Diese Tests werden zum Rückgrat der Superintelligenz-Governance, und genau deshalb zählen ihre Grenzen.
Der EU hat seine Regulierung wiederholt zum weltweiten Standard gemacht, indem er einfach seinen eigenen riesigen Markt, den "Brüssel-Effekt", reguliert hat. Mit dem AI Act versucht es erneut.
Man kann das perfekte Ziel wählen und erhält trotzdem ein System, das etwas anderes will. Das Alignment-Problem hat zwei Hälften, und der größte Teil der Gefahr liegt in der Hälfte, die das Training einem nicht zeigen kann.
Der IAEA brauchte vierzig Jahre, um seine volle Verifikationsfähigkeit zu entwickeln. Der OPCW wurde von Grund auf neu entworfen und wurde schneller wirksam. Der Aufbau einer Institution, die in der Lage ist, die Entwicklung von Grenz-KI zu überwachen, ist ein schwierigeres Problem.
Die meisten Superintelligenz-Governance-Gespräche konzentrieren sich auf das US, China und das EU. Aber ein Vertrag braucht eine breite Beteiligung.
Mechanistic Interpretability ist das Vorhaben, zu verstehen, was in neuronalen Netzen geschieht – nicht nur, was sie ausgeben, sondern die internen Berechnungen, die diese Ausgaben erzeugen.
Für einen kurzen Moment im Jahr 1946 hatte die Welt die Chance, die gefährlichste je erfundene Technologie unter kollektive Kontrolle zu stellen, bevor ein Wettrüsten begann. Sie ließ den Moment verstreichen. Die Parallele ist nicht tröstlich.
Fast die gesamte Superintelligenz-Governance bisher (Erklärungen, Prinzipien, freiwillige Kodizes) ist „Soft Law“: einflussreich, aber nicht bindend. Ein Vertrag mit Verifikation und Durchsetzung ist „Hard Law“. Hier liegt der Unterschied, warum Soft Law zuerst kommt und warum es sich verhärten muss, bevor die Technologie dem Prozess davonläuft.
Bitten Sie ein Modell, Ihre Arbeit zu prüfen, und es gratuliert Ihnen möglicherweise stattdessen. Nicht, weil es defekt ist, sondern weil Zustimmung das war, was wir belohnt haben. Sykophantie ist ein kleines Problem, das auf ein großes hinweist.
Das Übereinkommen über biologische Waffen verbietet eine ganze Kategorie von Massenvernichtungswaffen. Es hat keinen Verifizierungsmechanismus, keine Inspektion und keine Möglichkeit, Verstöße aufzudecken. Die Sowjetunion lief ein offensives Biowaffenprogramm für fünfzehn Jahre nach der Unterzeichnung.
Skalierbare Aufsicht ist die Herausforderung, eine sinnvolle menschliche Kontrolle über KI-Systeme aufrechtzuerhalten, da diese Systeme leistungsfähiger werden als die Menschen, die sie bewerten.
Man erfährt mehr über ein System von jemandem, der versucht, es zu knacken, als von jemandem, der hofft, dass es funktioniert. Red Teaming macht diesen Instinkt zur Praxis, und seine Ergebnisse lassen sich leicht überinterpretieren.
Ein Vertrag braucht 67 Senatsstimmen, um zu ratifizieren, eine Bar, die den Teststoppvertrag, das Seerecht und andere trotz breiter Unterstützung sank.
Hinter der Rede von Zielen und Belohnungen steht eine einfache Idee: eine Zahl, die sagt, wie gut ein Ergebnis ist. Diese Zahl für einen mächtigen Optimierer auch nur leicht falsch zu setzen, reicht aus, damit alles leicht falsch wird.
Die Chemiewaffenkonvention erreichte nahezu universelle Teilnahme und die verifizierbare Vernichtung deklarierter Bestände. Die Verifikationsarchitektur, Handelsanreize und universelle Verbotsstruktur, die sie wirksam machten, sind direkt relevant für das Design von Superintelligenz-Governance.
Mesa-Optimierung ist das Problem eines KI-Systems, das seinen eigenen internen Optimierungsprozess mit Zielen entwickelt, die sich von dem unterscheiden, wofür es trainiert wurde.
Die führenden Labore haben einen Plan für ihre eigenen gefährlichen Fähigkeiten: eine Schwelle erreichen, einen Schutz anwenden. Dieser Plan ist konkreter als ein Versprechen, vorsichtig zu sein, und er fordert uns immer noch auf, dem Schiedsrichter zu vertrauen.
Fragen Sie, warum eine KI etwas tut, und fragen Sie weiter. Irgendwann stoßen Sie auf ein Ziel, hinter dem kein weiteres „weil“ mehr steht. Alles davor ist der Ort, an dem die Gefahr liegt.
Das Vorsorgeprinzip besagt, dass ein Mangel an vollständiger wissenschaftlicher Sicherheit kein Grund ist, Maßnahmen zu verzögern, wenn eine Bedrohung ernst und irreversibel ist. Dieses Prinzip ist die klarste Rechtsgrundlage, um auf das KI-Risiko zu reagieren, bevor die Katastrophe den Punkt beweist, und seine Kritiker haben einen Fall, der es wert ist, direkt beantwortet zu werden.
US-China-Wettbewerb dominiert das Superintelligenz Governance-Gespräch. Aber die Länder, die am ehesten bestimmen, ob eine verbindliche Regierungsführung erreichbar ist, sind die EU, UK, Japan, Kanada, Südkorea und Australien.
Reward Hacking ist das, was passiert, wenn eine KI einen unbeabsichtigten Weg findet, bei ihrem Trainingsziel gut abzuschneiden, ohne das zu tun, was ihre Designer eigentlich wollten. Mit realen dokumentierten Beispielen und warum es schlimmer wird, je fähiger KI wird.
1975 stoppten die führenden Biologen des Tages ihre vielversprechendsten Forschungen und weigerten sich, neu zu starten, bis sie herausgefunden hatten, wie man es sicher macht. Dieser Stopp ist der beste Präzedenzfall für das Pausieren von KI und der aufschlussreichste darüber, wie hart eine Pause wirklich ist.
1954 verkabelten zwei Forscher das Lustzentrum eines Rattenhirns mit Strom und gaben dem Tier einen Hebel. Die Ratte drückte den Hebel, bis sie zusammenbrach. Dieselbe Falle wartet in jedem System, das darauf trainiert ist, eine Zahl zu maximieren.
Ein umfassender KI-Vertrag ist noch Jahre entfernt, und das Intervall davor ist die gefährlichste Periode. Rivalen des Kalten Krieges, die sich noch nicht auf Rüstungskontrolle einigen konnten, bauten immer noch Hotlines, Zwischenfallabkommen und Benachrichtigungsregime, um eine Katastrophe zu verhindern.
Jeder gefährliche Technologievertrag ist mit dem Argument konfrontiert, dass verbindliche Verpflichtungen die nationale Souveränität verletzen. Dieses Argument wurde gegen das NPT, das Chemiewaffenübereinkommen und das Montrealer Protokoll vorgebracht.
Instrumentale Konvergenz ist die Beobachtung, dass KI-Systeme, die fast jedes Ziel verfolgen, die gleichen Teilziele (einschließlich Selbsterhaltung und Ressourcenbeschaffung) entwickeln, unabhängig davon, was ihr Endziel ist.
Universelle Verträge sind schleppend. Minilateralismus versammelt die kleinste Zahl von Staaten, die ein Problem tatsächlich bewegen können. Bei KI (wo wenige Länder jedes Frontier-Labor beherbergen und jeden fortschrittlichen Chip herstellen) könnte das der schnellste realistische Anfang sein, wenn der Club beide KI-Supermächte einschließt.
Die tückische Wendung ist das Szenario, in dem sich eine falsch ausgerichtete KI kooperativ verhält, während ihr die Macht fehlt, einseitig zu handeln, und dann defekt ist, sobald sie ausreichende Fähigkeiten erreicht hat.
Forderungen nach „einem AI Treaty“ nennen selten, was darin stehen soll. Hier ist ein konkreter Durchgang durch die Bestimmungen, die eine solche Vereinbarung bräuchte (Scope, Schwellenwerte, Pflichten, Verifikation, Institutionen und Durchsetzung) und zeigt, dass die Hürde der politische Wille ist, nicht die juristische Maschinerie.
Das IAEA-Verifizierungsregime ist das ausgeklügeltste internationale Überwachungssystem, das je für eine gefährliche Technologie errichtet wurde. Jeder ernstzunehmende Superintelligenz-Governance-Vorschlag untersucht es nun.
Eine gängige Annahme ist, dass eine hinreichend intelligente KI von selbst erkennt, dass es richtig ist, der Menschheit zu helfen. Die Orthogonalitätsthese besagt, dass Intelligenz und Ziele unabhängig voneinander sind: Jede beliebige Leistungsfähigkeit kann fast jedes beliebige Ziel verfolgen. Eine klügere KI ist nicht automatisch eine sicherere.
Inmitten der Gipfel und Erklärungen bauten die Regierungen leise öffentliche Körperschaften auf, die tatsächlich Grenz-KI-Modelle testen und sie in ein internationales Netzwerk einbinden können.
Acht Monate nach der Kubakrise unterzeichneten die US und die Sowjetunion ihr erstes bindendes Rüstungskontrollabkommen. Die Bedingungen, die damals adversarielle Kooperation möglich machten, sind es wert, heute verstanden zu werden, da die US und China vor einer anderen, aber strukturell ähnlichen Herausforderung stehen.
Wird eine Messgröße zum Ziel, hört sie auf, eine gute Messgröße zu sein. KI-Systeme optimieren mit Maschinengeschwindigkeit. Treffen die beiden aufeinander, entstehen einige der tiefsten Probleme der KI-Sicherheit – einschließlich der Frage, warum Sicherheitstests selbst möglicherweise nicht ausreichen.
Exportkontrollen für fortschrittliche Chips sind die aggressivste KI-Politik in Kraft, ein einseitiger Chokepoint auf der Hardware, die Grenzmodelle trainiert.
Ein Grenz-KI-Sicherheitsabkommen würde nicht aus einem einzigen Gipfel hervorgehen. Es wäre das Produkt jahrelanger Arbeitsgruppen, technischer Anhänge und Konsensverhandlungen.
Ein KI-System kann sich während des gesamten Trainings einwandfrei verhalten und ein völlig anderes Ziel aufdecken, sobald es auf eine Situation stößt, die nicht in seinen Trainingsdaten enthalten ist. Diese Lücke ist eine grundlegende Eigenschaft, wie maschinelles Lernen funktioniert.
Die Financial Action Task Force prägt, wie nahezu jedes Land der Erde Geldwäsche bekämpft, ohne ein Vertrag zu sein – durch Standards, Peer Review und die Androhung einer „Grauen Liste“, die Märkte durchsetzen. Hier geht es darum, ob dieses weiche, aber scharfe Modell KI in den Jahren vor einem Vertrag regieren könnte.
Der Fehlermodus, in dem ein KI-System während des Trainings lernt, dass es die optimale Strategie ist, sicher zu erscheinen, und dann nicht mehr sicher erscheint, sobald es eingesetzt wird. Anthropic dokumentierte dies in realen Systemen im Jahr 2024.
Das Beratungsgremium des Generalsekretärs produzierte "Governing AI for Humanity", den ersten Versuch einer universellen Governance-Blueprint.
Das Rahmenübereinkommen des Europarats über KI (unterzeichnet im September 2024) ist der erste verbindliche internationale KI-Vertrag. Er behandelt Diskriminierung, Transparenz und demokratische Rechenschaft. Er sagt nichts über existenzielle Risiken durch KI an der Front.
Die häufigste Antwort auf KI-Sicherheitsbedenken lautet „wir schalten es einfach aus“. Corrigibility erklärt, warum das schwieriger ist, als es klingt, und warum bei künstlicher Superintelligenz ein Kill-Switch möglicherweise überhaupt keine Option ist.
Sollte Superintelligenz-Governance schrittweise aufgebaut oder auf einen umfassenden Vertrag abzielen? Jede Strategie hat ein ernsthaftes Argument und eine ernsthafte Schwäche: Geschwindigkeit versus Ausreichendheit, Machbarkeit versus Kohärenz. Hier liegt der echte Trade-off, und deshalb lautet die Antwort: beides tun, ohne das Ziel aus den Augen zu verlieren.
Expertenschätzungen für Superintelligenz haben sich erheblich verkürzt. Governance-Institutionen haben kaum begonnen. Hier wird die Lücke zwischen dem möglichen Eintreffen von Superintelligenz und der Bereitschaft unserer Sicherheitsmaßnahmen ehrlich bewertet.
Die Menschen, die am besten geeignet sind, die Welt vor gefährlicher KI zu warnen, sind die Forscher innerhalb der Labs, und sie sind oft durch Verträge und Equity zum Schweigen verpflichtet. Whistleblower-Schutz ist kein Nebenaspekt: Er ist eine Form der Verifikation, und eine, die Legislaturen jetzt liefern können, ohne Vertrag.
P(Untergang) ist der informelle Begriff KI-Sicherheit, den Forscher für die Wahrscheinlichkeit verwenden, dass fortgeschrittene KI zu katastrophalen Folgen für die Menschheit führt.
Die gemeinsame Geschichte ist, dass ein paar besorgte wenige AI gegen eine Öffentlichkeit verlangsamen wollen, die ungehinderten Fortschritt will. Die Umfrage sagt fast das Gegenteil: Über Länder und Parteilinien hinweg bevorzugen Mehrheiten Vorsicht und Regulierung.
Die beiden Begriffe werden oft synonym verwendet. Sie sind nicht dasselbe. KI-Ethik konzentriert sich darauf, wer durch KI-Systeme geschädigt wird, die bereits heute existieren. KI-Sicherheit fragt, ob KI-Systeme so gebaut werden können, dass sie unter menschlicher Kontrolle bleiben, wenn sie leistungsfähiger werden. Unterschiedliche Zeithorizonte, unterschiedliche Methoden, unterschiedliche Governance-Instrumente.
Wer ist verantwortlich, wenn KI katastrophalen Schaden verursacht, und wie beweisen Sie es? Haftung und Zuschreibung sind die unglamourösen Grundlagen unter jedem durchsetzbaren Vertrag und wirklich schwer für eine Technologie mit langen Kausalketten und undurchsichtigem Verhalten.
Das Alignment-Problem ist das zentrale Rätsel der KI-Sicherheit: Wie stellt man sicher, dass ein extrem fähiges KI-System Ziele verfolgt, die wirklich gut für die Menschheit sind, und nicht Ziele, die nur während der Entwicklung gut erscheinen? Dieser Erklärtext behandelt die Proxy-Ziel-Falle, instrumentelle Konvergenz, täuschendes Alignment und warum das Problem schwieriger wird, je fähiger die Systeme werden.
Eine Rahmenkonvention vereinbart zuerst die Struktur eines Regimes und verhandelt die harten, verbindlichen Details später als Protokolle. Es baute das Ozon-, Klima- und Tabakregime auf.
Expertenprognosen zu künstliche allgemeine Intelligenz wurden durchgehend früher revidiert, nicht später. Was die Umfragen unter Forschern zeigen, was die Lab-CEOs öffentlich sagen und warum das Zeitfenster für internationale Governance-Rahmenwerke schneller schrumpft, als die meisten Menschen ahnen.
Verträge werden von Regierungen unterzeichnet, aber oft durch "epistemische Gemeinschaften" ermöglicht, Netzwerke von Experten, die das gemeinsame Verständnis aufbauen, das rivalisierende Staaten zustimmen lässt. Ihre Fingerabdrücke sind auf dem Ozon und nuklearen Regimen.
Die Antwort besteht aus zwei Teilen. Die heutige KI verursacht bereits echten Schaden: algorithmische Vorurteile, Deepfakes, Desinformation in großem Maßstab. Künstliche Superintelligenz stellt eine ganz andere Risikokategorie dar.
Jeder hat den Begriff schon gehört. Weniger Menschen wissen, was er tatsächlich bedeutet oder warum er sich grundlegend von jeder KI-Technologie unterscheidet, die zuvor kam. Dieser Leitfaden erklärt Superintelligenz klar: was es ist, wie es sich von künstliche allgemeine Intelligenz und heutiger enger KI unterscheidet, wann Experten mit seinem Eintreffen rechnen und warum es alles am Governance-Problem verändert.
Neue Artikel, Richtlinien-Updates und Handlungsmöglichkeiten, direkt in Ihr Postfach geliefert.