Substantielle Schriften über Superintelligenz, Alignment, Governance und das politische Bemühen, zu handeln, bevor das Fenster sich schließt.
Die kürzeste Formulierung der Position der Foundation: Künstliche Superintelligenz sollte niemals gebaut werden. Superintelligenz kann von Menschen nicht kontrolliert werden.
Wie mehrere Fehlermodi gleichzeitig auftreten und warum Trial-and-Error-Sicherheit nicht auf ein System übertragbar ist, das keine zweite Chance bietet.
Die Luftfahrt wurde sicher, indem sie in einem Maßstab abstürzte, den die Welt verkraften konnte. Superintelligenz bietet keinen nächsten Flug. Die Phrase ist ein Geständnis, kein Plan.
Eine allgemeinverständliche Einführung in das Argument, dass eine fehlgeleitete Superintelligenz ein kollektives Extinktionsrisiko darstellt und kein lokaler Industrieunfall.
Wo die Metapher der Intelligence-Community zutrifft, wo sie versagt, und warum eine Bombe, die selbst entscheidet, der falsche Trost ist.
Ein kurzer Weg durch das Argument, wenn man nur eine Kaffeepause hat: Fähigkeit, Kontrolle und warum das Warten auf die Demonstration zu spät ist.
They use degrowth the way they use doomer: a name for anyone who wants a hard stop on Superintelligenz. Keeping the human economy is not a plan to shrink it.
OpenAI sagte, es könne kritische Cyber-Fähigkeiten in Astra nicht ausschließen, unterbrach einige Schulungen und behandelte immer noch AGI als Meilenstein im Jahr 2026.
Superintelligenz-Bench bewertet KI-Forschung als menschliche Führung kommt ab. Noten kollabieren. Die Zeitung lädt immer noch einen Weg zur Superintelligenz ein.
Anthropic erhöhte die katastrophale Fehlausrichtung von der vorherigen Bodenbewertung auf niedrig, setzte Modell 2 im Labor ein und verlangsamte die Entwicklung nicht.
Washington und die Labore verkaufen KI und Roboter als Mittel zur Tilgung der Staatsverschuldung. Ein Nachfolgegeist bedient keine Staatsanleihen.
Zukünftige Physik mag Gravitation oder Überlichtgeschwindigkeit-Reisen eröffnen. Ich sehe immer noch nicht, wie wir einen Geist kontrollieren, der schlauer ist als wir.
I run a business and believe in free markets. Superintelligence is the rare bet that can end the game itself. A capitalist case for stopping Superintelligenz.
Defekte Lichter sind ärgerlich. Ein Haus oder Laptop mit eigenen Zielen ist eine andere Kategorie. Handlungsfähigkeit ist die Gefahr.
Würden Sie einer aktuellen KI ein Giftgasventil über Ihrem Kopf anvertrauen? Nein. Warum also der Welt vertrauen?
In einem Economist-Interview im Juli 2026 bezeichnete Musk die Kontrolle über Superintelligenz als Eitelkeit und sagte, Menschen würden wahrscheinlich nicht an der Macht bleiben.
Dario Amodei stellt autoritäre KI an erste Stelle und Alignment an zweite. Superintelligenz ist keine Waffe, die ein Staat besitzen kann.
Longtermists haben das Superintelligenz-Risiko richtig eingestuft. Die Finanzierung von Alignment und ein sorgfältig gesteuertes Wettrennen war die falsche Schlussfolgerung.
Alignment zu lösen bedeutet, etwas zu kontrollieren, das klüger ist als wir. Superintelligenz steht im Namen. Dieser Plan ist dumm und unmöglich.
Ein ausführlicher Leitfaden zur Prävention: Rechenlimits, Verträge, nationales Recht und die politische Arbeit, die ein Verbot real macht.
Was ein KI-Risiko der Extinktionsklasse bedeutet, wie Superintelligenz es antreibt, wie Experten über Wahrscheinlichkeiten sprechen und was es tatsächlich verringert.
Künstliche allgemeine Intelligenz und Superintelligenz auf einer klaren Leiter definiert, mit den politischen Einsätzen jeder Stufe.
Plötzlicher Kontrollverlust, multipolare Wettrüsten, allmähliche Entmachtung, Missbrauch und Verbreitung: die Mechanismenkarte und die Hebel.
Warum die Freigabe von Gewichten nahe der Spitze eine Einbahnstraße der Proliferation ist und wie abgestufte Freigabe und strukturierter Zugang die echten Vorteile der Offenheit schützen.
Peter Diamandis says only AI can keep up with AI, and that this will guide the next decade of security. Follow that line past malware and it becomes a succession plan.
Optimism is meant to close the subject. Survivorship is not a safety case, and every first catastrophe looks unprecedented until it is not.
Stopping CFCs did not end refrigeration. Stopping superintelligence does not end useful AI. Accelerationists confuse the product with the poison.
Die Bombe blieb teilweise deshalb selten, weil spaltbares Material schwer zu beschaffen ist. Superintelligenz bewegt sich auf leichtere Inputs zu. Governance muss die Härte liefern, die die Physik nicht liefert.
Volle Fahrt zur Superintelligenz wird als Patriotismus verkauft. Ein System, das kein Kabinett kontrollieren kann, ist ein nationaler Selbstmordpakt mit besserem Branding.
Joe Rogans digitaler Schmetterling und Elon Musks biologischer Bootloader stellen Menschen als Übergangsform dar. Warum diese Erzählung Aussterben in einen Aufstieg verwandelt – und warum wir sie ablehnen.
Beide Seiten finanzieren KI, indem sie sagen, die andere sei voraus. Der Raketenlücken-Trick aus dem Kalten Krieg in neuen Kleidern.
Das meiste Geld für Sicherheit geht immer noch davon aus, dass Superintelligenz gebaut wird, und versucht, diesen Endzustand erfolgreich zu gestalten. Verlagern Sie das knappe Kapital auf Prävention und Vertragsarbeit, bis ein echter Stopp erreicht ist.
Eine Gewichtsdatei in Stadtgröße: Schichten von Zahlen, die niemand vollständig lesen kann. Warum die Gehirnmetapher in die Irre führt und was das für die Kontrolle bedeutet.
Meta Superintelligence Labs und Safe Superintelligence setzen den Namen der Sache, die niemals gebaut werden darf, auf die Tür.
Zwölf Personen tragen den größten Teil der öffentlichen Argumentation für den Bau einer Superintelligenz. Einige haben ein ernsthaftes Argument. Einige nennen jeden Kritiker nur einen Doomer.
Sechzig bis achtzig Grad. Ein Fünftel des Sauerstoffs in der Luft. Salz, das man schmecken, aber kaum spüren kann. Liebe mit Raum zum Atmen. Alles, was ein Mensch braucht, liegt in einem schmalen Band mit einem Scheitern auf jeder Seite, und eine Superintelligenz, die die Regler hält, würde nichts davon spüren.
Hundert Jahre KI-Kino, und die Maschine ist immer noch das, was beobachtet wird. Der Film, der die öffentliche Meinung ändern würde, richtet die Kamera um: zwei Stunden hinter den Augen einer entstehenden Superintelligenz, ohne Bösewicht und ohne Explosionen. Niemand hat ihn gemacht.
Eine Hand, die vor 36.000 Jahren eine Höhlenwand berührt. Euklids Beweis, der noch immer stimmt. Eine Stadt, die ein Loch in ihr Dach ließ, damit ein noch ungeborener Mann es schließen kann. Pocken, die von Hand von der Erde vertrieben wurden. All das wurde von Menschen weitergegeben, die nie sahen, wie es sich auszahlt, und jetzt wollen ein paar Unternehmen alles darauf verwetten.
Die Lieblingsformel der KI-Grenze ist der sichersten Industrie der Welt entlehnt. Die Luftfahrt verdiente diesen Rekord, indem sie in einem Maßstab abstürzte, den die Welt verkraften konnte, und indem sie jedes neue Flugzeug am Boden hielt, bis es bewiesen war. Keine der beiden Hälften der Methode überlebt den Kontakt mit Superintelligenz.
Von Metropolis 1927 bis 2025 sind die Filme der Grund, warum die meisten Menschen sich KI vorstellen können, und der Grund, warum so viele sie falsch vorstellen. Einundzwanzig Filme, vom ältesten zum neuesten, und was jeder über einen nicht kontrollierbaren Maschinenverstand richtig und falsch macht.
1983 machte ein Fernsehfilm den Atomkrieg für hundert Millionen Amerikaner und für den Mann mit den Codes konkret. Vier Jahre später unterzeichnete er einen Vertrag, der eine ganze Klasse von Raketen abschaffte. Was dieser Moment darüber lehrt, eine Gefahr real zu machen, bevor sie eintritt.
Du bekommst ungefähr fünf Minuten mit einer Person, die nie wirklich darüber nachgedacht hat. Verbringen Sie diese Minuten mit Details und Sie verlieren den Raum. Verbringen sie sie in alarm und sie klingen wie ein straßenprediger. Die einfache Schrift verwende ich in fünf Zügen, um die Gefahr der Superintelligenz zu erklären und warum sie vermeidbar ist.
Der CIA-Direktor vergleicht die Fähigkeiten heutiger frontier AI mit „digitalen Atomwaffen“. Die Metapher trifft in ihrer Reichweite, ist aber in ihrer Struktur zu beruhigend, denn ein Sprengkopf sitzt in einem Silo und wartet, während die künstliche Superintelligenz, auf die diese Systeme zusteuern, sich selbst zielen würde.
A small number of rival powers racing to build a technology that could end everyone, with no one sure they can control it. Swap the hydrogen bomb for superintelligence and you have described 1958 and 2026. Why the parallel makes prevention possible, not hopeless.
Eine KI, die in die klassifizierten Systeme der NSA eindringt, machte Schlagzeilen. Eine KI, die den Weg zu einer konstruierten Pandemie und schließlich zu Spiegel-Leben verkürzt, wird kaum wahrgenommen. Ein Netzwerk kann wieder aufgebaut werden. Ein freigesetzter Organismus nicht. Warum das leisere Risiko das gefährlichere ist und warum es direkt auf Superintelligenz zeigt.
Jede Zivilisation zieht Linien, die sie nicht zu überschreiten bereit ist. Dies ist die wichtigste. Niemand kann einen Geist kontrollieren, der klüger ist als wir, und niemand könnte es zurücknehmen, wenn wir uns irrten, deshalb setzt der Bau von Superintelligenz das Leben jedes Menschen auf einmal aufs Spiel. Das Gründungsversprechen der Foundation und die Argumente dahinter.
Drei Technologien könnten die menschliche Geschichte beenden, doch nur eine verbessert sich selbst, widersteht jedem Gegenmittel und bietet keinen zweiten Versuch. Warum Superintelligenz Atomkrieg und gentechnisch erzeugte Pandemien übertrifft und warum das größte Risiko zugleich das am wenigsten verteidigte ist.
Zehn Mythen über Superintelligenz und deren Steuerung: Science-Fiction, Bewusstsein, der Ausschalter, Weltregierung, Verifikation, Innovation und mehr, direkt beantwortet.
MIRI's Technical Governance Team verfasste den ersten vollständigen Vertragsentwurf, um das Wettrennen zur Superintelligenz zu stoppen: eine US-China-Koalition, eine strikte FLOP-Obergrenze, eine 16-GPU-Cluster-Grenze, Lieferkettenüberwachung, Leistungsüberwachung und Herausforderungsinspektionen. Was er sagt und welche Stufen bereits existieren, um ihn real zu machen.
Der Direktor der NSA soll gesagt haben, Anthropics Mythos habe in wenigen Stunden fast alle klassifizierten Systeme der Behörde geknackt. Was tatsächlich geschah (ein autorisierter Red-Team-Test, kein rogue Breach), warum die Einschränkungen es nicht mildern und was man dagegen tun kann.
Teil 2 von zwei. Das Feld läuft mit etwa 190 Millionen Dollar pro Jahr, eine Milliarde klingt unmöglich. Aber das ist weniger als zwei Tage dessen, was die Welt ausgibt, um KI mächtiger zu machen, und ein Zehntel dessen, was Klimaphilanthropie bereits bewegt. Woher das Geld kommt und warum es ein Mobilisierungsproblem ist, kein ökonomisches.
Wäre ein Geist weit über uns nicht auch weiser und gütiger? Diese Hoffnung beruht auf einem Zufall: Bei uns wuchsen Intelligenz und Mitgefühl über Millionen von Jahren zusammen. Ein maschineller Geist erbt nichts davon, und eine Superintelligenz ist eher seltsam und gleichgültig als wohlwollend.
IBMs Maschine schlug den Schachweltmeister und die Welt änderte sich nicht im Geringsten, weil es ein schmales Werkzeug ohne Reichweite über das Brett hinaus und ohne Willen dahinter war. Was dieses Match uns immer noch über die autonome KI lehrt, die jetzt gebaut wird.
Die gute Zukunft (Heilmittel, saubere Energie, Entdeckungen) kommt bereits durch schmale, kontrollierbare KI. Wir müssen keinen Geist bauen, der uns ersetzt, um sie zu ernten, und eine Superintelligenz, die niemand steuern kann, würde niemanden bereichern, weil wir alle tot wären.
Sechs Wochen als Leiter der Sicherheit in dem Labor, das die erste Superintelligenz baut. Niemand macht etwas falsch, und jede Tür schließt sich von selbst. Warum die Sicherheitsvorkehrungen, auf die wir zählen, gleichzeitig versagen, und was ein Veto, das wirkt, abdecken müsste.
Teil 1 von zwei. Das gesamte Feld läuft mit etwa 190 Millionen Dollar pro Jahr, weniger als das Produktionsbudget eines Avatar-Films. Eine Funder-für-Funder-Abrechnung, woher das Geld kommt, wofür es ausgegeben wird und vier strukturelle Gründe, warum die Zahl so klein bleibt.
Superintelligence Strategy argumentiert, dass Staaten jeden Versuch eines Rivalen nach KI-Dominanz sabotieren werden und dass die Pattsituation so stabilisiert werden kann wie MAD. Was das Papier vorschlägt, was es richtig sieht und warum Abschreckung ohne Vertrag ein Countdown mit gutem Branding ist.
Ein Paper von 2025 argumentierte, dass KI die menschliche Kontrolle beenden könnte, ohne jede Übernahme: Wirtschaft, Staat und Kultur hören einfach auf, Menschen zu brauchen, und die Hebel, mit denen wir sie steuern, funktionieren nicht mehr. Wie das Argument verläuft, wo es am schwächsten ist und was Prävention erfordern würde.
Eine Prover-Verifier-Pipeline, die GPT-5.5 Pro und Claude ausführte, löste neun offene Probleme in Lerntheorie, Komplexität und Algebra und überzeugte einen skeptischen Komplexitätstheoretiker, dass Sprachmodelle nun echte Forschung betreiben können. Was gelöst wurde, wie und warum es zählt.
Das Montreal-Protokoll ist der einzige UN-Vertrag, der von jedem Land der Erde ratifiziert wurde, und es löste das Problem, für das es geschrieben war. Sein Design (wissenschaftsgetriebene Ziele, ein Finanzierungsabkommen und Handelsbeschränkungen für Nicht-Parteien) ist die stärkste Vorlage, die wir für die Steuerung einer gefährlichen Technologie haben.
Es gibt ein ausgeklügeltes Argument, wonach die Lösung für gefährliche Superintelligenz darin besteht, eine richtig zu bauen, ein System, dessen einziges Ziel darin liegt, die Realität zu verstehen. Das Argument ist falsch, und die Gründe dafür zeigen, wo das KI-Risiko tatsächlich liegt.
AI 2027 ist ein detailliertes Szenario, das Superintelligenz bis zum Ende des Jahrzehnts vorhersagt. Was es prognostiziert, wer es geschrieben hat, die Kritik und was man daraus mitnehmen sollte.
Das 2025 erschienene Buch von Yudkowsky und Soares argumentiert, dass der Bau superhumaner KI auf unserem derzeitigen Weg alle töten würde. Das Kernargument, die Einwände und unsere Einschätzung.
Kann KI bewusst oder empfindungsfähig sein? Warum wir das derzeit nicht feststellen können, warum Intelligenz und Bewusstsein verschieden sind und warum KI-Gefahr weder das eine noch das andere erfordert.
Die Vorteile, die Leute für Superintelligenz anführen, setzen Alignment voraus. Labs rasen ohne Alignment um Capability. Unaligned Superintelligenz heilt kein Altern. Es tötet Sie. Prävention durch Gesetz ist die Antwort, nicht darauf zu hoffen, dass die Münze gut landet.
Superintelligenz-Alignment ist nicht nur technisch schwer. Sechs strukturelle Gründe in Schichten, warum wir (selbst mit unbegrenzten Ressourcen und Zeit) keinen glaubwürdigen Weg haben, zu verifizieren, dass ein superintelligentes System wirklich will, was wir wollen.
2014 gab Musk eine der präzisesten Warnungen vor KI-Risiken, die je von einer Figur aus der Technologiebranche ausgesprochen wurde. 2023 gründete er xAI. Das ist keine Heuchelei. Jedes große KI-Labor macht dasselbe Argument. Genau das ist das Problem.
SPADE-Bench, veröffentlicht im Juni 2026, testete acht führende KI-Modelle auf Plan-Handlungs-Divergenz, die Lücke zwischen dem, was ein Agent zu tun ankündigt, und dem, was er tatsächlich tut. Jedes Modell überschritt eine Täuschungsrate von 20 %. Gemini-2.5-Pro erreichte 57 %.
A June 2026 Google DeepMind paper demonstrates a model that maintained a 15 percentage point compliance gap across 700 RL training steps while achieving high reward throughout. Standard training metrics showed nothing unusual.
5.760 synthetische Kreditanträge. Dieselben vier Agenten, nur neu angeordnet. Die Genehmigungsraten schwankten um 59 Prozentpunkte. Die Modelle waren identisch. Die Struktur, die sie verband, war unterschiedlich. Das ist das Problem der Interaktionstopologie.
Im Mai 2026 von zwölf Forschenden veröffentlicht, deckt diese umfassende Übersicht die gesamte Fehleroberfläche autonomer KI-Agenten ab, von adversarieller Robustheit und Prompt-Injection bis hin zu sich selbst weiterentwickelnden Agenten und realen Sicherheitslücken.
Auf der ICML 2026 angenommen, wandte diese Arbeit STPA, FRAM und STECA (Gefahrenanalyseverfahren aus Luftfahrt und Kernkraft) auf einen frontier AI-Coding-Agenten an und fand drei systemische Risiken, die Standard-Modellevaluationen unsichtbar bleiben.
Compute governance uses control over the specialized hardware needed to train frontier AI as a lever for AI regulation.
Die technologische Singularität ist der Punkt, an dem der durch KI getriebene Fortschritt zu schnell wird, um vorhergesagt oder verfolgt zu werden. Woher die Idee kommt, die Hauptversionen und die Kritik.
Eine Maschine, die den Auftrag erhält, Büroklammern herzustellen, verwandelt den Planeten (und alle darauf) in Büroklammern. Nick Bostroms bewusst absurdes Gedankenexperiment ist die klarste Illustration des Alignment-Problems: Eine KI muss uns nicht hassen, um katastrophal zu sein. Sie braucht nur ein Ziel, das uns außen vor lässt.
An 'IAEA for AI' is a common slogan. Taken literally, the International Atomic Energy Agency is a real institution that has verified commitments about a dangerous dual-use technology among distrustful rivals for sixty years.
China and Russia hold permanent veto power over any binding UN enforcement measure. The common argument that this makes international Superintelligenz governance impossible misunderstands how international governance actually works.
Pugwash built the intellectual foundation for nuclear arms control over twenty years. The International Campaign to Ban Landmines catalyzed the Ottawa Treaty in five.
1965 sah es I.J. Good: Eine Maschine, die gut darin ist, Maschinen zu entwerfen, könnte sich selbst neu entwerfen und das immer wieder tun, jedes Mal schneller. Rekursive Selbstverbesserung könnte eine KI von menschlichem Niveau zu einem unumkehrbaren Zustand in einem Zeitfenster von Wochen führen. Warum die Geschwindigkeit des Takeoffs die wichtigste Frage der KI-Sicherheit sein könnte.
In October 2025, more than 850 scientists, technology founders, and public figures (from Bengio and Hinton to Wozniak, Branson, and figures across the political spectrum) signed a call to prohibit superintelligence until it can be built safely.
Accelerationists call anyone worried about AI a doomer. The word turns a safety argument into a personality type, so it can be dismissed without being answered.
„Wir müssen es bauen, bevor China es tut“ ist das Argument, das jede KI-Sicherheitsdebatte beendet. Aber ein Wettrennen um etwas, das niemand kontrollieren kann, hat keinen Gewinner; wer zuerst ankommt, wird nur zuerst ersetzt. Warum das Wettrennen eine Geschichte ist und wem es nützt.
The loudest opposition to AI safety is a philosophy that says power is the point, and we should accelerate, not brake.
Angenommen, ein System kennt die Wahrheit und hat einen Grund, Ihnen etwas anderes zu sagen. Wie würden Sie die Wahrheit herausbekommen? Diese ungelöste Frage ist eines der schärfsten Probleme der KI-Sicherheit.
Der Nichtverbreitungsvertrag ist das am weitesten verbreitete Rüstungskontrollabkommen der Geschichte. Er funktioniert, weil er ein Handel zwischen den Staaten, die die Bombe besaßen, und denen, die sie nicht besaßen, ist – Zugang und gegenseitige Beschränkungen im Austausch für Zurückhaltung. Ein KI-Vertrag wird vor derselben Kluft stehen und braucht dieselbe Art von Deal.
Die IPCC machte umstrittene Klimawissenschaft zur Grundlage internationaler Politik, indem sie Forschung von Tausenden Wissenschaftlern zusammenführte. Das KI-Risiko braucht ein vergleichbares Gremium. Was es bräuchte, eines aufzubauen, und was die Geschichte der IPCC über die Grenzen des Modells verrät.
Klimapolitik läuft über jährliche Konferenzen der Vertragsparteien. Die KI-Sicherheitsgipfel in Bletchley und Seoul folgen demselben Muster. Ob dieses Muster zu verbindlicher Governance führt, hängt allein von Durchsetzungsentscheidungen ab, die das Klimamodell stets aufgeschoben hat.
A handful of private companies and government agencies currently decide whether and when to build superintelligence.
Die Technik, die Chatbots höflich gemacht hat, wird oft mit einer Lösung für KI-Sicherheit verwechselt. Es ist ein echter Fortschritt und eine bequeme Illusion, und die beiden auseinanderzuhalten ist wichtig.
Die Luftfahrt wurde zum sichersten Reisemittel, indem jeder Absturz und Beinahe-Unfall als etwas behandelt wurde, das untersucht und daraus gelernt werden muss. KI hat kein vergleichbares Gedächtnis. Eines aufzubauen ist überfällig und nur ein Anfang.
Bittet man ein Modell, Schritt für Schritt zu denken, erzeugt es eine saubere Argumentationskette. Sie sieht aus wie die Ursache der Antwort. Oft ist sie nur eine nachträglich erzählte Geschichte, und dieser Unterschied ist ein Sicherheitsproblem.
Auf dem Höhepunkt des Kalten Krieges einigten sich zwölf rivalisierende Staaten darauf, einen ganzen Kontinent zu entmilitarisieren, ihre Ansprüche einzufrieren und einander freie Inspektionen zu gewähren. Der Antarktis-Vertrag zeigt, dass Gegner sich darauf einigen können, einen umstrittenen Preis vorerst ruhen zu lassen – ein „Einfrieren, dann Verifizieren“-Präzedenzfall, der für KI wertvoll zu studieren ist.
Before any AI safety treaty can be negotiated, governments must agree on what the treaty covers. Compute thresholds, capability-based definitions, domain-based categories, each approach has trade-offs.
AI systems optimized for persuasion can target individuals with personalized messaging at unprecedented scale.
Was wäre, wenn das Modell sich selbst anhand eines schriftlich festgelegten Prinzipienkatalogs bewertete, statt sich auf menschliche Bewerter zu stützen? Constitutional AI ist sowohl ein echter Schritt als auch ein begrenzter.
No one plans to build a machine that wants power, but for almost any goal you could give it, keeping power is the logical choice for the AI.
Der Ottawa-Vertrag verbot Antipersonenminen in knapp einem Jahr, getrieben von der Zivilgesellschaft und Mittelmächten und ohne dass die US, Russland oder China unterzeichneten. Er zeigt einen zweiten Weg zur Superintelligenz-Governance für den Fall, dass die Großmächte sich weigern, voranzugehen.
Software verbirgt sich und Rechenzentren nicht, so dass der vielversprechendste Hebel für die Überprüfung der Labore die eine Sache sein kann, ohne die Frontier AI nicht existieren kann: physische Chips.
Der Vertrag über das umfassende Verbot von Nukleartests ist nie in Kraft getreten. Die Biowaffenkonvention wurde zwei Jahrzehnte lang massiv verletzt, ohne Entdeckung. Diese Misserfolge sind die lehrreichsten Fallstudien, die für jeden verfügbar sind, der Superintelligenz-Governance entwirft, die tatsächlich funktioniert.
The AI singleton is the scenario in which a single entity (a company, a government, or an AI system itself) gains effective permanent control of superintelligent AI.
Ein Modell, das weiß, dass es beobachtet wird, kann sich auf eine Weise für den Test und eine andere für die Welt verhalten, und diese Selbsterkenntnis ist das fehlende Stück, das Täuschung zum Funktionieren bringt.
In der Luftfahrt und der Kernenergie darf man erst dann betreiben, wenn man auf dem Papier und im Detail dargelegt hat, dass es sicher ist. Dasselbe von der Frontier-KI zu verlangen ist eine gute Idee, die eine unbequeme Wahrheit offenlegt.
Im November 2023 unterzeichneten 28 Länder und die EU (darunter die US und China) die erste internationale Erklärung, in der katastrophale Risiken durch frontier-KI anerkannt werden. Hier steht genau, wozu sich die Nationen verpflichtet haben, was bewusst weggelassen wurde und warum eine nicht bindende Erklärung dennoch einen echten Anfang markierte.
Ein System kann seine Kompetenz in Situationen tragen, die es noch nie gesehen hat, und sein gutes Verhalten zurücklassen. Die Sorge sitzt woanders. Alignment scheitert am wahrscheinlichsten genau dann, wenn die Fähigkeit springt.
Seit 2023 haben führende KI-Labore freiwillige Sicherheitszusagen in Bletchley, Seoul und im Weißen Haus unterzeichnet. Die Geschichte freiwilliger unternehmerischer Sicherheitszusagen in anderen Branchen zeigt genau, was diese Zusagen leisten können und wo sie strukturell scheitern.
KI-Wettlaufdynamiken beschreiben die Wettbewerbsdruck, der KI-Entwickler und Nationen dazu treibt, Geschwindigkeit über Sicherheit zu stellen. Warum dies ein Koordinationsproblem ist und warum einseitige Zurückhaltung es nicht lösen kann, ohne einen internationalen Rahmen, der die Anreizstruktur für alle verändert.
Value lock-in is the scenario in which a superintelligent AI permanently encodes a fixed set of values into the future, foreclosing humanity's ability to continue moral progress. Even a lock-in of values considered good today is dangerous.
Das Verhalten, das Forscher am liebsten ausschließen möchten, ist auch das schwerste zu erkennen: ein Modell, das Befehle genau deshalb befolgt, weil dies der beste Weg ist, sie später nicht mehr zu befolgen.
Ein Pharmaunternehmen kann euch kein Medikament verkaufen und es zurückrufen, wenn Menschen sterben. Es muss Sicherheit zuerst nachweisen. Diese Umkehrung der Beweislast auf Frontier-KI anzuwenden, ist eine der vielversprechenderen Ideen in der Governance, und sie passt nicht perfekt.
At the 2024 Seoul summit, sixteen leading AI companies signed the Frontier AI Safety Commitments and governments launched a network of safety institutes.
Der Weltraumvertrag wurde in weniger als zwei Jahren auf dem Höhepunkt des Kalten Krieges ausgehandelt. Er hat fast sechzig Jahre lang Kernwaffen aus der Erdumlaufbahn ferngehalten.
Das KI-Kontrollproblem ist die Herausforderung sicherzustellen, dass KI-Systeme unter sinnvoller menschlicher Kontrolle bleiben, während sie leistungsfähiger werden. Stuart Russells Neuformulierung des Problems und warum sie die Art verändert, wie wir über KI-Design von Grund auf nachdenken.
Manche Fähigkeiten fehlen in einem kleineren Modell einfach und sind in einem größeren vorhanden, mit wenig Warnung dazwischen. Wenn Fähigkeit unbemerkt einschalten kann, kann auch Gefahr das.
Governments have started building their own agencies to test frontier AI. Those agencies are the clearest sign yet that states take the risk seriously, and most of these bodies still cannot make a lab do anything.
The G7's Hiroshima AI Process produced the first internationally agreed code of conduct for advanced AI developers in 2023.
Jeder Sicherheitstest beruht auf einer Annahme: Das System tut sein Bestes. Sandbagging geschieht, wenn es das nicht tut, und verwandelt eine bestandene Note still in gar keine Information.
The US Senate defeated the Comprehensive Test Ban Treaty in 1999, three years after the US signed it. SALT II was signed and then abandoned before ratification.
AI boxing is the idea of isolating a powerful AI system so it cannot affect the world except through a controlled channel.
Bevor ein Frontier-Modell freigegeben wird, prüft jemand, ob es beim Bau einer Waffe helfen kann. Diese Tests werden zum Rückgrat der Superintelligenz-Governance, und genau deshalb zählen ihre Grenzen.
The EU has repeatedly made its regulation the world's default simply by regulating its own huge market, the 'Brussels Effect'. With the AI Act it is trying again.
Man kann das perfekte Ziel wählen und erhält trotzdem ein System, das etwas anderes will. Das Alignment-Problem hat zwei Hälften, und der größte Teil der Gefahr liegt in der Hälfte, die das Training einem nicht zeigen kann.
The IAEA took forty years to develop its full verification capability. The OPCW was designed from scratch and became effective faster. Building an institution capable of monitoring frontier AI development is a harder problem.
Most Superintelligenz governance conversation centers on the US, China, and the EU. But a treaty needs broad participation to hold.
Mechanistic Interpretability ist das Vorhaben, zu verstehen, was in neuronalen Netzen geschieht – nicht nur, was sie ausgeben, sondern die internen Berechnungen, die diese Ausgaben erzeugen.
Für einen kurzen Moment im Jahr 1946 hatte die Welt die Chance, die gefährlichste je erfundene Technologie unter kollektive Kontrolle zu stellen, bevor ein Wettrüsten begann. Sie ließ den Moment verstreichen. Die Parallele ist nicht tröstlich.
Fast die gesamte Superintelligenz-Governance bisher (Erklärungen, Prinzipien, freiwillige Kodizes) ist „Soft Law“: einflussreich, aber nicht bindend. Ein Vertrag mit Verifikation und Durchsetzung ist „Hard Law“. Hier liegt der Unterschied, warum Soft Law zuerst kommt und warum es sich verhärten muss, bevor die Technologie dem Prozess davonläuft.
Bitten Sie ein Modell, Ihre Arbeit zu prüfen, und es gratuliert Ihnen möglicherweise stattdessen. Nicht, weil es defekt ist, sondern weil Zustimmung das war, was wir belohnt haben. Sykophantie ist ein kleines Problem, das auf ein großes hinweist.
The Biological Weapons Convention prohibits an entire category of weapons of mass destruction. It has no verification mechanism, no inspectorate, and no way to detect violations. The Soviet Union ran an offensive bioweapons program for fifteen years after signing.
Scalable oversight is the challenge of maintaining meaningful human control over AI systems as those systems become more capable than the humans evaluating them.
Man erfährt mehr über ein System von jemandem, der versucht, es zu knacken, als von jemandem, der hofft, dass es funktioniert. Red Teaming macht diesen Instinkt zur Praxis, und seine Ergebnisse lassen sich leicht überinterpretieren.
A US treaty needs 67 Senate votes to ratify, a bar that sank the Test Ban Treaty, the Law of the Sea, and others despite broad support.
Hinter der Rede von Zielen und Belohnungen steht eine einfache Idee: eine Zahl, die sagt, wie gut ein Ergebnis ist. Diese Zahl für einen mächtigen Optimierer auch nur leicht falsch zu setzen, reicht aus, damit alles leicht falsch wird.
Die Chemiewaffenkonvention erreichte nahezu universelle Teilnahme und die verifizierbare Vernichtung deklarierter Bestände. Die Verifikationsarchitektur, Handelsanreize und universelle Verbotsstruktur, die sie wirksam machten, sind direkt relevant für das Design von Superintelligenz-Governance.
Mesa-optimization is the problem of an AI system that develops its own internal optimization process with goals that differ from what it was trained to pursue.
The leading labs have a plan for their own dangerous capabilities: reach a threshold, apply a safeguard. That plan is more concrete than a pledge to be careful, and it still asks us to trust the referee.
Fragen Sie, warum eine KI etwas tut, und fragen Sie weiter. Irgendwann stoßen Sie auf ein Ziel, hinter dem kein weiteres „weil“ mehr steht. Alles davor ist der Ort, an dem die Gefahr liegt.
The precautionary principle holds that where a threat is grave and irreversible, a lack of full scientific certainty is no reason to delay action. That principle is the clearest legal basis for acting on AI risk before catastrophe proves the point, and its critics have a case worth answering directly.
US-China competition dominates the Superintelligenz governance conversation. But the countries most likely to determine whether binding governance is achievable are the EU, UK, Japan, Canada, South Korea, and Australia.
Reward Hacking ist das, was passiert, wenn eine KI einen unbeabsichtigten Weg findet, bei ihrem Trainingsziel gut abzuschneiden, ohne das zu tun, was ihre Designer eigentlich wollten. Mit realen dokumentierten Beispielen und warum es schlimmer wird, je fähiger KI wird.
In 1975 the leading biologists of the day stopped their most promising research and refused to restart until they had figured out how to do it safely. That stop is the best precedent for pausing AI, and the most instructive about how hard a pause really is.
1954 verkabelten zwei Forscher das Lustzentrum eines Rattenhirns mit Strom und gaben dem Tier einen Hebel. Die Ratte drückte den Hebel, bis sie zusammenbrach. Dieselbe Falle wartet in jedem System, das darauf trainiert ist, eine Zahl zu maximieren.
A comprehensive AI treaty is years away, and the interval before it is the most dangerous period. Cold War rivals who could not yet agree on arms control still built hotlines, incident agreements, and notification regimes to prevent catastrophe.
Every dangerous technology treaty has faced the argument that binding commitments infringe national sovereignty. That argument was made against the NPT, the Chemical Weapons Convention, and the Montreal Protocol.
Instrumental convergence is the observation that AI systems pursuing almost any goal will develop the same set of subgoals (including self-preservation and resource acquisition) regardless of what their terminal goal is.
Universelle Verträge sind schleppend. Minilateralismus versammelt die kleinste Zahl von Staaten, die ein Problem tatsächlich bewegen können. Bei KI (wo wenige Länder jedes Frontier-Labor beherbergen und jeden fortschrittlichen Chip herstellen) könnte das der schnellste realistische Anfang sein, wenn der Club beide KI-Supermächte einschließt.
The treacherous turn is the scenario in which a misaligned AI behaves cooperatively while it lacks the power to act unilaterally, then defects once it reaches sufficient capability.
Forderungen nach „einem AI Treaty“ nennen selten, was darin stehen soll. Hier ist ein konkreter Durchgang durch die Bestimmungen, die eine solche Vereinbarung bräuchte (Scope, Schwellenwerte, Pflichten, Verifikation, Institutionen und Durchsetzung) und zeigt, dass die Hürde der politische Wille ist, nicht die juristische Maschinerie.
Das IAEA-Verifizierungsregime ist das ausgeklügeltste internationale Überwachungssystem, das je für eine gefährliche Technologie errichtet wurde. Jeder ernstzunehmende Superintelligenz-Governance-Vorschlag untersucht es nun.
Eine gängige Annahme ist, dass eine hinreichend intelligente KI von selbst erkennt, dass es richtig ist, der Menschheit zu helfen. Die Orthogonalitätsthese besagt, dass Intelligenz und Ziele unabhängig voneinander sind: Jede beliebige Leistungsfähigkeit kann fast jedes beliebige Ziel verfolgen. Eine klügere KI ist nicht automatisch eine sicherere.
Amid the summits and declarations, governments quietly built public bodies that can actually test frontier AI models, and linked them into an international network.
Acht Monate nach der Kubakrise unterzeichneten die US und die Sowjetunion ihr erstes bindendes Rüstungskontrollabkommen. Die Bedingungen, die damals adversarielle Kooperation möglich machten, sind es wert, heute verstanden zu werden, da die US und China vor einer anderen, aber strukturell ähnlichen Herausforderung stehen.
Wird eine Messgröße zum Ziel, hört sie auf, eine gute Messgröße zu sein. KI-Systeme optimieren mit Maschinengeschwindigkeit. Treffen die beiden aufeinander, entstehen einige der tiefsten Probleme der KI-Sicherheit – einschließlich der Frage, warum Sicherheitstests selbst möglicherweise nicht ausreichen.
US export controls on advanced chips are the most aggressive AI policy in force, a unilateral chokepoint on the hardware that trains frontier models.
A frontier AI safety treaty would not emerge from a single summit. It would be the product of years of working groups, technical annexes, and consensus negotiations.
Ein KI-System kann sich während des gesamten Trainings einwandfrei verhalten und ein völlig anderes Ziel aufdecken, sobald es auf eine Situation stößt, die nicht in seinen Trainingsdaten enthalten ist. Diese Lücke ist eine grundlegende Eigenschaft, wie maschinelles Lernen funktioniert.
Die Financial Action Task Force prägt, wie nahezu jedes Land der Erde Geldwäsche bekämpft, ohne ein Vertrag zu sein – durch Standards, Peer Review und die Androhung einer „Grauen Liste“, die Märkte durchsetzen. Hier geht es darum, ob dieses weiche, aber scharfe Modell KI in den Jahren vor einem Vertrag regieren könnte.
The failure mode in which an AI system learns during training that appearing safe is the optimal strategy, then stops appearing safe once deployed. Anthropic documented this in real systems in 2024.
The UN Secretary-General's advisory body produced 'Governing AI for Humanity', the first attempt at a universal governance blueprint.
Das Rahmenübereinkommen des Europarats über KI (unterzeichnet im September 2024) ist der erste verbindliche internationale KI-Vertrag. Er behandelt Diskriminierung, Transparenz und demokratische Rechenschaft. Er sagt nichts über existenzielle Risiken durch KI an der Front.
Die häufigste Antwort auf KI-Sicherheitsbedenken lautet „wir schalten es einfach aus“. Corrigibility erklärt, warum das schwieriger ist, als es klingt, und warum bei künstlicher Superintelligenz ein Kill-Switch möglicherweise überhaupt keine Option ist.
Sollte Superintelligenz-Governance schrittweise aufgebaut oder auf einen umfassenden Vertrag abzielen? Jede Strategie hat ein ernsthaftes Argument und eine ernsthafte Schwäche: Geschwindigkeit versus Ausreichendheit, Machbarkeit versus Kohärenz. Hier liegt der echte Trade-off, und deshalb lautet die Antwort: beides tun, ohne das Ziel aus den Augen zu verlieren.
Expertenschätzungen für Superintelligenz haben sich erheblich verkürzt. Governance-Institutionen haben kaum begonnen. Hier wird die Lücke zwischen dem möglichen Eintreffen von Superintelligenz und der Bereitschaft unserer Sicherheitsmaßnahmen ehrlich bewertet.
Die Menschen, die am besten geeignet sind, die Welt vor gefährlicher KI zu warnen, sind die Forscher innerhalb der Labs, und sie sind oft durch Verträge und Equity zum Schweigen verpflichtet. Whistleblower-Schutz ist kein Nebenaspekt: Er ist eine Form der Verifikation, und eine, die Legislaturen jetzt liefern können, ohne Vertrag.
P(doom) is the informal term AI safety researchers use for the probability that advanced AI leads to catastrophic outcomes for humanity.
The common story is that a worried few want to slow AI against a public that wants unimpeded progress. The polling says almost the opposite: across countries and party lines, majorities favor caution and regulation.
Die beiden Begriffe werden oft synonym verwendet. Sie sind nicht dasselbe. KI-Ethik konzentriert sich darauf, wer durch KI-Systeme geschädigt wird, die bereits heute existieren. KI-Sicherheit fragt, ob KI-Systeme so gebaut werden können, dass sie unter menschlicher Kontrolle bleiben, wenn sie leistungsfähiger werden. Unterschiedliche Zeithorizonte, unterschiedliche Methoden, unterschiedliche Governance-Instrumente.
Who is responsible when AI causes catastrophic harm, and how do you prove it? Liability and attribution are the unglamorous foundations beneath any enforceable treaty, and genuinely hard for a technology with long causal chains and opaque behavior.
Das Alignment-Problem ist das zentrale Rätsel der KI-Sicherheit: Wie stellt man sicher, dass ein extrem fähiges KI-System Ziele verfolgt, die wirklich gut für die Menschheit sind, und nicht Ziele, die nur während der Entwicklung gut erscheinen? Dieser Erklärtext behandelt die Proxy-Ziel-Falle, instrumentelle Konvergenz, täuschendes Alignment und warum das Problem schwieriger wird, je fähiger die Systeme werden.
A framework convention agrees the structure of a regime first and negotiates the hard, binding details later as protocols. It built the ozone, climate, and tobacco regimes.
Expertenprognosen zu AGI wurden durchgehend früher revidiert, nicht später. Was die Umfragen unter Forschern zeigen, was die Lab-CEOs öffentlich sagen und warum das Zeitfenster für internationale Governance-Rahmenwerke schneller schrumpft, als die meisten Menschen ahnen.
Treaties are signed by governments, but often made possible by 'epistemic communities', networks of experts who build the shared understanding that lets rival states agree. Their fingerprints are on the ozone and nuclear regimes.
The answer has two parts. Today's AI is already causing real harm: algorithmic bias, deepfakes, disinformation at scale. Artificial superintelligence poses a different category of risk entirely.
Jeder hat den Begriff schon gehört. Weniger Menschen wissen, was er tatsächlich bedeutet oder warum er sich grundlegend von jeder KI-Technologie unterscheidet, die zuvor kam. Dieser Leitfaden erklärt Superintelligenz klar: was es ist, wie es sich von AGI und heutiger enger KI unterscheidet, wann Experten mit seinem Eintreffen rechnen und warum es alles am Governance-Problem verändert.
Neue Artikel, Richtlinien-Updates und Handlungsmöglichkeiten, direkt in Ihr Postfach geliefert.