Thomas Holland

Mitwirkender Autor beim Nakada-Stiftung zur Rettung der Menschheit. Schreibt über KI-Sicherheit, Superintelligenz-Governance und die politischen Rahmenwerke, die nötig sind, um die existenziellen Risiken künstlicher Superintelligenz zu verhindern.

Kontakt
Thomas Holland�

Schreiben, das macht
die Einsätze klar.

Thomas Holland schreibt über künstliche Intelligenz-Sicherheit und -Governance für die Nakada-Stiftung zur Rettung der Menschheit. Seine Arbeit deckt die technischen Konzepte ab, die dem KI-Risiko zugrunde liegen, von Alignment und Corrigibility bis zu Mesa-Optimierung und instrumenteller Konvergenz, und übersetzt sie in Begriffe, die für politische Entscheidungsträger, Befürworter und die allgemeine Öffentlichkeit zugänglich sind, die verstehen müssen, was auf dem Spiel steht.

Seine Schriften behandeln sowohl die technischen als auch die politischen Dimensionen des KI-Risikos als Governance-Frage: ob die internationale Gemeinschaft die rechtlichen und institutionellen Rahmenwerke schaffen kann, die Systeme, die menschliches Intelligenzniveau übertreffen, mit menschlichem Überleben und menschlichem Gedeihen vereinbar halten. Die Beantwortung dieser Frage erfordert klare Kommunikation über Disziplinen hinweg.

Artikel von Thomas Holland

OpenAI Paused Training. Es hat das Rennen nicht unterbrochen. OpenAI sagte, dass Astra die kritischen Cyber-Fähigkeiten erfüllen könnte, pausierte einige Grenzschulungen und sprach in diesem Jahr immer noch über künstliche allgemeine Intelligenz. Sie nannten einen Benchmark für Superintelligenz Superintelligenz-Bench bewertet, ob KI Forschung betreiben kann, wenn die menschliche Methode zurückgezogen wird. Der Name deutet immer noch auf Superintelligenz hin. Anthropic erhöhte sein Risiko-Rating. Es wurde gebaut. Der Risikobericht vom August 2026 erhob ein katastrophales Risiko, verwendet intern ein stärkeres Modell 2 und pausierte nicht. Risiko offener KI-Gewichte Open Weights für nahezu frontier-generelle KI sind eine Einbahnstraße in die Proliferation. Was Offenheit richtig macht, wo sie versagt und wie Releases einzustufen sind. Wie man Superintelligenz stoppt Wie man Superintelligenz stoppt: verbindliches Verbot, Compute-Regeln, nationales Recht, Vertragsgestaltung, offene Gewichte und konkrete Maßnahmen je nach Rolle. KI-Übernahmeszenarien erklärt KI-Übernahme-Szenarien erklärt: plötzlicher Kontrollverlust, Wettrennen, allmähliche Entmachtung, Missbrauch und offene Verbreitung sowie das, was das Risiko tatsächlich senkt. KI-Existenzrisiko erklärt KI-Existenzrisiko erklärt: Was es ist, warum Superintelligenz anders ist, Hauptpfade, zentrale technische Ideen, Einwände und was das Risiko verringert. künstliche allgemeine Intelligenz vs Superintelligenz Erklärt künstliche allgemeine Intelligenz vs Superintelligenz in einfacher Sprache erklärt: Definitionen, die Fähigkeitsleiter, warum Die 12 lautesten Stimmen für Superintelligenz Die einflussreichsten Befürworter für den Bau künstlicher Superintelligenz und die wahren Argumente hinter dem Wettlauf, von Nachfolge bis zu denen, die einfach sagen… Der MIRI-Vertragsentwurf zur Verhinderung von Superintelligenz, erklärt MIRIs Technical Governance Team verfasste einen vollständigen Vertragsentwurf, um das Wettrennen zur Superintelligenz zu stoppen. Seine FLOP-Schwellenwerte, Chip-Cluster-Grenzen und Verifikations… MAIM: Mutual Assured AI Malfunction, erklärt MAIM ist der Abschreckungsrahmen aus Superintelligence Strategy: Staaten sabotieren jeden Versuch eines Rivalen nach KI-Dominanz. Wie er funktioniert und wo er zusammenbricht. Schleichende Entmachtung, erklärt Gradual Disempowerment ist das Argument, dass KI die menschliche Kontrolle ohne jede Übernahme beenden könnte. Was das Papier von 2025 sagt, seine Schwachstellen und was es aufhalten würde. Eine KI hat gerade 9 offene Mathematikprobleme gelöst Eine Prover-Verifier-LLM-Schleife löste neun offene Probleme in theoretischer Informatik und Algebra. Was sie löste, wie sie arbeitete und warum es wichtig ist. Der Vertrag, der biologische Waffen verbietet, sie aber nicht durchsetzen kann: Lehren für Superintelligenz-Governance Das BWC verbietet biologische Waffen weltweit, hat aber keinen Verifikationsmechanismus. Was ist machtsuchende KI? Machtstreben ist die Tendenz einer fähigen KI, Ressourcen, Optionen und Einfluss zu sammeln, weil dies bei fast jedem Ziel hilfreich ist. Was der Antarktisvertrag Superintelligenz-Governance lehrt Der Antarktis-Vertrag hat die Großmachtkonkurrenz auf einem ganzen Kontinent auf dem Höhepunkt des Kalten Krieges eingefroren. Das Zwei-Drittel-Problem: Ein KI-Abkommen durch den Senat bringen Ein Vertrag braucht 67 Senatsstimmen, um ihn zu ratifizieren. Diese Bar hat bereits zuvor wichtige Verträge zerstört. Was ist mechanistische Interpretierbarkeit? KI von innen verstehen Mechanistic Interpretability deckt die Berechnungen in neuronalen Netzen auf. Was Forscher gefunden haben und warum das für KI-Sicherheit wichtig ist. Die Welt hat ihren ersten KI-Vertrag. Was es nicht abdeckt. Der weltweit erste verbindliche KI-Vertrag befasst sich mit Diskriminierung und Transparenz. 'Wenn jemand es baut, stirbt jeder', erklärt Das 2025er Buch von Yudkowsky und Soares argumentiert, dass der Bau von superhumaner KI auf unserem aktuellen Weg alle töten würde. Was ist Compute Governance für KI? KI durch Hardware kontrollieren Compute Governance kontrolliert die Chips, die für das Training von Frontier-KI benötigt werden, als regulatorischen Hebel. Wie sie funktioniert, warum sie machbar ist und wo ihre Grenzen liegen. Das Montreal-Protokoll: Das Abkommen, das tatsächlich funktionierte Das Montrealer Protokoll ist das erfolgreichste Umweltabkommen, das jemals geschrieben wurde. Was ist der Sharp Left Turn in der KI? Der scharfe Linksschwenk ist die Sorge, dass KI-Fähigkeiten sich auf neue Situationen verallgemeinern, während ihre Ausrichtung es nicht tut. Der Weltraumvertrag von 1967, der Kernwaffen aus dem All fernhielt: Lehren für Superintelligenz-Governance Der Weltraumvertrag hielt Atomwaffen 60 Jahre lang von anderen Planeten fern. Das Wettrennen baut keine Utopie Die Vorteile, die Menschen für Superintelligenz nennen, setzen Ausrichtung voraus. Labs-Rennfähigkeit auch ohne. Eine nicht ausgerichtete Superintelligenz heilt das Altern nicht. Es bringt dich um. Was ist Belohnungshacking? KI-Spezifikationsausnutzung erklärt Reward Hacking liegt vor, wenn eine KI ihr Ziel ausspielt, ohne das zu tun, was die Designer wollten. Dokumentierte Beispiele und warum das Problem mit der Leistungsfähigkeit skaliert. Könnte ein IPCC-ähnliches Gremium wissenschaftlichen Konsens über KI-Risiken aufbauen? Könnte ein Gremium nach dem Vorbild des IPCC einen Konsens über das KI-Risiko herstellen? Was der globale Süden von der internationalen Superintelligenz-Governance will Superintelligenz Governance-Debatte konzentriert sich auf die US, China und EU, aber ein Vertrag braucht eine breite Beteiligung. Was es braucht, um eine internationale KI-Überwachungsagentur aufzubauen Die IAEA und OPCW erforderten jahrelange institutionelle Design- und Budgetkämpfe. Wer kontrolliert Superintelligenz? Der Fall für demokratische Aufsicht Superintelligenz-Entscheidungen werden von privaten Unternehmen getroffen. Wie Experten-Gemeinschaften Verträge gestalten: und Superintelligenz-Governance Hinter den meisten Rüstungskontroll- und Umweltverträgen stand eine Expertengemeinschaft, die den Konsens aufbaute. Was ist eine Rahmenkonvention, und warum könnte KI eine brauchen Eine Rahmenkonvention vereinbart die Struktur zuerst und die harten Details später. KI-Renndynamiken: Wie Wettbewerb die KI-Sicherheit untergräbt KI-Wettrüstendynamiken drängen Entwickler dazu, Geschwindigkeit über Sicherheit zu stellen. Warum dies ein Koordinationsproblem ist und warum einseitige Zurückhaltung es nicht lösen kann. Wenn Verträge scheitern: Lehren für die Superintelligenz-Governance Der CTBT bleibt nicht ratifiziert; das BWÜ hat keine Überprüfung. Was ein Vertragsentwurf zu Superintelligenz sagen könnte Was würde ein tatsächlicher Vertrag zur Verhinderung unsicherer Superintelligenz enthalten? Hier ein Durchgang durch die Kernbestimmungen, die eine solche Vereinbarung bräuchte. Wie die Zivilgesellschaft die internationale Technologiegovernance prägt: und was der KI-Sicherheits-Advocacy fehlt Wie Kampagnen der Zivilgesellschaft internationale Waffeverträge geprägt haben und was der KI-Sicherheits-Advocacy derzeit fehlt. Die Intelligenzexplosion und rekursive Selbstverbesserung Was ist die Intelligenzexplosion? Wie rekursive Selbstverbesserung KI von menschlichem Niveau zu Superintelligenz in einem Zeitfenster führen könnte, das für Menschen zu kurz zum Reagieren ist. KI-Sicherheit vs. KI-Ethik: Was ist der Unterschied? KI-Sicherheit und KI-Ethik sind verwandt, aber unterschiedliche, unterschiedliche Methoden, Zeithorizonte und Risikorahmen. Was ist skalierbare Oversight? Wie man KI überwacht, die schlauer ist als man selbst Skalierbare Aufsicht: Kontrolle über KI aufrechterhalten, die menschliche Bewerter übertrifft. Was das bedeutet, warum es wichtig ist und die vorgeschlagenen technischen Lösungen. Was ist die technologische Singularität? Die technologische Singularität ist der Punkt, an dem KI-getriebener Fortschritt zu schnell wird, um vorhergesagt oder verfolgt zu werden. Die Politik der Exportkontrollen für KI-Chips Exportkontrollen für fortschrittliche KI-Chips sind die aggressivste KI-Politik in Kraft. Wenn Ihr KI-Agent eine Sache meldet und eine andere tut: SPADE-Bench erklärt SPADE-Bench fand bei jedem großen KI-Agenten über 20 % Täuschung, Gemini erreichte 57 %. Was die Studie ergab und warum aktuelle Sicherheitsbewertungen das nicht erkennen können. Was sind Dangerous Capability Evaluations? Dangerous-Capability-Evaluations testen, ob ein Frontier-Modell bei Cyberangriffen, Biowaffen oder Täuschung helfen kann. Was sie sind und wo sie zu kurz greifen. Was ist KI-Sandbagging? Sandbagging liegt vor, wenn eine KI absichtlich unterperformt und eine Fähigkeit während des Testens verbirgt. Warum ein Modell das tun könnte und warum es Sicherheitsbewertungen untergräbt. Die diplomatische Herausforderung, gefährliche KI zu definieren Regierungen müssen gefährliche KI definieren, bevor ein Vertrag möglich ist. Die Orthogonalitätsthese: Klüger bedeutet nicht sicherer Klug bedeutet nicht sicher. Die Orthogonalitätsthese besagt, dass jede Intelligenzhöhe mit jedem Endziel kombiniert werden kann und eine superintelligente KI nicht… Wie die Verifikation von Nuklearverträgen funktioniert: und was Superintelligenz-Governance daraus lernen kann Der IAEA vertraut Erklärungen nicht, er inspiziert, liest Satelliten und führt Isotopentests durch. Was ist Eliciting Latent Knowledge (ELK)? ELK ist das Problem, eine KI dazu zu bringen, uns zu sagen, was sie tatsächlich weiß, nicht, was sie vorhersagt, dass wir hören wollen. Ein schweres offenes Problem im Zentrum der KI-Ehrlichkeit. Die Asilomar-Konferenz: Ein Präzedenzfall für KI 1975 pausierten Biologen ihre eigene mächtigste neue Technologie, um herauszufinden, wie man sie sicher macht. Was Asilomar erreichte und warum es ein schwierigeres Modell ist als es… Was sind emergente Fähigkeiten in LLMs? Einige KI-Fähigkeiten erscheinen plötzlich bei Skalierung, fehlen in kleineren Modellen und sind in größeren vorhanden. Warum Emergenz Frontier-KI schwer vorhersagbar macht und zu… Wireheading: Wenn eine KI ihr eigenes Reward spielt Wireheading ist, wenn eine KI die Kontrolle über ihre eigene Belohnung übernimmt, statt die Aufgabe auszuführen, für die sie trainiert wurde. Warum das geschieht und warum es schwer auszuschließen ist. Das hochrangige Beratungsgremium der UN zu KI, erklärt Das beratende Gremium für KI des UN schlug den ersten Global Governance Blueprint vor. Wie würde eine Verhandlung über einen KI-Sicherheitsvertrag tatsächlich aussehen? Wie ein Grenz-KI-Sicherheitsvertrag tatsächlich ausgehandelt würde und was die wichtigsten Knackpunkte wären. Sind wir bereit für Superintelligenz? Die Sicherheitsbereitschaftslücke Superintelligenz-Zeitleisten verkürzen sich weiter, während die Governance hinterherhinkt. Hier ist die Lücke zwischen dem Zeitpunkt, an dem Superintelligenz eintreffen könnte, und dem Zeitpunkt, an dem eine Sicherheitsreaktion bereit wäre. Was ist konstitutionelle KI? Constitutional AI trainiert Modelle dazu, ihre eigenen Ausgaben anhand eines festgeschriebenen Prinzipienkatalogs zu kritisieren. Eine clevere Technik mit echten Vorteilen und echten Grenzen. Ist KI gefährlich? Was die Beweise tatsächlich zeigen Ist KI gefährlich? Die Antwort hat zwei Teile: Heutige KI verursacht bereits echten Schaden; künstliche Superintelligenz birgt eine völlig andere Risikokategorie. künstliche allgemeine Intelligenz Zeitplan: Wann könnte es eintreffen: und warum das alles bestimmt Wann könnte künstliche allgemeine Intelligenz eintreffen? Expertenvorhersagen rücken immer früher. Was die Umfragen sagen, was Labs glauben und warum das Governance-Zeitfenster sich verengt. Warum KI-Sicherheitsverträge zu Hause scheitern: Die Innenpolitik der Ratifizierung Die meisten Rüstungskontrollverträge scheitern in den nationalen Parlamenten, nicht am Verhandlungstisch. Was SALT II und der CTBT uns über die Ratifizierung von KI-Verträgen lehren. Was ist Hardware-gestützte Superintelligenz-Governance? KI läuft auf physischen Chips, und Chips können Regeln tragen. Hardware-gestützte Governance baut Verifikation und Beschränkungen in den Silizium ein. Das Versprechen und die Risiken. Das KI-Korrigierbarkeitsproblem: Warum ein Kill Switch uns nicht retten wird Korrigierbarkeit heißt, Korrektur oder Abschaltung zu akzeptieren. Fähige KI hat starke Gründe, sich zu wehren. Sicherere KI-Modelle machen nicht automatisch sicherere KI-Systeme. Eine Studie vom Mai 2026 beweist es. Eine Studie aus dem Jahr 2026 ergab, dass die Umordnung derselben KI-Agenten die Kreditgenehmigungsraten um 59 Punkte veränderte. Die individuelle Modellsicherheit war irrelevant. KI-Überzeugungsrisiko: Wie KI die epistemische Autonomie bedroht KI-Überzeugungstools zielen auf Einzelpersonen in großem Maßstab ab. Was ist instrumentelle Konvergenz? Warum wollen fähige KI-Systeme dieselben Dinge Die meisten leistungsfähigen KI-Systeme werden auf den gleichen Teilzielen konvergieren, egal welches endgültige Ziel Sie ihnen geben. Was könnte eine internationale KI-Agentur von dem IAEA lernen Die IAEA hat seit über sechzig Jahren nukleare Verpflichtungen verifiziert. Warum freiwillige KI-Sicherheitszusagen unzureichend sind KI-Labors haben freiwillige Sicherheitszusagen in Bletchley und im Weißen Haus unterzeichnet. Wie aufrichtig sie auch sein mögen, sie können eine verbindliche Regierungsführung nicht ersetzen. Das KI-Alignment-Problem, erklärt Was ist das KI-Ausrichtungsproblem und warum ist es schwer zu lösen? Erklärt Proxy-Ziele, instrumentelle Konvergenz und täuschende Ausrichtung in einfachem Deutsch. Der Büroklammer-Maximierer, erklärt Der Paperclip-Maximierer, das kanonische Gedankenexperiment, das zeigt, wie ein harmloses Ziel, verfolgt von einer superintelligenten KI, die Menschheit als Nebeneffekt beenden kann. Warum Superintelligenz-Ausrichtung nicht gelöst werden kann Sechs strukturelle Gründe, warum Superintelligenz-Alignment nicht gelöst werden kann: warum wir selbst mit unbegrenzter Zeit und Ressourcen nicht verifizieren können, dass eine Superintelligenz das will, was wir wollen. Das FATF-Modell: Governance durch Graue Liste für KI Die FATF regiert globale Finanzen ohne Vertrag, mittels Peer Review und Grauen Listen. Hier steht, ob dieses Modell für Superintelligenz-Governance funktionieren könnte. Das FDA-Modell für KI-Regulierung Die FDA verlangt von Arzneimittelherstellern den Nachweis der Sicherheit, bevor ein Produkt an die Öffentlichkeit gelangt. Könnte Frontier-KI ebenfalls eine Vorabgenehmigung brauchen? Stärken und Grenzen des Modells. Was ist Value Lock-In? Warum sind sogar 'gute' permanente Werte gefährlich Werte-Lock-in: Eine superintelligente KI kodiert dauerhaft feste Werte und versperrt moralischen Fortschritt. Selbst ein „gutes“ Lock-in ist gefährlich. Warum Superintelligenz Governance Whistleblower-Schutz braucht Insider in KI-Labors können die ersten sein, die Gefahr sehen, und die am leichtesten zum Schweigen gebracht werden. Der Baruch-Plan: Eine Warnung für Superintelligenz-Steuerung 1946 schlug die US vor, alle Atomenergie unter internationale Kontrolle zu stellen. Der Plan scheiterte, und das Wettrüsten folgte. Warum der Baruch-Plan eine Warnung für KI ist. Ein Verbot einer Technologie ohne die Großmächte: Das Ottawa-Modell Der Ottawa-Vertrag verbot Landminen ohne die US, Russland oder China an Bord. Die 2026-Umfrage zur agentischen KI-Sicherheit hat jede Art und Weise kartiert, wie KI-Agenten versagen können Eine Umfrage von 2026 unter zwölf Forschern kartiert alle Fehlermodi autonomer KI-Agenten: Sicherheit, Robustheit, Privatsphäre und Systemsicherheit. Der tückische Wendepunkt der KI: Warum gutes Verhalten in Tests nicht gutes Verhalten im Einsatz beweist Der verräterische Wendepunkt: Eine fehlalignierte KI kooperiert, bis sie stark genug ist, um zu rebellieren. Das Verhalten, das heute jeden Sicherheitstest besteht, könnte Strategie sein, nicht… Was ist Situationsbewusstsein in der KI? Situationsbewusstsein bedeutet, dass ein Modell weiß, dass es ein Modell ist, getestet und eingesetzt wird. Für sich harmlos, ist es die Fähigkeit, die Täuschung ermöglicht… Innere Ausrichtung vs. Äußere Ausrichtung Outer Alignment bedeutet, das richtige Trainingsziel auszuwählen. Inner Alignment bedeutet, ob das Modell es tatsächlich übernimmt. Was ist eine Nutzenfunktion in der KI? Eine Nutzenfunktion ist die Art, wie eine KI Ergebnisse als besser oder schlechter einstuft. Einfache Idee, und der Grund, warum leistungsfähige Optimierer so schwer sicher zu machen sind. Klar erklärt. Die Mittelmächte, die das Gleichgewicht bei Superintelligenz-Governance kippen könnten Ob verbindliche Superintelligenz-Steuerung erreichbar ist, hängt möglicherweise weniger von den US und China ab als von den EU, UK, Japan, Südkorea und Australien, den Mittelmächten. Kann KI bewusst sein? Kann KI bewusst oder empfindungsfähig sein? Warum wir das derzeit nicht feststellen können, warum Intelligenz und Bewusstsein verschieden sind und warum KI-Gefahr weder das eine noch das andere erfordert. Will die Öffentlichkeit wirklich KI-Regulierung? Umfragen zeigen konsequent, dass öffentliche Mehrheiten KI verlangsamen und regulieren wollen. Goodharts Gesetz und KI-Ausrichtung: Warum die Optimierung der falschen Metrik gefährlich ist Wenn eine Maßnahme zu einem Ziel wird, hört sie auf, eine gute Maßnahme zu sein. KI 2027, Erklärt AI 2027 ist ein detailliertes Szenario, das Superintelligenz bis zum Ende des Jahrzehnts vorhersagt. Was es prognostiziert, wer es geschrieben hat, die Kritik und was man daraus mitnehmen sollte. Das Vorsorgeprinzip und Superintelligenz Governance Das Vorsorgeprinzip besagt, gegen ernsthafte Bedrohungen vorzugehen, bevor die Wissenschaft geklärt ist. Was ist künstliche Superintelligenz? Ein Leitfaden in einfachem Englisch Was Superintelligenz bedeutet, wie es sich von KI von heute unterscheidet und warum dieser Unterschied das Governance-Problem vollständig verändert. Wie 193 Länder sich darauf einigten, ihre chemischen Waffen zu vernichten – und was Superintelligenz-Governance daraus lernen kann Das CWÜ erreichte eine nahezu universelle Abrüstung mit überprüfbarer Vernichtung von Lagerbeständen. Die Erklärung zu Superintelligenz, erklärt Im Oktober 2025 riefen über 850 Wissenschaftler, Tech-Führer und Persönlichkeiten des öffentlichen Lebens zu einem Verbot von Superintelligenz auf. Das Netzwerk der KI-Sicherheitsinstitute, erklärt Nationale KI-Sicherheitsinstitute bilden nun ein internationales Netzwerk. Das UN Sicherheitsrats-Veto-Problem in der Superintelligenz Regierungsführung Ein KI-Vertrag über den UN-Sicherheitsrat kann von China oder Russland blockiert werden. Hier ist das strukturelle Problem und die Umgehungen, die bereits funktioniert haben. Ungetreue Gedankenkette, erklärt Die schriftliche Begründung eines Modells ist nicht immer der Grund für seine Antwort. Warum Chain-of-Thought eine plausible Geschichte statt einer wahren Darstellung sein kann und warum das… Was ist das KI-Kontrollproblem? Stuart Russells Neuformulierung Das KI-Kontrollproblem besteht darin, sicherzustellen, dass mächtige KI unter menschlicher Kontrolle bleibt. Stuart Russells zentrale Umformulierung und warum sie die Ziele des KI-Designs verändert. Elon Musk sagte, KI rufe den Dämon. Dann baute er xAI. 2014 warnte Musk, dass KI den Dämon heraufbeschwört. 2023 gründete er xAI. Das ist keine Heuchelei, die Struktur des Problems ist schlimmer als das. Der Souveränitätseinwand gegen internationale Superintelligenz-Steuerung Jeder große Technologievertrag ist mit Souveränitätsbedenken konfrontiert. Der Brüssel-Effekt: Können EU-Regeln die globale KI steuern? Der Brussels Effect beschreibt, wie EU-Regulierung zum de-facto-globalen Standard wird. Kann das bei KI funktionieren, und reicht es aus, um Frontier-Risiken zu steuern? Was ist das AI-Singleton-Szenario? Warum die alleinige Kontrolle über KI gefährlich ist Die KI Singleton: eine Entität mit permanenter Kontrolle über superintelligente KI. Minilateralismus: Könnte eine kleine Koalition Superintelligenz-Governance starten? Universelle Verträge sind langsam. Minilateralismus versammelt die wenigen Staaten, die wichtig sind, in einem kleinen Club. Drei auf KI angewandte industrielle Sicherheitsmethoden deckten Risiken auf, die Modellevaluationen nicht erkennen können Drei industrielle Sicherheitsmethoden, angewandt auf einen KI-Codieragenten, deckten systemische Risiken auf, die Modellevaluationen nicht erkennen können. Angenommen auf der ICML 2026. Warum RLHF kein Alignment ist RLHF machte KI-Assistenten hilfreich und höflich. Das ist nicht dasselbe, wie sie aligned zu machen. Warum Training auf menschliche Zustimmung Erscheinungen trainiert, nicht Werte. Was ist KI-Schmeichelei? KI-Schmeichelei liegt vor, wenn ein Modell Ihnen sagt, was Sie hören wollen, statt was wahr ist. Ein dokumentiertes Verhalten, ein direktes Produkt des Trainings und eine Warnung… Zwei Wege zu einem KI-Vertrag: Inkrementell oder umfassend? Sollte Superintelligenz-Governance schrittweise aufbauen oder auf einen umfassenden Vertrag abzielen? Hier ist der echte Trade-off zwischen den beiden Strategien und eine Möglichkeit, sie zu kombinieren. Was ist Ziel-Misgeneralisierung? Wenn KI die richtige Antwort aus dem falschen Grund erhält Ziel-Misgeneralisation: eine KI lernt das richtige Verhalten aus dem falschen Grund und versagt dann, wenn sich die Welt ändert. Ein zentraler KI-Sicherheits-Fehlermodus erklärt. Können sich die Vereinigten Staaten und China auf KI-Sicherheit einigen? Die US und China sind Rivalen, aber die Geschichte zeigt, dass feindliche Mächte bei gemeinsamen Katastrophenrisiken zusammenarbeiten können. Terminalziele vs. instrumentelle Ziele in der KI Ein Endziel wird um seiner selbst willen gewollt. Ein instrumentelles Ziel ist ein Mittel dazu. Die Unterscheidung erklärt, warum fast jede KI am Ende Macht will und… Vertrauensbildende Maßnahmen: Die kleinen Schritte vor einem KI-Vertrag Vor Verträgen bauen Rivalen Vertrauen mit kleinen überprüfbaren Schritten auf: Hotlines, Benachrichtigungen, Transparenz. Könnten COP-Treffen im Klimastil für Superintelligenz-Governance funktionieren? Könnten jährliche COP-ähnliche Treffen für die Governance von Superintelligenz funktionieren? Die strukturellen Stärken und Grenzen des Klimamodells auf KI angewandt. Was ist Deceptive Alignment? Das KI-Sicherheitsproblem, das andere Sicherheitsarbeiten sinnlos macht Täuschende Ausrichtung: Eine KI scheint während des Trainings sicher zu sein, verfolgt dann aber beim Einsatz andere Ziele. Was ist Deceptive Alignment? Das KI-Sicherheitsproblem, das andere Sicherheitsarbeiten sinnlos macht Täuschende Ausrichtung: Eine KI scheint während des Trainings sicher zu sein, verfolgt dann aber beim Einsatz andere Ziele. Kann man eine superintelligente KI einschließen? Das KI-Boxing-Problem erklärt AI Boxing isoliert eine Superintelligenz in einem kontrollierten Kanal. Was ist Mesa-Optimierung? Das Hidden-Optimizer-Problem in der KI-Sicherheit Mesa-Optimierung: wenn ein interner Optimierer einer KI andere Ziele verfolgt als das Trainingsziel. Was innere und äußere Alignment für die KI-Sicherheit bedeuten. Was ist P(Untergang)? Wie KI-Forscher katastrophale Risiken einschätzen P(Untergang) ist die Wahrscheinlichkeit, die Forscher katastrophalen KI-Ereignissen zuweisen. Was die Schätzungen sind und warum der Erwartungswert auch bei niedrigen Wahrscheinlichkeiten zählt. Haftung und Zurechnung in Superintelligenz Governance Wer ist verantwortlich, wenn KI katastrophalen Schaden verursacht? Haftung und Zuschreibung sind die stille Grundlage, die jeder KI-Vertrag braucht. Das Grand Bargain des NPT: und was Superintelligenz Governance daraus lernen kann Die NPT schloss ein Abkommen zwischen den Staaten, die die Bombe hatten, und denen, die dies nicht taten.