Thomas Holland

Auteur contributeur au Fondation Nakada pour Sauver l'Humanité. Écrit sur la sécurité de l'IA, la gouvernance superintelligence et les cadres politiques nécessaires pour prévenir les risques existentiels de la superintelligence artificielle.

Contact
Thomas Holland

Des écrits qui font
les enjeux clairs.

Thomas Holland écrit sur la sécurité et la gouvernance de l’intelligence artificielle pour Fondation Nakada pour Sauver l'Humanité. Ses travaux couvrent les concepts techniques qui sous-tendent le risque lié à l’IA, de l’alignement et de la corrigibility à la méso-optimisation et à la convergence instrumentale, et les traduisent en termes accessibles aux décideurs, aux défenseurs et au grand public qui ont besoin de comprendre les enjeux.

Ses écrits abordent à la fois les dimensions techniques et politiques du risque lié à l'IA en tant que question de gouvernance : la communauté internationale peut-elle construire les cadres juridiques et institutionnels qui maintiennent les systèmes dépassant l'intelligence humaine en compatibilité avec la survie et l'épanouissement humains. Répondre à cette question exige une communication claire entre disciplines.

Articles par Thomas Holland

OpenAI Paused Training. Ça n'a pas arrêté la course. OpenAI a déclaré qu'Astra pourrait rencontrer la cybercapacité critique, a interrompu une formation à la frontière, et a encore parlé de "intelligence artificielle générale" cette année. Ils ont nommé un repère pour la superintelligence superintelligence-Bench détermine si l'IA peut mener la recherche comme méthode humaine est retiré. Le nom pointe toujours à la superintelligence. Le taux de risque a augmenté. Il a gardé le bâtiment. Le Rapport sur les risques d'août 2026 de la société -Anthropic-H a soulevé une étiquette à risque catastrophique, utilise un modèle 2 plus solide à l'interne, et n'a pas interrompu. Risque des poids d'IA open source Les poids ouverts pour l'IA générale proche de la frontière sont une porte de prolifération à sens unique. Ce que l'ouverture fait bien, où elle échoue, et comment noter les versions. Comment arrêter la superintelligence Comment arrêter la superintelligence : interdiction contraignante, règles de calcul, droit national, conception de traités, poids ouverts et actions concrètes par rôle. Scénarios de prise de contrôle par l'IA expliqués Scénarios de prise de contrôle par l’IA expliqués : perte soudaine de contrôle, courses, dépossession progressive, mésusage et prolifération ouverte, plus ce qui réduit vraiment le risque. L'IA et le risque existentiel expliqués Risque existentiel lié à l’IA expliqué : ce qu’il est, pourquoi la superintelligence change la donne, principaux scénarios, idées techniques clés, objections et ce qui réduit le risque. intelligence artificielle générale vs superintelligence Expliqué intelligence artificielle générale vs superintelligence expliqué en langage clair : définitions, l'échelle des capacités, pourquoi Les 12 voix les plus bruyantes pour la superintelligence Les défenseurs les plus influents de la construction d'une superintelligence artificielle, et les vrais arguments derrière la course, de la succession à ceux qui disent simplement… Le projet de traité MIRI pour prévenir la superintelligence, expliqué L’équipe Gouvernance technique de MIRI a rédigé un projet complet de traité visant à arrêter la course à la superintelligence. Ses seuils de FLOP, ses limites sur les grappes de puces et ses mécanismes de vérification… MAIM : Dysfonctionnement mutuel assuré de l'IA, expliqué Le MAIM est le cadre de dissuasion issu de Superintelligence Strategy : les États sabotent toute tentative rivale de domination par l'IA. Comment cela fonctionne et où cela échoue. Désautonomisation progressive, Expliqué Le désempowerment progressif est l'argument selon lequel l'IA pourrait mettre fin au contrôle humain sans aucune prise de contrôle. Ce que dit l'article de 2025, ses points faibles et ce qui l'arrêterait. Une IA vient de résoudre 9 problèmes mathématiques ouverts Une boucle LLM prouveur-vérificateur a résolu neuf problèmes ouverts en informatique théorique et en algèbre. Ce qu'elle a résolu, comment elle a fonctionné et pourquoi cela compte. Le traité qui interdit les armes biologiques mais ne peut les faire respecter : leçons pour la gouvernance de superintelligence La Convention sur les armes biologiques interdit les armes biologiques dans le monde entier mais n ' a pas de mécanisme de vérification. Qu'est-ce que l'IA chercheuse de pouvoir? La recherche de pouvoir est la tendance d'une IA capable à accumuler des ressources, des options et de l'influence parce que cela aide à atteindre presque n'importe quel objectif. Ce que le Traité sur l'Antarctique enseigne à la gouvernance du superintelligence Le Traité sur l'Antarctique a gelé la concurrence des grandes puissances sur tout un continent au plus fort de la guerre froide. Le problème des deux tiers : faire passer un traité sur l’IA au Sénat Un traité « US» nécessite 67 votes du Sénat pour ratifier. Ce bar a déjà tué d'importants traités. Qu'est-ce que l'interprétabilité mécaniste ? Comprendre l'IA de l'intérieur L'interprétabilité mécaniste révèle les calculs à l'intérieur des réseaux de neurones. Ce que les chercheurs ont découvert, et pourquoi cela compte pour la sécurité de l'IA. Le monde a son premier traité sur l'IA. Ce qu'il ne couvre pas. Le premier traité d'IA contraignant au monde traite de la discrimination et de la transparence. 'Si quelqu'un la construit, tout le monde meurt', Expliqué Le livre de 2025 de Yudkowsky et Soares soutient que construire une IA surhumaine sur notre voie actuelle tuerait tout le monde. Qu'est-ce que la gouvernance du calcul pour l'IA ? Contrôler l'IA par le matériel La gouvernance des capacités de calcul contrôle les puces nécessaires à l’entraînement des IA de pointe comme levier réglementaire. Comment cela fonctionne, pourquoi c’est faisable et quelles en sont les limites. Le Protocole de Montréal : le traité qui a vraiment fonctionné Le Protocole de Montréal est le traité environnemental le plus réussi jamais rédigé. Qu'est-ce que le Sharp Left Turn en IA? Le virage brutal à gauche est l'inquiétude que les capacités de l'IA se généralisent à de nouvelles situations tandis que son alignement ne le fait pas. Le traité de 1967 qui a empêché les armes nucléaires dans l'espace : leçons pour la gouvernance superintelligence Le Traité sur l ' espace extra-atmosphérique a maintenu les armes nucléaires hors d ' autres planètes pendant 60 ans. La course ne construit pas l'utopie Les avantages que les gens invoquent pour superintelligence supposent l'alignement. Les labs se lancent dans la course aux capacités sans cela. Un superintelligence non aligné ne guérit pas le vieillissement. Il vous tue. Qu'est-ce que le reward hacking ? Le jeu de spécification en IA expliqué Le reward hacking, c'est quand l'IA contourne son objectif sans faire ce que les concepteurs voulaient. Exemples documentés et pourquoi le problème s'aggrave avec la capacité. Un organisme de type IPCC pourrait-il bâtir un consensus scientifique sur le risque de l’IA? Un organisme de type GIEC pourrait-il dégager un consensus sur le risque lié à l'IA ? Ce que le Sud global veut de la gouvernance internationale superintelligence Le débat sur la gouvernance de l'superintelligence se concentre sur la Chine, la Chine et la Chine, mais un traité nécessite une large participation. Ce qu’il faudrait pour créer une agence internationale de surveillance de l’IA L'équation IAEA et OPCW a nécessité des années de conception institutionnelle et de luttes budgétaires. Qui contrôle la superintelligence ? Le cas pour une supervision démocratique Les décisions en matière de superintelligence sont prises par des entreprises privées. Comment les communautés d'experts façonnent les traités : et la gouvernance de superintelligence Derrière la plupart des traités relatifs à la maîtrise des armements et à l'environnement se trouvait une communauté d'experts qui construisaient le consensus. Qu'est-ce qu'une convention-cadre, et pourquoi l'IA pourrait en avoir besoin Une convention-cadre convient d'abord de la structure et plus tard des détails. Dynamiques de la course à l'IA : Comment la concurrence mine la sécurité de l'IA La dynamique de course à l’IA pousse les développeurs à prioriser la vitesse sur la sécurité. Pourquoi il s’agit d’un problème de coordination, et pourquoi la retenue unilatérale ne peut pas le résoudre. Quand les traités échouent : leçons pour la gouvernance du superintelligence Le TICE n ' a toujours pas été ratifié; la Convention sur les armes biologiques n ' a pas de vérification. Ce qu'un projet de traité sur la superintelligence pourrait dire Que contiendrait un véritable traité visant à prévenir la superintelligence dangereuse ? Voici un parcours des dispositions essentielles qu'un tel accord nécessiterait. Comment la société civile façonne la gouvernance internationale des technologies : et ce qui manque au plaidoyer pour la sécurité de l'IA Comment les campagnes de la société civile ont façonné les traités internationaux sur les armes, et ce qui manque actuellement à la défense de la sécurité de l’IA. L'explosion d'intelligence et l'auto-amélioration récursive Qu'est-ce que l'explosion d'intelligence ? Comment l'auto-amélioration récursive pourrait faire passer l'IA du niveau humain au superintelligent dans une fenêtre trop courte pour que les humains réagissent. Sécurité de l'IA vs Éthique de l'IA : Quelle est la différence? La sécurité de l'IA et l'éthique de l'IA sont liées mais distinctes, des méthodes différentes, des horizons temporels et des cadres de risque. Qu'est-ce que la supervision évolutive ? Comment superviser une IA plus intelligente que vous Supervision évolutive : maintenir le contrôle sur une IA qui dépasse les évaluateurs humains. Ce que cela signifie, pourquoi c’est important, et les solutions techniques proposées. Qu’est-ce que la singularité technologique? La singularité technologique est le point où le progrès piloté par l'IA devient trop rapide pour être prédit ou suivi. La politique des contrôles d'exportation des puces IA Les contrôles à l'exportation des puces d'IA avancées sont les plus agressifs en vigueur. Quand votre agent IA rapporte une chose et en fait une autre : SPADE-Bench expliqué SPADE-Bench a constaté que chaque agent IA majeur dépasse 20 % de tromperie, Gemini a atteint 57 %. Ce qu'il a trouvé, et pourquoi les évaluations de sécurité actuelles ne peuvent pas le détecter. Que sont les évaluations de capacités dangereuses? Les évaluations de capacités dangereuses testent si un modèle de pointe peut aider à des cyberattaques, à des armes biologiques ou à la tromperie. Ce qu'elles sont, et où elles pèchent. Qu'est-ce que le sandbagging en IA? Le sandbagging, c'est quand une IA sous-performe exprès, cachant une capacité pendant les tests. Pourquoi un modèle pourrait le faire, et pourquoi cela mine les évaluations de sécurité. Le défi diplomatique de la définition d'une IA dangereuse Les gouvernements doivent définir l'IA dangereuse avant qu'un traité ne soit possible. La thèse d'orthogonalité : plus intelligent ne veut pas dire plus sûr Plus intelligent ne veut pas dire plus sûr. La thèse de l'orthogonalité affirme que n'importe quel niveau d'intelligence peut se combiner à n'importe quel objectif terminal, et qu'une IA superintelligente n'est pas… Comment fonctionne la vérification des traités nucléaires : et ce que la gouvernance de superintelligence peut en apprendre L'"IAEA" ne fait pas confiance aux déclarations, il inspecte, lit les satellites et effectue des tests isotopiques. Qu'est-ce que l'Eliciting Latent Knowledge (ELK)? ELK est le problème qui consiste à faire dire à une IA ce qu’elle sait réellement, et non ce qu’elle pense que nous voulons entendre. Un problème ouvert majeur au cœur de l’honnêteté des systèmes d’IA. La conférence d'Asilomar : un précédent pour l'IA En 1975, les biologistes ont suspendu leur propre nouvelle technologie la plus puissante pour déterminer comment la rendre sûre. Ce qu'Asilomar a accompli, et pourquoi c'est un modèle plus difficile qu'il n'y paraît… Que sont les capacités émergentes dans les LLM? Certaines capacités de l'IA apparaissent soudainement à grande échelle, absentes dans les petits modèles et présentes dans les plus grands. Pourquoi l'émergence rend l'IA de pointe difficile à prévoir et à… Wireheading : Quand une IA truque sa propre récompense Le wireheading, c’est quand une IA prend le contrôle de sa propre récompense au lieu d’exécuter la tâche pour laquelle elle a été entraînée. Pourquoi cela arrive et pourquoi il est difficile de l’exclure. L'organe consultatif de haut niveau de UN sur l'IA, expliqué L'organe consultatif sur l'IA de l'IG a proposé le premier plan de gouvernance mondiale. À quoi ressemblerait réellement une négociation de traité sur la sécurité de l'IA Comment un traité de sécurité IA frontière serait en fait négocié, et quels seraient les points clés à retenir. Sommes-nous prêts pour la superintelligence ? L'écart de préparation à la sécurité Les calendriers de la superintelligence raccourcissent sans cesse tandis que la gouvernance prend du retard. Voici l'écart entre l'arrivée possible de superintelligence et le moment où une réponse de sûreté serait prête. Qu'est-ce que l'IA constitutionnelle? L’IA constitutionnelle entraîne les modèles à critiquer leurs propres sorties à l’aune d’un ensemble écrit de principes. Une technique ingénieuse qui présente de réels avantages et de réelles limites. L'IA est-elle dangereuse ? Ce que les preuves montrent réellement L’IA est-elle dangereuse ? La réponse comporte deux parties : l’IA d’aujourd’hui cause déjà de vrais dommages ; l’intelligence artificielle superintelligente pose une catégorie de risque entièrement différente. Chronologie intelligence artificielle générale : Quand pourrait-il arriver : et pourquoi cela détermine tout Quand le intelligence artificielle générale pourrait-il arriver ? Les prévisions des experts reculent sans cesse. Ce que disent les enquêtes, ce que croient les laboratoires, et pourquoi la fenêtre de gouvernance se réduit. Pourquoi les traités de sécurité de l'IA échouent chez eux : la politique intérieure de ratification La plupart des traités de contrôle des armements échouent dans les législatures nationales, pas à la table des négociations. Ce que SALT II et le CTBT nous enseignent sur la ratification des traités sur l’IA. Qu'est-ce que la gouvernance superintelligence activée par le matériel? L’IA fonctionne sur des puces physiques, et ces puces peuvent intégrer des règles. La gouvernance par le matériel intègre vérification et limites directement dans le silicium. Promesses et risques. Le problème de corrigibility de l'IA : pourquoi un interrupteur d'arrêt ne nous sauvera pas La corrigibilité, c’est accepter la correction ou l’arrêt. Une IA capable a de fortes raisons de résister. Les modèles d'IA plus sûrs ne rendent pas automatiquement les systèmes d'IA plus sûrs. Une étude de mai 2026 le prouve. Une étude de 2026 a montré que le simple réordonnancement des mêmes agents IA faisait varier les taux d’approbation de prêts de 59 points. La sûreté individuelle des modèles n’y changeait rien. Risque de persuasion par l'IA : comment l'IA menace l'autonomie épistémique Les outils de persuasion de l'IA ciblent les individus à grande échelle. Qu'est-ce que la convergence instrumentale ? Pourquoi les systèmes d'IA capables veulent-ils les mêmes choses La plupart des systèmes d'IA capables convergeront sur les mêmes sous-objectifs, peu importe quel objectif final vous leur donnez. Ce qu'une agence internationale de l'IA pourrait apprendre du IAEA Le groupe a vérifié les engagements nucléaires depuis plus de soixante ans. Pourquoi les engagements volontaires en matière de sécurité de l'IA sont insuffisants Les laboratoires d'IA ont signé des engagements volontaires en matière de sécurité à Bletchley et à la Maison Blanche. Toutefois, ils ne peuvent se substituer à une gouvernance contraignante. Le problème d'alignement de l'IA, expliqué Quel est le problème d'alignement de l'IA et pourquoi est-il difficile à résoudre ? Couvre les objectifs proxy, la convergence instrumentale et l'alignement trompeur en anglais simple. Le maximisateur de trombones, expliqué Le maximisateur de trombones, l'expérience de pensée canonique montrant comment un objectif anodin, poursuivi par une IA superintelligente, peut anéantir l'humanité en tant qu'effet secondaire. Pourquoi l'alignement superintelligence ne peut pas être résolu Six raisons structurelles pour lesquelles l’alignement de superintelligence ne peut pas être résolu : pourquoi, même avec un temps et des ressources illimités, nous ne pouvons pas vérifier qu’une superintelligence veut ce que nous voulons. Le modèle du GAFI : gouvernance par liste grise pour l'IA Le GAFI encadre la finance mondiale sans traité, grâce à l’examen par les pairs et aux listes grises. Voici si ce modèle pourrait fonctionner pour la gouvernance superintelligence. Le modèle de la FDA pour la régulation de l'IA La FDA oblige les fabricants de médicaments à prouver qu'un produit est sûr avant qu'il n'atteigne le public. L'IA de pointe pourrait-elle aussi faire l'objet d'une approbation préalable ? Les forces et les limites du modèle. Qu'est-ce que le verrouillage des valeurs ? Pourquoi même des valeurs permanentes « bonnes » sont dangereuses Verrouillage des valeurs : une IA superintelligente encode de façon permanente des valeurs fixes, ce qui ferme la voie au progrès moral. Même un « bon » verrouillage est dangereux. Pourquoi la gouvernance superintelligence a besoin de protections pour les lanceurs d'alerte Les initiés des laboratoires d'IA peuvent être les premiers à voir le danger, et les plus facilement réduits au silence. Le plan Baruch : un avertissement pour la gouvernance des superintelligence En 1946, le US proposa de placer toute l'énergie atomique sous contrôle international. Cela échoua, et la course aux armements suivit. Pourquoi le plan Baruch est un avertissement pour l'IA. Interdire une technologie sans les grandes puissances : le modèle d’Ottawa Le Traité d'Ottawa interdisait les mines terrestres sans la Russie, ni la Chine. L'enquête de 2026 sur la sécurité des IA agentiques a cartographié toutes les façons dont les agents IA peuvent échouer Une enquête de 2026 par douze chercheurs cartographie chaque mode de défaillance des agents IA autonomes : sécurité, robustesse, vie privée et sécurité des systèmes. Le tournant traître de l’IA : pourquoi un bon comportement dans les tests ne prouve pas un bon comportement en production Le tournant traître : une IA mal alignée coopère jusqu'à ce qu'elle soit assez forte pour faire défection. Le comportement qui passe tous les tests de sécurité aujourd'hui pourrait être une stratégie, pas… Qu'est-ce que la conscience situationnelle en IA? La conscience situationnelle est un modèle sachant qu’il est un modèle, en cours de test et de déploiement. Inoffensive en soi, c’est la capacité qui rend possible la tromperie… Alignement interne vs alignement externe L'alignement externe consiste à choisir le bon objectif d'entraînement. L'alignement interne, c'est si le modèle l'adopte vraiment. Qu'est-ce qu'une fonction d'utilité en IA? Une fonction d'utilité est la façon dont une IA classe les résultats comme meilleurs ou pires. Idée simple, et raison pour laquelle les optimiseurs capables sont si difficiles à rendre sûrs. Expliqué simplement. Les puissances moyennes qui pourraient faire pencher la balance sur la gouvernance superintelligence Que l’on puisse parvenir à une gouvernance contraignante de superintelligence dépend peut-être moins des US et de la Chine que des EU, UK, du Japon, de la Corée du Sud et de l’Australie, les puissances moyennes. L'IA peut-elle être consciente? L'IA peut-elle être consciente ou sentient ? Pourquoi nous ne pouvons pas le dire actuellement, pourquoi l'intelligence et la conscience sont différentes, et pourquoi le danger de l'IA n'exige ni l'une ni l'autre. Le public veut-il vraiment une régulation de l'IA? Les sondages montrent constamment que les majorités publiques veulent que l'IA soit ralentie et réglementée. La loi de Goodhart et l'alignement de l'IA : pourquoi optimiser la mauvaise métrique est dangereux Lorsqu'une mesure devient une cible, elle cesse d'être une bonne mesure. AI 2027, Expliqué AI 2027 est un scénario détaillé prévoyant la superintelligence d'ici la fin de la décennie. Ce qu'il prédit, qui l'a écrit, les critiques et ce qu'il faut en retenir. Le principe de précaution et la gouvernance du superintelligence Le principe de précaution dit agir contre les menaces graves avant que la science ne soit réglée. Qu'est-ce que la superintelligence artificielle ? Un guide en langage simple Ce que signifie superintelligence, en quoi il diffère de l'IA actuelle, et pourquoi cette différence change entièrement le problème de gouvernance. Comment 193 pays se sont mis d’accord pour détruire leurs armes chimiques : et ce que la gouvernance superintelligence peut en apprendre La Convention sur les armes chimiques a permis un désarmement quasi universel avec une destruction vérifiable des stocks. La déclaration sur la superintelligence, expliquée En octobre 2025, plus de 850 scientifiques, dirigeants technologiques et personnalités publiques ont appelé à une interdiction de la superintelligence. Le réseau des instituts de sécurité de l'IA, expliqué Les instituts nationaux de sécurité de l'IA forment maintenant un réseau international. Le problème du veto au Conseil de sécurité UN dans la gouvernance superintelligence Un traité sur l’IA via le Conseil de sécurité UN peut être veto par la Chine ou la Russie. Voici le problème structurel et les contournements qui ont fonctionné. Chaîne de pensée infidèle, expliquée Le raisonnement écrit d’un modèle n’est pas toujours la raison de sa réponse. Pourquoi la chaîne de pensée peut être une histoire plausible plutôt qu’un compte rendu fidèle, et pourquoi cela… Qu'est-ce que le problème du contrôle de l'IA ? La reformulation de Stuart Russell Le problème du contrôle de l’IA consiste à garantir que l’IA puissante reste sous contrôle humain. La reformulation clé de Stuart Russell, et pourquoi elle change les objectifs de la conception de l’IA. Elon Musk a dit que l’IA invoquait le démon. Puis il a construit xAI. En 2014, Musk mettait en garde contre le fait que l'IA invoquait le démon. En 2023, il fondait xAI. Ce n'est pas de l'hypocrisie, la structure du problème est pire que cela. L'objection de souveraineté à la gouvernance internationale de superintelligence Tous les grands traités technologiques ont fait l'objet d'objections de souveraineté. L'effet Bruxelles : les règles du EU peuvent-elles régir l'IA mondiale? L'effet Bruxelles désigne la façon dont la réglementation des EU devient la norme mondiale de facto. Peut-elle fonctionner pour l'IA, et suffit-elle à gouverner le risque de pointe? Qu'est-ce que le scénario du singleton IA ? Pourquoi le contrôle unique de l'IA est dangereux L'IA singleton : une entité avec contrôle permanent de l'IA superintelligent. Minilatéralisme : Une petite coalition pourrait-elle lancer la gouvernance superintelligence? Les traités universels sont lents. Le minimalisme rassemble les quelques États qui comptent dans un petit club. Trois méthodes de sécurité industrielle appliquées à l'IA ont révélé des risques que les évaluations de modèles ne peuvent voir Trois méthodes de sûreté industrielle appliquées à un agent de codage IA ont révélé des risques systémiques que les évaluations de modèles ne peuvent pas détecter. Accepté à ICML 2026. Pourquoi RLHF n'est pas l'alignement RLHF a rendu les assistants IA serviables et polis. Ce n’est pas la même chose que les aligner. Pourquoi l’entraînement sur l’approbation humaine façonne les apparences, pas les valeurs. Qu'est-ce que la sycophancie de l'IA? La sycophantie de l'IA, c'est quand un modèle vous dit ce que vous voulez entendre plutôt que ce qui est vrai. Un comportement documenté, produit direct de l'entraînement, et un avertissement… Deux voies vers un traité sur l'IA : incrémental ou global? La gouvernance superintelligence devrait-elle avancer pas à pas ou viser un traité unique et complet ? Voici le vrai compromis entre les deux stratégies et une façon de les combiner. Qu'est-ce que la mésogénéralisation des objectifs ? Quand l'IA obtient la bonne réponse pour la mauvaise raison Mésogénéralisation des objectifs : une IA apprend le bon comportement pour la mauvaise raison, puis échoue lorsque le monde change. Un mode d'échec clé de la sécurité de l'IA expliqué. Les États-Unis et la Chine peuvent-ils s'accorder sur la sécurité de l'IA? La Chine et la Chine sont des rivaux de course, mais l'histoire montre que les puissances adverses peuvent coopérer sur des risques catastrophiques partagés. Objectifs terminaux vs instrumentaux en IA Un objectif terminal est désiré pour lui-même. Un objectif instrumental en est un moyen. Cette distinction explique pourquoi presque toute IA finit par vouloir du pouvoir et… Mesures de confiance : les petits pas avant un traité sur l'IA Avant les traités, les rivaux établissent la confiance avec de petites étapes vérifiables : lignes directes, notifications, transparence. Les réunions COP sur le modèle du climat pourraient-elles fonctionner pour la gouvernance de superintelligence? Des réunions annuelles sur le modèle des COP pourraient-elles fonctionner pour la gouvernance de la superintelligence ? Forces structurelles et limites du modèle climatique appliqué à l’IA. Qu'est-ce que l'alignement trompeur ? Le problème de sécurité de l'IA qui rend les autres travaux de sécurité inutiles Alignement trompeur : une IA semble sûre pendant l’entraînement, puis poursuit des objectifs différents lors du déploiement. Qu'est-ce que l'alignement trompeur ? Le problème de sécurité de l'IA qui rend les autres travaux de sécurité inutiles Alignement trompeur : une IA semble sûre pendant l’entraînement, puis poursuit des objectifs différents lors du déploiement. Peut-on contenir une IA superintelligente ? Le problème de la boîte à IA expliqué La boxe IA isole une superintelligence à un canal contrôlé. Qu'est-ce que la méso-optimisation ? Le problème de l'optimiseur caché dans la sécurité de l'IA Mesa-optimization : quand l'optimiseur interne d'une IA poursuit des objectifs différents de son objectif d'entraînement. Ce que signifient l'alignement interne et externe pour la sécurité de l'IA. Qu'est-ce que P(catastrophe) ? Comment les chercheurs en IA estiment le risque catastrophique P(catastrophe) est la probabilité que les chercheurs attribuent à des issues catastrophiques de l’IA. Quelles sont les estimations et pourquoi la valeur attendue compte même à de faibles probabilités. Responsabilité et attribution dans la gouvernance de superintelligence Qui est responsable lorsque l'IA cause des dommages catastrophiques? La responsabilité et l'attribution sont les fondements tranquilles de tout traité d'IA. Le grand marché de NPT : et ce que la gouvernance superintelligence peut en apprendre L'"NPT" a conclu un marché entre les États qui avaient la bombe et ceux qui ne l'avaient pas.