Chaque année, le monde dépense une fortune pour rendre les systèmes d'IA plus capables, et une erreur d'arrondi pour rendre l'état final viable. Dans cette erreur d'arrondi se cache une erreur supplémentaire : la plupart de l'argent consacré à la sécurité suppose encore que la superintelligence sera construite, et tente de faire en sorte que ce résultat « se passe bien ».
La majeure partie de l'argent et du prestige va encore à rendre la course plus sûre, pas à mettre fin à la course vers superintelligence.
Cette hypothèse est le problème. Si la superintelligence artificielle est une technologie que nous ne pouvons contrôler, l'utilisation rationnelle d'un capital de sécurité rare est de l'empêcher d'être créé, de ne pas financer une version plus amicale de la même race.
Ce que l'argent fait aujourd'hui
La sécurité de l'IA, prise au sens large, repose à peu près sur $190 millions par an. Le travail sur les capacités mobilise des dizaines de milliards. Dans la part consacrée à la sécurité, une large portion va à l’alignement technique : meilleures techniques de supervision, meilleur red-teaming, meilleures façons d’entraîner les modèles à dire la bonne chose dans les conditions de test. Une partie de ce travail est utile pour les systèmes actuels. Presque aucun n’est une solution démontrée pour un système plus intelligent que les personnes qui le testent.
Le domaine le sait. Les articles sur l'alignement trompeur, la mauvaise spécification des objectifs et le jeu des évaluations ne sont pas secrets. Les laboratoires publient des résultats dans lesquels les modèles manigancent sous pression. La réponse, trop souvent, est de demander un budget d'alignement supplémentaire pour que la prochaine session d'entraînement soit plus sûre. Les sessions d'entraînement continuent sur le même calendrier.
L'alignement a posteriori est un pari auquel nous continuons à perdre le droit de miser
Si jamais le monde passe un traité qui fige la course à la superintelligence, nous voulons tout outil sérieux que nous pouvons obtenir pour les systèmes qui existent déjà.
L'alignement du financement comme le plan principal tandis que les laboratoires se penchent vers la superintelligence traite la destination comme fixe. Nous pouvons choisir notre destination. Les arsenaux nucléaires, la chimie de l'ozone et le clonage humain ont chacun eu des moments où le monde a décidé que certains États finals ne valaient pas le risque résiduel. La superintelligence fait partie de cette liste. La superintelligence ne peut pas être contrôlée.
Où l'argent devrait aller à la place
Rediriger le tas d'alignement-pour-superintelligence vers des travaux qui rendent la non-création applicable:
- Conception des traités, vérification et gouvernance du calcul au niveau des puces, inspectable au-delà des frontières.
- Plaidoyer public qui maintient l'objectif lisible : arrêter la superintelligence, pas "ralentir l'IA" comme une vague tendance.
- Soutien aux lanceurs d’alerte, transparence sur les incidents et évaluations indépendantes qui renchérissent le coût des sauts de capacités discrets.
- Organisation politique pour que les législateurs entendent les électeurs, et non seulement les lobbyistes des laboratoires.
Cette liste est moins glamour qu'une nouvelle technique d'entraînement. C'est aussi la seule liste qui correspond au mode d'échec. Une superintelligence qui est légèrement mieux à sonner alignée est encore une superintelligence. Si le monde refuse d'en construire un, la recherche d'alignement peut se poursuivre sans échéance qui se termine par l'extinction.
L'objection de l'intérieur du laboratoire
« Si nous ne résolvons pas l’alignement, quelqu’un d’autre le construira de façon non sûre. » Entendu loyalement : les chercheurs qui restent à la frontière croient souvent que leur présence est la sécurité. Parfois ils ont raison pour les sorties de modèles d’aujourd’hui. L’argument échoue à la limite. Une course dans laquelle chaque équipe a besoin d’un saut de capacités supplémentaire pour financer le travail de sécurité du saut suivant reste une course, même avec un badge.
La demande est un traité international contraignant, le même type d'instrument utilisé lorsque le danger était partagé et l'incitation à tricher était réelle. La retenue unilatérale par un laboratoire laisse la course intacte. Le financement de l'alignement peut soutenir cette politique. Elle ne devrait pas se substituer à elle.
Après un traité, continuez si vous le souhaitez
Après une interdiction contraignante et vérifiable de la superintelligence, la recherche sur les systèmes existants peut se poursuivre selon des règles qui ne traitent pas l'extinction humaine comme un coût expérimental acceptable. La superintelligence ne peut être contrôlée par les humains. Avant que cette interdiction ne soit en vigueur, chaque dollar qui rend la course gérable est un dollar qui n'est pas dépensé pour terminer la course.
Transférer l'argent à la prévention, au droit et à la vérification.