Le 18 août 2026, un journal est monté sur arXiv sous un titre qui ne cache pas la cible : « superintelligence-Bench : À l'aube de la superintelligence artificielle ». Plus de 40 experts ont réalisé 60 travaux de recherche au niveau des projets dans 11 domaines scientifiques. Les auteurs ont estimé le coût humain à plus de 31 000 heures. Le test n'est pas un autre quiz sur les faits connus. Il demande si un système d'IA peut explorer, choisir une méthode et transformer une nouvelle idée en un résultat que vous pouvez vérifier, au fur et à mesure que les instructions humaines s'en vont.

Sur 18 configurations d'agents et de modèles de pointe, la note moyenne était de 50,91 avec une orientation méthodologique complète. Il est tombé à 29.10 quand seule la méthode a été nommée. Il est tombé à 26.62 quand l'agent a dû choisir la méthode. Les auteurs lisent ce qui suit : les systèmes d'aujourd'hui s'appuient toujours sur la personne qui sait déjà comment le travail devrait se dérouler.

Cette forte baisse montre que les systèmes actuels demeurent fortement tributaires de l'orientation humaine et sont encore loin de mener de façon autonome des recherches scientifiques de bout en bout au niveau des projets.

superintelligence-Bench · arXiv:2608.17271 · 2026

Ce que le banc mesure en fait

La plupart des tests existants demandent si un modèle peut produire une réponse correcte à partir de la connaissance qu'il a déjà compressée, ou s'il peut terminer une tâche alors qu'une personne détient toujours la méthode. superintelligence-Bench tente de marquer deux autres choses à la fois : l'exploration innovante et l'exécution scientifique autonome. Sur le même projet de recherche, il retire les orientations méthodologiques par étapes, pour voir jusqu'où le système va de soi.

Les tâches ont fait l'objet d'un examen par des experts, d'un audit, d'une exécution de bacs à sable et d'une validation des scoreurs. C'est plus attentionné qu'une capture d'écran. C'est encore une référence. Un nombre n'est pas une superintelligence. Le document ne prétend pas qu'on soit arrivé.

Ce qu'ils ont appelé

Les auteurs invitent les chercheurs et les constructeurs à ajouter des tâches, à défier les systèmes d'aujourd'hui et à accélérer la voie collective de l'humanité vers la superintelligence artificielle. Les résultats des auteurs montrent que les systèmes ne sont pas là, tandis que l'invitation invite les chercheurs à accélérer le chemin vers la superintelligence.

La lecture populaire est que nous avons le temps

Un effondrement de 51 à 27 ressemble à une distance. La distance est réelle. C'est aussi le mauvais confort. Le même août, OpenAI a déclaré qu'il ne pouvait pas exclure La cybercapacité critique en Astra: trouver et utiliser des trous dans des systèmes durcis, avec un but, sans personne à chaque pas. Un agent de recherche qui a encore besoin d'une méthode et d'un cyber agent qui ne peut pas exister dans la même industrie en même temps. Un numéro n'annule pas l'autre.

Il y a une deuxième erreur, plus calme que "nous avons le temps". Il traite l'écart restant comme une liste à faire. Une fois qu'un champ nomme un banc après la superintelligence, le travail restant a un tableau de bord. Les laboratoires optimisent déjà pour les tableaux de bord. Le cadrage du journal, « à l'aube », est le langage d'une piste, pas d'un arrêt.

Le retrait de la méthode sur le même projet est le test réel. Un modèle peut sembler fort quand une personne a déjà choisi l'expérience, nommé l'instrument, et écrit la condition de succès. C'est la plupart des démonstrations d'agent d'aujourd'hui. superintelligence-Bench demande ce qui reste lorsque ces cadeaux sont supprimés: le système peut-il décider quoi essayer, exécuter le travail, et rendre quelque chose qu'un marqueur peut vérifier. La chute de 50.91 à 26.62 est la taille du cadeau.

Rien de tout cela ne vous oblige à croire la métaphore de l'aube des auteurs. Il vous oblige à remarquer qu'une communauté de recherche vient de se dresser une piste publique pour la dernière étape humaine dans le travail scientifique, et a demandé au monde d'aider à le remplir.

Ne construisez pas la chose que le banc est pour

La Fondation Nakada does not read a low superintelligence-Bench score as permission to keep going. Artificial superintelligence should never be built. Superintelligence cannot be controlled by humans. A test that withdraws the last human method is a test of the last human role. Current agents failing that test is not a safety case for building agents that pass it.

Si vous travaillez en science, demandez qui a décidé que l'accélération de cette voie était le bien public. Si vous travaillez au gouvernement, traitez le document comme une carte de ce que les laboratoires vont essayer de fermer. La réponse qui correspond au risque est une loi qui dit que la destination est fermée.