Am 18. August 2026 erschien ein Artikel auf arXiv unter einem Titel, der das Ziel nicht verbirgt: "Superintelligenz-Bench: At the Dawn of Artificial Superintelligence". Mehr als 40 Experten bauten 60 Forschungsaufgaben auf Projektebene in 11 wissenschaftlichen Bereichen auf. Die Autoren bezifferten die menschlichen Kosten auf mehr als 31.000 Stunden. Der Test ist kein weiteres Quiz über bekannte Fakten. Es fragt, ob ein KI-System erforschen, eine Methode auswählen und eine neue Idee in ein Ergebnis verwandeln kann, das Sie überprüfen können, wenn die menschlichen Anweisungen abgehen.
Bei 18 hochmodernen Agenten- und Modell-Setups betrug die durchschnittliche Punktzahl 50,91 mit vollständiger methodischer Anleitung. Es fiel auf 29.10, als nur die Methode benannt wurde. Es fiel auf 26,62, als der Agent die Methode wählen musste. Die Autoren lesen, dass fallen die Art und Weise ein Lehrer würde: die heutigen Systeme noch auf die Person, die bereits weiß, wie die Arbeit gehen sollte.
Dieser starke Rückgang zeigt, dass die derzeitigen Systeme nach wie vor stark von menschlicher Führung abhängig sind und noch weit davon entfernt sind, autonom wissenschaftliche Forschung auf Projektebene durchzuführen.
Superintelligenz-Bench · arXiv:2608.17271 · 2026
Was die Bank tatsächlich misst
Die meisten bestehenden Tests fragen, ob ein Modell eine korrekte Antwort aus dem Wissen liefern kann, das es bereits komprimiert hat, oder ob es eine Aufgabe beenden kann, während eine Person die Methode noch hält. Superintelligenz-Bench versucht, zwei weitere Dinge gleichzeitig zu bewerten: innovative Exploration und autonome wissenschaftliche Durchführung. Bei demselben Forschungsprojekt zieht es die methodische Anleitung schrittweise zurück, um zu sehen, wie weit das System von selbst voranschreitet.
Die Aufgaben wurden von Experten überprüft, auditiert, Sandbox ausgeführt und validiert. Das ist mehr Sorgfalt als ein Leaderboard-Screenshot. Es ist immer noch ein Benchmark. Eine Zahl ist keine Superintelligenz. Die Zeitung behauptet nicht, dass einer angekommen ist.
Die Autoren laden Forscher und Bauherren ein, Aufgaben hinzuzufügen, die heutigen Systeme herauszufordern und den kollektiven Weg der Menschheit in Richtung künstlicher Superintelligenz zu beschleunigen. Die eigenen Ergebnisse der Autoren zeigen, dass die Systeme nicht da sind, während die Einladung den Forschern sagt, dass sie helfen sollen, den Weg zur Superintelligenz zu beschleunigen.
Die Volkslesung ist, dass wir Zeit haben
Ein Zusammenbruch von 51 auf 27 sieht aus wie eine Entfernung. Distanz ist real. Es ist auch der falsche Komfort. Im selben August sagte OpenAI, es könne nicht ausgeschlossen werden Kritische Cyber-Fähigkeiten in Astra: Finden und Verwenden von Löchern in gehärteten Systemen, mit einem Ziel, ohne eine Person bei jedem Schritt. Ein Research Agent, der noch eine Methode benötigt, und ein Cyber Agent, der dies nicht tut, können gleichzeitig in derselben Branche existieren. Eine Zahl hebt die andere nicht auf.
Es gibt einen zweiten Fehler, ruhiger als "wir haben Zeit." Es behandelt die verbleibende Lücke als To-Do-Liste. Sobald ein Feld eine Bank nach Superintelligenz benennt, hat die verbleibende Arbeit eine Anzeigetafel. Labs optimieren bereits für Anzeigetafeln. Der eigene Rahmen der Zeitung, "in der Morgendämmerung", ist die Sprache einer Landebahn, nicht eines Stopps.
Das Zurückziehen der Methode für dasselbe Projekt ist der eigentliche Test. Ein Modell kann stark aussehen, wenn eine Person bereits das Experiment ausgewählt, das Instrument benannt und die Erfolgsbedingung geschrieben hat. Das ist der größte Teil der heutigen Agentendemos. Superintelligenz-Bench fragt, was bleibt, wenn diese Geschenke entfernt werden: Kann das System entscheiden, was es versuchen soll, die Arbeit ausführen und etwas zurückgeben, das ein Scorer überprüfen kann? Der 50,91 bis 26,62 Tropfen ist die Größe des Geschenks.
Nichts davon erfordert, dass sie der morgendlichen metapher der autoren glauben. Es erfordert, dass Sie bemerken, dass eine Forschungsgemeinschaft gerade eine öffentliche Spur für den letzten menschlichen Schritt in der wissenschaftlichen Arbeit aufgestellt hat und die Welt gebeten hat, dabei zu helfen, sie zu füllen.
Baue nicht das Ding, für das die Bank ist
Die Nakada-Stiftung does not read a low Superintelligenz-Bench score as permission to keep going. Artificial superintelligence should never be built. Superintelligence cannot be controlled by humans. A test that withdraws the last human method is a test of the last human role. Current agents failing that test is not a safety case for building agents that pass it.
Wenn Sie in der Wissenschaft arbeiten, fragen Sie, wer entschieden hat, dass die Beschleunigung dieses Weges das Gemeinwohl ist. Wenn Sie in der Regierung arbeiten, behandeln Sie das Papier als eine Karte dessen, was die Labors versuchen werden, zu schließen. Die Antwort, die dem Risiko entspricht, ist ein Gesetz, das besagt, dass das Ziel geschlossen ist.