18 августа 2026 года на arXiv появилась статья под названием, который не скрывает цели: «сверхразум-Bench: На заре искусственного сверхинтеллекта». Более 40 экспертов создали 60 исследовательских задач проектного уровня по 11 научным областям. Авторы оценили человеческие затраты более чем в 31 000 часов. Тест — это не очередная викторина по известным фактам. Он проверяет, способна ли система ИИ исследовать, выбирать метод и превращать новую идею в проверяемый результат по мере снятия человеческих инструкций.

По 18 современным агентным и модельным конфигурациям средний балл составил 50,91 при полном методологическом руководстве. Он упал до 29,10, когда назывался только метод. Он упал до 26,62, когда агент должен был сам выбрать метод. Авторы интерпретировали это падение как учитель: сегодняшние системы всё ещё опираются на человека, который уже знает, как должна идти работа.

Это резкое снижение показывает, что нынешние системы остаются сильно зависимыми от человеческого руководства и всё ещё далеки от автономного проведения сквозных научных исследований проектного уровня.

сверхразум-Bench · arXiv:2608.17271 · 2026

Что на самом деле измеряет скамейка

Большинство существующих тестов проверяют, может ли модель выдать правильный ответ из уже сжатых знаний или завершить задачу, пока человек всё ещё держит метод. сверхразум-Bench пытается оценить сразу две другие вещи: инновационное исследование и автономное научное выполнение. В рамках одного исследовательского проекта он поэтапно снимает методологическое руководство, чтобы увидеть, насколько далеко система продвинется самостоятельно.

Задачи прошли экспертную проверку, аудит, выполнение в песочнице и валидацию оценщика. Это больше заботы, чем скриншот лидерборда. Это всё равно бенчмарк. Число — не сверхинтеллект. Статья не утверждает, что он уже появился.

Как они его назвали

Авторы предлагают исследователям и строителям добавить задачи, бросить вызов современным системам и помочь ускорить коллективный путь человечества к искусственному сверхразуму. Собственные оценки авторов показывают, что систем там нет, в то время как приглашение говорит исследователям, чтобы помочь ускорить путь к сверхразуму.

Обыденное прочтение — что у нас есть время

Коллапс от 51 до 27 выглядит как расстояние. Расстояние реальное. Это тоже неправильный комфорт. В августе того же года OpenAI заявил, что не может исключить Критические кибервозможности в Astra: Нахождение и использование отверстий в закаленных системах, заданных целью, без человека на каждом шагу. Исследовательский агент, которому все еще нужен метод, и кибер-агент, который не может существовать в одной и той же отрасли одновременно. Один номер не отменяет другой.

Есть вторая, более тихая ошибка, чем «у нас есть время». Это восприятие оставшегося разрыва как списка задач. Когда область называет скамью в честь сверхинтеллекта, оставшаяся работа получает табло. Лаборатории уже оптимизируют под табло. Формулировка самой статьи «на заре» — это язык взлётной полосы, а не остановки.

Отзыв метода в рамках того же проекта — настоящая проверка. Модель может выглядеть сильной, когда человек уже выбрал эксперимент, назвал инструмент и написал условие успеха. Таковы большинство сегодняшних демонстраций агентов. сверхразум-Bench спрашивает, что остаётся, когда эти подарки убирают: сможет ли система сама решить, что попробовать, провести работу и вернуть результат, который сможет проверить оценщик. Падение с 50,91 до 26,62 — это размер подарка.

Ничего из этого не требует верить метафоре авторов о заре. Требуется заметить, что исследовательское сообщество создало публичный трек для последнего человеческого шага в научной работе и попросило мир помочь его заполнить.

Не создавайте то, для чего предназначена эта скамья

Фонд Накада does not read a low сверхразум-Bench score as permission to keep going. Artificial superintelligence should never be built. Superintelligence cannot be controlled by humans. A test that withdraws the last human method is a test of the last human role. Current agents failing that test is not a safety case for building agents that pass it.

Если вы работаете в науке, спросите, кто решил, что ускорение этого пути — общественное благо. Если вы работаете в правительстве, воспринимайте статью как карту того, что лаборатории попытаются закрыть. Ответ, соответствующий риску, — закон, который объявляет пункт назначения закрытым.