2026년 8월 18일 arXiv에 "초지능-Bench: At the Dawn of Artificial Superintelligence"라는 제목의 논문이 올라왔다. 40명 이상의 전문가가 11개 과학 분야에 걸쳐 60개의 프로젝트 수준 연구 과제를 만들었다. 저자들은 인간 비용을 31,000시간 이상으로 산정했다. 이 시험은 이미 알려진 사실에 대한 또 다른 퀴즈가 아니다. 인간 지침이 사라진 상태에서 AI가 탐색하고, 방법을 선택하며, 새로운 아이디어를 검증 가능한 결과로 전환할 수 있는지를 묻는다.
18개의 최신 에이전트 및 모델 설정에서 완전한 방법론 지침이 제공될 때 평균 점수는 50.91이었다. 방법만 명시되자 29.10로 떨어졌고, 에이전트가 직접 방법을 선택해야 하자 26.62로 하락했다. 저자들은 이 하락을 교사가 평가하듯 해석했다. 오늘날 시스템은 여전히 작업 방식에 대해 이미 아는 사람에게 의존한다.
이 급격한 하락은 현재 시스템이 여전히 인간 지침에 크게 의존하며, 자율적으로 프로젝트 수준의 과학 연구를 종단적으로 수행하는 단계와는 거리가 멀다는 것을 보여준다.
초지능-Bench · arXiv:2608.17271 · 2026
벤치가 실제로 측정하는 것
기존 대부분의 시험은 모델이 이미 압축한 지식에서 정답을 도출할 수 있는지, 또는 사람이 여전히 방법을 쥐고 있는 상태에서 과제를 완료할 수 있는지를 묻는다. 초지능-Bench는 동시에 두 가지를 평가하려 한다. 혁신적 탐색과 자율적 과학 실행이다. 동일한 연구 프로젝트에서 방법론 지침을 단계적으로 철회하며 시스템이 얼마나 스스로 진행하는지를 확인한다.
과제는 전문가 검토, 감사, 샌드박스 실행, 채점자 검증을 거쳤다. 이는 리더보드 스크린샷보다 더 많은 주의를 기울인 결과다. 그래도 여전히 벤치마크일 뿐이다. 숫자는 초지능이 아니다. 논문은 초지능이 도래했다고 주장하지 않는다.
저자는 연구자 및 빌더를 초대하여 작업을 추가하고, 오늘 시스템을 도전하고, 인공 superintelligence로 인류의 집단 경로를 가속화하는 데 도움이됩니다. 저자의 자신의 점수는 시스템이 존재하지 않습니다, 초대는 연구원에게 superintelligence로 경로를 가속하는 데 도움이.
대중의 해석은 우리가 아직 시간이 있다고 보는 것입니다
51에서 27까지의 붕괴는 거리처럼 보입니다. 거리는 진짜입니다. 그것은 또한 잘못된 안락입니다. 같은 8 월, 오픈AI는 그것을 규칙 할 수 없었다 말했다 Astra에서 중요한 사이버 기능: 경화 시스템에서 구멍을 뚫고, 각 단계에 사람없이 목표를 부여. 여전히 같은 시간에 동일한 산업에 존재하지 않는 방법 및 사이버 에이전트를 필요로하는 연구 에이전트. 1개의 숫자는 다른 것을 취소하지 않습니다.
두 번째 실수는 "우리는 시간이 있다"는 말보다 더 조용합니다. 남은 격차를 할 일 목록으로 취급하는 것입니다. 한 분야가 초지능이라는 이름의 벤치마크를 만들면 남은 작업은 점수판을 갖게 됩니다. 연구소들은 이미 점수판에 최적화합니다. 논문 자체의 표현인 "새벽에"는 정지가 아니라 활주로의 언어입니다.
같은 프로젝트에서 방법을 철회하는 것이 실제 시험입니다. 사람이 이미 실험을 선택하고 장비를 지정하며 성공 조건을 작성했다면 모델은 강해 보일 수 있습니다. 그것이 오늘날 대부분의 에이전트 데모입니다. 초지능-Bench는 그러한 지원이 제거되었을 때 남는 것이 무엇인지 묻습니다. 시스템이 무엇을 시도할지 결정하고 작업을 실행하며 채점자가 확인할 수 있는 결과를 내놓을 수 있는가. 50.91에서 26.62로의 하락이 바로 그 지원의 크기입니다.
이 모든 것이 저자들의 새벽 비유를 믿을 것을 요구하지는 않습니다. 다만 과학 연구에서 마지막 인간 단계에 대한 공개 트랙을 연구 공동체가 막 세웠고 세계에 이를 채워 달라고 요청했다는 사실을 알아차리면 됩니다.
벤치마크가 겨냥하는 것을 만들지 마십시오
나카다 재단은 초지능-Bench 점수를 읽지 않습니다. 인공 superintelligence는 결코 건축되어야 합니다. Superintelligence는 인간에 의해 통제될 수 없습니다. 마지막 인간적인 방법을 인출하는 시험은 마지막 인간적인 역할의 시험입니다. 현재 에이전트는 테스트는 그것을 통과 하는 건물 에이전트에 대 한 안전 케이스.
과학 분야에서 일한다면 누가 이 경로를 가속화하는 것이 공공의 이익이라고 결정했는지 물어보십시오. 정부에서 일한다면 논문을 연구소들이 닫으려 할 것들의 지도로 대하십시오. 위험에 맞는 대응은 목적지가 폐쇄되었다고 명시하는 법입니다.