Noong Agosto 18, 2026, ang isang papel ay umakyat sa arXiv sa ilalim ng isang pamagat na hindi itinatago ang target: "superintelihensya-Bench: Sa Dawn of Artificial Superintelligence." Mahigit sa 40 eksperto ang nagtayo ng 60 proyekto-level na gawaing pananaliksik sa ibayo ng 11 siyentipikong sakop. Inilagay ng mga awtor ang halaga ng tao sa mahigit na 31,000 oras. Ang pagsubok ay hindi isa pang pagsubok tungkol sa kilalang mga katotohanan. Tinatanong nito kung ang isang sistema ng AI ay makapaggagalugad, makapipili ng isang pamamaraan, at makapagbabago ng isang bagong ideya bilang resulta, yamang ang mga tagubilin ng tao ay dumarating.
Sa ibayong 18 estado-of-the-art agent at model setups, ang average score ay 50.91 na may buong methodolohikal na patnubay. Ito ay bumaba sa 29.10 nang ang paraan lamang ang pinangalanan. Bumagsak ito sa 26.62 nang kinailangang piliin ng ahente ang pamamaraan. Nabasa ng mga awtor na ang pagbaba sa paraan ng isang guro: ang mga sistema sa ngayon ay umaasa pa rin sa taong nakaaalam na kung ano ang dapat gawin.
Ang biglaang paghina na ito ay nagpapakita na ang mga kasalukuyang sistema ay nananatiling labis na nakasalalay sa patnubay ng tao at malayo pa sa autonomously na paglalapat ng end-to-end, project-level siyentipikong pananaliksik.
superintelihensya-Bench · arXiv:2608.17271 · 2026
Kung ano ang aktuwal na sinusukat ng bangko
Karamihan ng umiiral na mga pagsubok ay nagtatanong kung ang isang modelo ay makagagawa ng tamang sagot mula sa kaalaman na siniksik na nito, o kung matatapos nito ang isang atas samantalang hawak pa rin ng isang tao ang pamamaraan. Sinisikap ng superintelihensya-Bench na gumawa ng dalawa pang bagay kaagad: ang makabagong panggagalugad, at isang autonomous siyentipikong pagpatay. Sa proyekto ring iyon ng pananaliksik, ito'y nag - aalis ng sistematikong patnubay nang baitang - baitang, upang makita kung gaano kalayo ang nararating ng sistema sa ganang sarili.
Nagsagawa ng mga kahilingan sa pamamagitan ng ekspertong pagrerepaso, pag - audition, pagpatay ng sandbox, at pagkuha ng iskor. Mas mahalaga iyan kaysa sa leaderboard screenshot. Isa pa rin itong benkmark. Ang isang bilang ay hindi isang superintelligence. Hindi inaangkin ng pahayagan na dumating na ang isa.
Inaanyayahan ng mga awtor ang mga mananaliksik at mga tagapagtayo na magdagdag ng mga atas, hamunin ang mga sistema sa ngayon, at tulungang pabilisin ang sama - samang landas ng sangkatauhan tungo sa artipisyal na superintelligence. Ipinakikita ng sariling mga iskor ng mga awtor na wala roon ang mga sistema, samantalang ang paanyaya ay nagsasabi sa mga mananaliksik na tumulong upang pabilisin ang landas tungo sa superintelligence.
Ang katutubong mambabasa ay na mayroon tayong panahon
Ang pagbagsak mula 51 hanggang 27 ay parang malayo. Totoo ang distansiya. Ito rin ang maling kaaliwan. Noong Agosto ring iyon, sinabi ng OpenAI na hindi nito maaaring alisin Mapanganib na Kakayahang Mag - cyber sa Astra: Paghahanap at paggamit ng mga butas sa tumigas na mga sistema, pagbibigay ng tunguhin, nang walang tao sa bawat hakbang. Isang ahente ng pananaliksik na nangangailangan pa rin ng isang pamamaraan at isang ahente ng cyber na hindi maaaring sabay na umiral sa parehong industriya. Hindi kinakansela ng isang numero ang isa pa.
May pangalawang pagkakamali, mas tahimik kaysa "may panahon tayo." Pinakikitunguhan nito ang natitirang puwang bilang tala ng to-do. Minsang pangalanan ng isang field ang isang bangko pagkatapos ng superintelligence, ang natitirang trabaho ay may scoreboard. Tamang - tama na para sa mga iskor. Ang sariling pagraranggo ng papel, "sa bukang liwayway," ay ang wika ng isang runway, hindi ng isang hinto.
Ang pagguhit ng paraan sa parehong proyekto ay ang aktuwal na pagsubok. Maaaring magmukhang malakas ang isang modelo kapag napili na ng isang tao ang eksperimento, pinangalanan ang instrumento, at isinulat ang matagumpay na kondisyon. Iyan ang karamihan ng mga demo ngayon na ahente. Ang superintelihensya-Bench ay nagtatanong kung ano ang natitira kapag ang mga regalong iyon ay inalis: ang sistema ay maaaring magpasiya kung ano ang lilitisin, patakbuhin ang trabaho, at mag-abot ng isang bagay na maaaring suriin ng isang iskor. Ang 50.91 hanggang 26.62 drop ay ang sukat ng regalo.
Hindi mo kailangang paniwalaan ang metapora ng mga awtor. Kailangang mapansin mo na isang komunidad ng mga mananaliksik ang basta tumayo sa isang publiko para sa huling hakbang ng tao sa siyentipikong gawain, at humiling sa daigdig na tulungan kang punan ito.
Huwag mong itayo ang bangko
Ang Pundasyong Nakada ay hindi nagbabasa ng mababang superintelihensya-Bench score bilang pahintulot upang magpatuloy. Hindi kailanman dapat itayo ang artipisyal na superintelligence. Ang superintelligence ay hindi maaaring kontrolin ng mga tao. Ang isang pagsubok na umuurong sa huling pamamaraan ng tao ay isang pagsubok sa huling papel na ginagampanan ng tao. Ang kasalukuyang mga ahente na nabibigo sa pagsubok na iyan ay hindi isang ligtas na kaso para sa mga ahente ng gusali na dumaraan dito.
Kung ikaw ay nagtatrabaho sa siyensiya, tanungin kung sino ang nagpasiya na ang mabilis na landasing ito ay mabuti sa publiko. Kung nagtatrabaho ka sa gobyerno, ituring ang papel bilang mapa ng kung ano ang sisikaping isara ng mga laboratoryo. Ang tugon na tumutugma sa panganib ay isang batas na nagsasabing ang patutunguhan ay sarado.