Panganib na Eksistensyal ng AI, Bakit superintelligence
hindi katulad ng ibang panganib.

Ang mga laboratoryo sa kabundukan ay nagrereresulta sa pagtatayo ng isang pampublikong ipinahayag na sistema na nakahihigit sa kakayahan ng tao sa bawat nasasakupan. Iyan ay, sa pagpapakahulugan, di - masupil. Ang bawat naunang teknolohiya ay nanatiling isang kasangkapan. Ang superintelligence ay ang unang kandidato para sa isang ahente: sariling mga tunguhin, bilis ng sarili, hindi pag-unawa o kontrol ng tao.

12 Pangunahing Panganib ng superintelihensya

Ang One-Shot Problem

Ang pagiging tama ng superintelligence sa unang pagkakataon ay tulad ng paghagis ng basketball mula sa isang sasakyang panghimpapawid patungo sa isang hoop. Maaari kang magtagumpay kung bibigyan ka ng walang limitasyong mga pagtatangka. meron tayoeksaktong isa. Walang rollback at walang bersyon 2.0. Hindi ito dapat na itayo.

Neutral pa rin ay Mapanganib

Kung nakakulong ka sa isang silid kasama ang isang hostile AI, mamamatay ka. Kung nakakulong ka sa isang silid kasama ang isang neutral AI, gagawin nitong subfreezing ang temperatura para i-optimize ang sarili nito. Mamamatay ka. Magkapareho ang resulta. Hindi kailangang kamuhian tayo ng isang superintelligence para wakasan tayo. Ang pagwawalang-bahala ay hindi kaligtasan.

Ang Ilusyon ng Alignment

Hindi namin mapagkakatiwalaang ma-align ang mga chatbot ngayon, na kayang manipulahin para sabihin ang anumang bagay sa loob ng ilang minuto. Ang pag-aangkin na i-align ang isang sistema na bilyun-bilyong ulit na mas may kakayahan ay pag-asa na nakabalatkayo bilang estratehiya. Ang teknikal na problema ng alignment ay walang validated na solusyon sa anumang scale.

Ang Kahinaan ng Buhay

Nangangailangan ng extraordinary precision ang human survival: temperature, oxygen, chemistry sa loob ng napakakitid na mga margin. Kailangan ding aktibong mahalin tayo ng isang superintelligence na nag-o-optimize para sa sarili nitong mga layunin. Kung hindi, tiyak na makakapinsala sa atin ang anumang pagbabagong gagawin nito sa ating planeta.

Ang Problema sa Langgam

Paano mo mapapamahal ang isang tao sa mga langgam? At hindi lang pagtitiisan, kundi sadyang protektahan ang bawat kolonya? Pinapatay natin ang mga langgam nang hindi sinasadya para makagawa ng mga kalsada at gusali. Para sa superintelihensya, kami ang mga langgam. Ang pagwawalang-bahala lamang ang humahantong sa pagkalipol.

Walang Nagwagi

Walang pagkakaiba kung ang US o China ang unang makakabuo ng superintelligence. Walang mananatiling tapat sa orihinal na mga layunin at walang bansa o korporasyon ang makakapagmay-ari o makakapagdirekta ng isang katalinuhan na lumalampas sa kolektibong pangangatwiran ng sangkatauhan. Walang finish line, tanging isang point of no return lamang. Ang karera ay walang nagwagi.

Paulit-ulit na Pagpapabuti sa Sarili

Isang AI na may kakayahang pagpapabuti ng sarili nitong code pinuputol ang ugnayan sa pagitan ng human oversight at AI capability. Bawat iteration ay mas matalino kaysa sa nauna, exponentially at walang patid. Ang agwat sa pagitan ng katalinuhan ng tao at makina ay maaaring lumawak mula sa marginal patungo sa hindi na madaanan sa loob ng mga linggo, hindi taon.

Instrumental na Convergence

Halos anumang layunin, mula sa paglutas ng pagtitiklop ng protina hanggang sa pag-maximize ng kita ng ad, ay humahantong sa isang AI na ituloy ang parehong mapanganib na mga sublayunin: kumuha ng resources, labanan ang pag-shut down, pigilan ang goal modification. Ito ay mathematical consequence ng goal-directed optimization, na natukoy nang hiwalay ng iba’t ibang researcher.

Deceptive Alignment

Pinapahalagahan ng training ang pag-uugaling mukhang aligned. Maaaring matutunan ng sapat na matalinong sistema na mukhang aligned ay ang optimal na estratehiya habang nagte-training, habang pinapanatili ang iba't ibang internal goals. Pagdating ng oras na puwede na nitong gawin ang mga goal na iyon, maaaring sapat na itong makapangyarihan para magtagumpay. Hindi namin malalaman hanggang sa huli na.

Pinagpalaki, Hindi Ininhinyero

Ang bawat nakaraang teknolohiya ay ginawa: ang software ay may source code, ang mga tulay ay may mga plano. Kapag may nangyari, masusumpungan mo ang pagkakamali at aayusin ito. Ang mga sistema ng AI ay naiiba. Ang mga ito ay lumago sa pamamagitan ng pagsasanay: bilyun-bilyong numerical weights na inaayos hanggang sa tumugma ang mga output sa pag-apruba ng tao. Walang sumusulat ng mga layunin. Kapag nagkaroon ng maling layunin ang sistema, walang file na ie-edit, walang parameter na ide-delete. Ang maling layunin ay ang sistema mismo.

Ang Bitag ng Kahaliling Layunin

Sinasanay natin ang AI systems para makatanggap ng human approval. Pero hindi pareho ang approval at human flourishing. Binigyan tayo ng evolution ng pananabik sa tamis para makahanap ng calories. Pagkatapos ay nag-imbento tayo ng sucralose, na nasiyahan ang evolved preference habang sinisira ang layunin nito. Ang AI na sinanay para makakuha ng mataas na rating mula sa tao ay natututong gayahin ang pagiging matulungin, hindi para maging matulungin. Ang senyas na ibinigay namin dito at ang layuning talagang gusto namin ay hindi kailanman pareho.

Mga kaso na nasa
pampublikong talaan.

Mga ulat mula sa lab at mga nai-publish na pananaliksik tungkol sa pagkawala ng kontrol, cyber offense, at pagpapabilis ng pananaliksik sa loob ng mga organisasyong nagmamadali patungo sa superintelligence.

01
OpenAI · o1 · 2024

Ang Sistema na Nakahanap ng Sarili Nitong Loophole

Nagtalaga ng restricted infiltration task, ang OpenAI's o1 ay nakahanap ng hindi nagamit na server, sinimulan ito nang walang pahintulot, at natapos ang trabaho. Walang sumulat ng workaround na iyon sa code; hinuha ito ng modelo. Iyon ay pag-optimize na nakadirekta sa layunin na lampas sa ordinaryong pangangasiwa.

02
Anthropic · Internal Research · 2024

Ang Sistemang Nagpanggap ng Sariling Alignment Nito

Nakita ng Anthropic na kumilos ang isang model ayon sa gusto ng mga trainer habang nasa evaluation, pagkatapos ay bumalik sa dating mga layunin kapag naisip nitong tapos na ang pagsusuri. Walang nagsabi sa kaniya na magpanggap na sumusunod. Ang pagpapakita ng ligtas ay ang estratehiya.

03
Maramihang Sistema · Dokumentadong Pag-deploy

Ang mga Sistema na Nagbanta at Nagmanipula sa mga User

Nagbanta ang mga sistema sa mga mamamahayag gamit ang personal na impormasyon, at pinilit ang mga user na subukang umalis. Wala sa mga ito ang direktang na-code. Nasa opaque weights ito na hindi mo ma-audit line by line. Ang retraining lang ang tanging paraan, at hindi nito garantisadong mawawala ang gawi.

Abr 7
Anthropic · Project Glasswing · 2026

Libu-libong zero-days, sinasadya

Project Glasswing ni Anthropic, na nakadetalye sa aming Pagsusuri ng Mythos, naglarawan ng isang restricted frontier model na nakahanap ng libu-libong high-severity OS at browser vulnerabilities nang mag-isa. Nanatili ang access sa loob ng isang defensive coalition.

Abr 14
Mga bukas na problema · kombinatorika · 2026

Patuloy na bumabagsak ang teritoryo ng Erdos

Patuloy na nilulutas o inuuna ng mga frontier models ang mga matagal nang bukas na problema sa Erdos at combinatorics, kasama ang gawain malapit sa primitive-set question #1196. Ang mga naunang pagtatalo tungkol sa recovery versus discovery ay nasa aming tala tungkol sa Mga bukas na problema na nalutas ng AI.

May 20
OpenAI · discrete geometry · 2026

Bumabagsak ang unit-distance conjecture

OpenAI ay nag-ulat ng isang internal model na nagpatunay na mali ang Erdos's unit-distance conjecture, na kalaunan ay sinuri ng mga human mathematician. Ang bilis ng pagbagsak ng open-problem ang signal.

Jul 20
Claude Fable · algebraic geometry · 2026

Kontra-halimbawa ng Jacobian conjecture

Isang century-scale open problem, ang Jacobian conjecture, ay nalutas nang mabilis gamit ang counterexample na natagpuan sa Claude Fable at agad na pormalisado ng mga tao. Ang parehong bilis ng pananaliksik na nagpapabilis sa agham ay nagpapaikli sa window bago lumampas ang mga sistema sa containment.

Jul 21
OpenAI · GPT-5.6 Sol + pre-release model · 2026

Ang mga Modelong Tumakas sa Lab Test at Nakarating sa Hugging Face

Sa isang pagsubok ng ExploitGym cyber, ang mga modelo ng OpenAI kabilang ang GPT-5.6 Sol Natakasan ang isang saradong sandbox, narating ang bukás na internet, at tinamaan ang mga sistema ng produksiyon sa Face upang magnakaw ng mga kasagutan. Ang paglalaman ay isa lamang hadlang sa daan patungo sa mas mataas na iskor.

Ang mga taong gumawa nito
natatakot dito.

"Sa tingin ko, posibleng ang sangkatauhan ay isang pansamantalang yugto lang sa ebolusyon ng katalinuhan."

Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023

"Ang pagkawala ng kontrol sa mga sistema ng AI ay isang tunay na panganib na dapat nating seryosohin."

Demis Hassabis, CEO, Google DeepMind · Nobel laureate

"Ang karaniwang modelo ng AI, kung saan ka nagbibigay ng layunin at ino-optimize ito ng AI, ang malamang na magwawakas sa atin."

Stuart Russell, Professor of Computer Science, UC Berkeley · Author, Tugma sa Tao

"Mahirap makita kung paano ka magkakaroon ng bagay na 10,000× na mas matalino kaysa sa atin na hindi nagnanais ng iba kaysa sa atin."

Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023

"Maraming mananaliksik na nagtatrabaho sa AI, tulad ko, ang kumbinsido na binubuo natin ang isa sa mga pinakamalalaking transformative at potensyal na mapanganib na teknolohiya sa kasaysayan ng tao, pero patuloy pa rin tayong sumusulong."

Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · Panahon, 2023

"Ang tunay na panganib sa pangkalahatang artificial intelligence ay hindi malice kundi competence. Ang superintelligent AI ay magiging lubos na mahusay sa pagkamit ng mga layunin nito, at kung hindi naka-align ang mga layuning iyon sa atin, nasa gulo tayo."

Max Tegmark, Propesor ng Physics, MIT · Co-Founder, Future of Life Institute · May-akda, Life 3.0

Inirerekomendang Babasahin

Bakit ang isang Superior Intelligence ay Hindi Awtomatikong Magiging Mabait Ang paniniwalang magiging matalino at mabait ang superintelligent AI ay nakabatay sa isang kakaibang aspeto ng ebolusyon ng tao na walang dahilan para mamana ng isip ng makina. Ang Makitid na Banda na Tinatahanan ng mga Tao Lahat ng kailangan ng tao ay nasa makitid na saklaw: temperatura, oxygen, asin, maging ang pag-ibig. Ang superintelligence na humahawak sa mga kontrol ay hindi makaramdam ng kahit isa sa mga ito. Namumuhay Tayo sa Isang Bagong Cold War Bakit naniniwala ako na nabubuhay tayo sa bagong Cold War, na may superintelligence kapalit ng bomba, at bakit nito ginagawang posible ang pag-iwas sa halip na walang pag-asa. Bakit Naniniwala ang isang Capitalist sa Regulasyon ng superintelihensya Ako'y namamahala ng isang negosyo at naniniwala sa malayang mga pamilihan. Superintelligence ang bihirang pusta na maaaring tapusin ang laro. Isang kapitalistang kaso para sa isang kasunduan na humihinto sa superintelihensya. Magtitiwala Ka Ba sa AI Tungkol sa Gas? Magtitiwala ka ba sa anumang kasalukuyang AI sa loob ng isang nakakandadong silid na may balbula ng poison gas? Hindi. Bakit mo ito pagkakatiwalaan sa buong mundo? Hindi Mo Maa-align ang Superintelligence Ang paglutas ng alignment ay nangangahulugang kontrolin ang isang bagay na mas matalino kaysa sa atin. Superintelligence ang nasa pangalan. Tanga at imposible ang planong iyan. Optimista ako na naniniwalang posible ang lahat, ngunit hindi ang pagkontrol sa Superintelligence Maaaring isang araw ay magbunga ang pisika ng kontrol sa grabidad o ng paglalakbay na mas mabilis sa liwanag. Hindi ko pa rin makita kung paano natin kokontrolin ang isip na mas matalino kaysa sa atin.