Bawat taon ay gumagastos ang mundo ng malaking halaga para gawing mas may kakayahan ang mga AI system, at isang rounding error lang para gawing survivable ang end state. Sa loob ng rounding error na iyon ay may isa pang pagkakamali: karamihan sa safety money ay nag-aakala pa ring itatayo ang superintelligence, at sinusubukang gawing "go well" ang kinalabasan na iyon.
Karamihan pa rin ng pera at prestihiyo ay napupunta sa pagpapaligtas ng karera, hindi sa pagtatapos ng karera patungo sa superintelihensya.
Ang palagay na iyan ang problema. Kung ang artipisyal na superintelligence ay isang teknolohiya na hindi natin kayang kontrolin, ang makatuwirang paggamit ng bihirang kabiserang pangkaligtasan ay ihinto ito sa paglikha, hindi upang pondohan ang isang mas palakaibigang bersiyon ng iisang lahi.
Ang ginagawa ng pera ngayon
AI safety, sa malawak na kahulugan, ay umaasa sa halos $190 milyon kada taon. Ang capability work ay tumatakbo sa sampu-sampung bilyon. Sa loob ng safety slice, malaking bahagi ang napupunta sa technical alignment: mas mahusay na oversight tricks, mas mahusay na red-teaming, mas mahusay na paraan para sanayin ang mga modelo na sabihin ang tamang bagay sa ilalim ng test conditions. Ang ilan sa gawaing ito ay kapaki-pakinabang para sa mga system ngayon. Halos wala sa mga ito ang napatunayang solusyon para sa system na mas matalino kaysa sa mga taong sumusubok dito.
Alam ito ng larangan. Ang mga papel tungkol sa deceptive alignment, goal misspecification, at evaluation gaming ay hindi lihim. Naglalathala ang mga lab ng mga resulta kung saan nag-iiskema ang mga modelo sa ilalim ng pressure. Ang tugon, madalas, ay humingi ng mas maraming alignment budget para mas ligtas ang susunod na training run. Nagpapatuloy ang mga training run sa parehong iskedyul.
Ang alignment pagkatapos ng katotohanan ay isang taya na patuloy nating nawawalan ng karapatang gawin
Kung ang daigdig ay magpapasa kailanman ng isang kasunduan na nagpapawalang - bisa sa karera tungo sa superintelligence, nanaisin natin ang bawat seryosong kagamitan na makukuha natin para sa mga sistemang umiiral na.
Ang paghahanay ng mga produkto bilang pangunahing plano samantalang ang mga laboratoryo ay patungo sa superintelligence ay itinuturing ang patutunguhan na permanente. Maaari nating piliin ang ating patutunguhan. Ang nuklear na mga arsenal, kimika ng ozone, at ang cloning ng tao ay may mga sandali nang ipasiya ng daigdig na ang ilang dulo ng estado ay hindi sulit sa natitirang panganib. Ang superintelligence ay kabilang sa listahang iyon nang permanente. Ang superintelligence ay hindi maaaring kontrolin.
Saan dapat mapunta ang pera sa halip
I-redirect ang alignment-for-superintelihensya na pondo patungo sa gawaing nagpapatupad ng hindi paglikha:
- Disenyo ng treaty, pagpapatunay, at chip-level compute governance na maaaring suriin sa mga hangganan.
- Public case-making na pinapanatiling legible ang layunin: ihinto ang superintelligence, hindi ang "slow AI" bilang isang malabong mood.
- Suporta sa mga whistleblower, transparency sa insidente, at independiyenteng ebalwasyon na nagpapataas ng gastos ng tahimik na paglukso sa kakayahan.
- Pag-oorganisa pampulitika para marinig ng mga mambabatas ang mga botante, hindi lang ang mga lobbyist ng lab.
Ang listahang iyan ay hindi gaanong kaakit - akit kaysa isang bagong paraan ng pagsasanay. Ito rin ang tanging talaan na tumutugma sa paraan ng pagkabigo. Ang isang superintelligence na mas mahusay nang kaunti sa tunog ay isa pa ring superintelligence. Kung ang daigdig ay tumatangging magtayo ng isa nito, ang pananaliksik tungkol sa pagkakahanay ay maaaring magpatuloy nang walang takdang petsa na nagwawakas sa pagkalipol.
Ang pagtutol mula sa loob ng lab
"Kung hindi natin masosolusyunan ang alignment, may iba pang gagawa nito nang hindi ligtas." Naririnig nang maayos: madalas naniniwala ang mga mananaliksik na nananatili sa frontier na ang kanilang presensya ang siyang kaligtasan. Minsan tama sila tungkol sa mga model release ngayon. Nabigo ang argumento sa limit. Ang lahi kung saan kailangan ng bawat team ng isa pang capability leap para pondohan ang safety work para sa susunod na leap ay nananatiling ang lahi pa rin, may badge lang.
Ang tanong ay isang kasunduang pandaigdig na may bisa, ang parehong uri ng instrumento na ginamit kapag ang panganib ay ibinahagi at ang insentibo na mandaya ay tunay. Ang di - tuwirang pagpipigil ng isang laboratoryo ay nag - aalis sa takbuhan. Ang pondong ibinibigay ay maaaring sumuporta sa pulitikang iyan. Hindi ito dapat humalili rito.
Pagkatapos ng kasunduan, magpatuloy kung gusto mo
Pagkatapos ng isang mabisa, mabisang pagbabawal sa superintelligence, ang pananaliksik tungkol sa mga sistema na umiiral na ay maaaring magpatuloy sa ilalim ng mga tuntunin na hindi itinuturing ang pagkalipol ng tao bilang isang tinatanggap na halaga sa eksperimento. Ang superintelligence ay hindi maaaring kontrolin ng mga tao. Bago ipatupad ang pagbabawal na iyan, bawat dolyar na nagpapadama sa karera ay isang dolyar na hindi ginugugol sa pagtatapos sa takbuhan.
Ilipat ang pera sa presipitasyon, batas, at beripikasyon.