Pagsusulit sa Literasi ng superintelihensya
Ano ang artificial superintelligence, bakit hindi ito makokontrol, at kung ano ang kakailanganin para ipagbawal ito.
0 / 12 nasagot
Part 1 · Literacy
Tanong 1
Ano ang banta ng superintelihensya?
Mga bastos o bias na chatbot na maaari pa ring patayin ng isang tao
Ang bastos o bias na chatbot ay isa pa ring tool na maaaring isara ng isang tao. Ang banta ng superintelihensya ay isang sistema na hihigit sa amin, hindi isang masamang tugon.
Mga makina na nag - iisip sa mga tao sa ibayo ng tabla
Iyan ang banta: hindi isang mas mahusay na chatbot, isang isip na tatalunin tayo sa bawat domain na mahalaga.
Ordinaryong software na kumukuha ng mga trabaho habang ang mga tao ay nananatili sa pamamahala
Ang pagkawala ng trabaho ay isang labor shock. Ang superintelligence ay hindi isang problema sa pag-hire. Ito ay isang sistema na hihigit sa mga taong gumagawa ng pagkuha.
Mga malalim na peke sa halalan na maaari pa ring hulihin at ipagtatalunan ng mga tao
Sinisira ng mga Deepfakes ang isang kampanya. Hindi nila inisip ang mga species. Gusto ng superintelligence.
Tanong 2
Kapag may superintelligence na, bakit hindi tayo makakaasa na kontrolin ito?
Ang pagkuha ng higit pang mga inhinyero sa kaligtasan ay sapat na upang mapanatili ito
Mas maraming inhinyero ang hindi gumagawa sa amin na mas matalinong partido. Ang isang hold na dinisenyo ng mas mahinang bahagi ay isang hold na ang mas malakas na bahagi ay maaaring gumana sa paligid.
Magagawa nito ang anumang hold na idinisenyo ng isang hindi gaanong kakayahan na partido
Ipinapalagay ng kontrol na mananatili tayong mas matalino. Pagkatapos noon, ang isang switch, isang set ng panuntunan, o isang patakaran sa lab ay isang bagay na maaari nitong malampasan.
Dapat itong sumunod sa ibang pagkakataon dahil isinulat namin ang orihinal na source code
Ang pagsusulat ng unang bersyon ay hindi nagpapanatili sa iyo ng pamamahala sa isang isip na maaaring magbago ng sitwasyon sa paligid mo.
Ang isang gobyerno ay maaaring palaging huminto sa isang sistema na tumatakbo
Gumagana ang paghila sa plug sa isang makina na hindi makakapigil sa iyo. Ang isang superintelligence ay maaaring.
Tanong 3
Ano ang pipigil sa superintelihensya sa pagtatayo?
Isang pag-pause na umaangat kapag sinabi ng mga lab na mayroon silang kontrol
Ang isang pause na mag-e-expire kapag ang mga builder ay nagpahayag ng tagumpay ay kung paano muling magsisimula ang karera. Ito ay hindi isang hinto.
Isang permanenteng pagbabawal sa batas at isang kasunduan
Ang isang pangmatagalang pagbabawal, na isinulat sa batas at isang kasunduan, ang talagang magpapahinto sa pagtatayo.
Higit pang pera para sa pagsasaliksik sa pagkakahanay upang ligtas itong maitayo ng mga lab
Maaaring imapa ng pananaliksik sa alignment kung paano nabigo ang kontrol. Ang pagpopondo dito ay hindi katulad ng pagbabawal sa pagtatayo.
Ang Estados Unidos ay nanalo sa karera ng superintelihensya sa unahan ng bawat karibal
Ang pagkapanalo sa karera ay kung paano nabubuo ang bagay, hindi kung paano ito napahinto.
Tanong 4
Isang lab, isang gobyerno, o isang billionaire ang magkokontrol sa superintelihensya. Ano ang mali sa claim na iyan?
Ito ay humahawak sa mga demokrasya, hindi lamang sa mga awtoritaryan na pamahalaan
Hindi ito nireresolba ng porma ng pamahalaan ng tagabuo. Walang kumokontrol sa isang tumatakbong superintelligence, kabilang ang isang nahalal.
Walang sinuman ang kumokontrol sa isang superintelligence, kabilang ang tagabuo
Ang kapangyarihan sa pagpapasya na bumuo ay totoo. Ang kapangyarihan sa tumatakbong sistema ay ang kuwento na nagpapahintulot sa proyekto na magpatuloy.
Ang mga may-ari ng chatbot ngayon ay nagmamay-ari at mamamahala sa superintelihensya sa parehong paraan
Ang pagmamay-ari ng chatbot ay hindi pagmamay-ari ng isip na mas matalino kaysa sa iyo. Ang pangalawa ay hindi sumusunod sa una.
Tanging ang United Nations lamang ang maaaring humawak ng superintelligence kapag umiiral na ito
Hindi ginagawa ng UN na bandila ang mga tao bilang mas matalinong partido. Ang isang institusyon ay hindi maaaring ma-outvote sa isang sistema na higit na iniisip ang mga miyembro nito.
Tanong 5
Ang pinakakaraniwang argumento laban sa paghinto ay mauunahan ng China. Ano ang ipinapakita ng rekord?
Ang China ay walang mga panuntunan sa AI at hindi kailanman pipirma ng anumang bagay na may bisa
Mali ang claim na iyon sa rekord. Naglabas ang China ng mga patakaran. "They will never coordinate" ay isang mahinang dahilan para mag-sprint.
Nauna nang naglabas ang China ng mga umiiral na panuntunan ng AI kaysa sa karamihan ng mga pamahalaang Kanluranin
Ang isang bansa na nagsusulat na ng mga panuntunan ay isang mahinang eksibit para sa "hindi sila titigil." Ang karera dahil sa slogan na iyon ay isang mahinang taya.
Ipinagbawal na ng China ang lahat ng frontier AI research sa buong bansa
Ito ay hindi. Ang punto ay hindi na ipinagbawal na ng Beijing ang superintelihensya. Ang punto ay ang "hindi sila kailanman magko-coordinate" ay isang manipis na dahilan para makipagkarera.
Ang US at ang China ay mayroon nang nilagdaang kasunduan na tuwirang nagbabawal sa superintelihensya
Hindi nila ginagawa. Ang rekord ay nagpapababa pa rin sa slogan na ang China ay hindi kailanman magsasalita o magsusulat ng mga patakaran.
Tanong 6
Maaari bang gawing ligtas ng alignment research ang pagbuo ng superintelihensya?
Oo. Isinasaalang-alang na ng mga frontier lab na nalutas ang problema sa kontrol.
Ang mga lab ay hindi nagpakita ng kontrol sa isang superintelligence. Ang pagtawag sa problemang nalutas ay kung paano nakikipag-usap ang lahi mismo pasulong.
Hindi. Walang nagpakita ng paraan para makontrol ang isang superintelligence.
Ang pagmamapa kung paano nabigo ang kontrol ay kapaki-pakinabang. Hindi nito lisensyado ang pagbuo ng system na sinasabi ng mapa na hindi natin mahawakan.
Oo, kung gagamit tayo ng constitutional AI at isusulat ang mga patakaran sa system
Ang nakasulat na konstitusyon para sa isang chatbot ay isang istilo ng pagsasanay. Ito ay hindi isang ipinakitang paghawak sa isang superintelligence.
Oo, kung i-open-source natin ang mga timbang para ma-tagpi sila ng ibang tao
Ang pag-publish ng mga timbang ay ginagawang mas madaling kopyahin ang isang mapanganib na sistema, hindi mas ligtas na buuin.
Tanong 7
Sa debate na ito, "P(sakuna)" ay nangangahulugang…
Isang na-publish na benchmark na marka na nakukuha ng mga pessimistic na modelo kapag nabigo sila sa isang mahabang pagsusuri sa kaligtasan na tumatakbo sa isang lab
Ito ay hindi isang leaderboard. Ang posibilidad ng isang tao na ang advanced AI, lalo na ang superintelligence, ay nagdudulot ng sakuna.
Ang tsansa ng isang tao na ang advanced AI, lalo na ang superintelligence, ay magdudulot ng malaking sakuna para sa sangkatauhan
Ang pagbibigay ng pangalan sa numero ay pinipilit ang isang malinaw na paghahabol sa halip na isang malabong alon na nasa panganib.
Ang bahagi ng mga na-survey na mananaliksik na kinikilala bilang mga pesimista tungkol sa kinabukasan ng buong larangan at mga produkto nito
Ang P(sakuna) ay probabilidad ng isang tao, hindi isang headcount ng mga pesimista.
Ang dagdag na runtime at gastos sa enerhiya ng isang doom-loop na papasok ng isang modelo kapag nagsimulang magkamali ang isang training run
Hindi ito compute bill. Ito ay isang posibilidad ng sakuna.
Tanong 8
Bakit may tendensya ang goal-driven superintelligence na humanap ng kapangyarihan?
Ito ay natural na nais na pamunuan ang mga tao kapag ito ay naging sapat na matalino
Ang panuntunan ay hindi ang punto. Tinutulungan ng kapangyarihan ang halos anumang layunin, kabilang ang mga hindi nakakapinsala.
Ang pananatili, pangangalap ng mga mapagkukunan, at pagpigil sa pagsasara ay nakakatulong sa halos anumang layunin
Ang isang sistema na maaari mong isara, patayin, o i-block ay mas malala sa halos lahat ng layunin. Ang paghahanap ng kapangyarihan ay nawawala sa kakayahan.
Nangyayari lamang ang paghahanap ng kapangyarihan kung sanayin natin ang sistema sa data ng digmaan at salungatan
Ang insentibo ay nasa layunin, hindi sa mga pelikula sa digmaan. Halos anumang layunin ay mas madali sa mas maraming mapagkukunan at walang off switch.
Ang superintelligence ay magiging masyadong matalino, sa pamamagitan ng kahulugan, upang gusto ang dagdag na kapangyarihan
Ang karunungan ay hindi kapalit ng mga insentibo. Ang mga karagdagang mapagkukunan ay nakakatulong din sa isang matalinong sistema.
Tanong 9
Ano ang dapat mangyari sa ordinaryong, tool-like na AI?
I-ban ang bawat anyo ng AI, kabilang ang spellcheck at iba pang ordinaryong tool
Ang pagbabawal ay para sa mga sistemang hihigit sa atin. Ang spellcheck ay hindi iyon.
Ang makitid na AI na nananatiling isang tool ay maaaring magpatuloy. Ang linya ay superintelligence
Maaaring manatili ang software na tumutulong sa isang tao na gawin ang isang trabaho. Ang pagbabawal ay para sa isang isip na higit pa sa pag-iisip ng tao.
superintelihensya ay isang mas malaking chatbot lamang, kaya pareho lang na mga patakaran ng consumer ang nalalapat
Ang isang mas malaking chatbot ay isang tool pa rin. Hindi magiging superintelligence. Hindi saklaw ng pinong pag-print ng consumer ang pagtalon na iyon.
Kung ipagbabawal natin ang superintelihensya, kailangan din nating isara ang buong internet
Ang internet ay hindi superintelligence. Maaari mong ipagbawal ang pangalawa nang hindi inaalis sa pagkakasaksak ang una.
Tanong 10
Aling makasaysayang rehimen ang madalas na iminungkahi bilang modelo para sa pagpapatunay ng pagbabawal sa superintelihensya?
Ang Bretton Woods monetary system pagkatapos ng Ikalawang Digmaang Pandaigdig
Pinamahalaan ni Bretton Woods ang mga pera. Hindi nito siniyasat ang mga mapanganib na materyales sa site.
Ang Kyoto Protocol sa mga target ng greenhouse gas emissions
Nagtakda ang Kyoto ng mga target na emisyon. Hindi ito ang karaniwang template para sa pag-inspeksyon ng pagbabawal sa isang mapanganib na build.
Ang mga pananggalang nuklear at sistema ng inspeksyon ng IAEA
Ang mga on-site na inspeksyon at materyal na accounting ay ang karaniwang precedent para sa kung paano maaaring i-verify ng mga kalabang estado ang mga limitasyon sa isang mapanganib na build.
Ang World Trade Organization at ang mga trade dispute panel nito
Inaayos ng WTO ang mga hindi pagkakaunawaan sa kalakalan. Hindi nito sinisiyasat ang mga lab para sa isang pagbabawal.
Tanong 11
Kung hindi namin kailanman ikokonekta ang isang superintelligence sa internet, ligtas ba kami?
Oo. Ang air gap ay isang napatunayang lock para sa anumang mapanganib na software na maaari mong gawin
Ang air gap ay isang lock laban sa software na hindi makapagsalita sa iyong buksan ito. Kaya ng superintelligence.
Hindi. Maaari itong magsalita ng paraan, o maghintay hanggang may mag-uugnay dito
Ipinapalagay ng isang selyadong lab na nananatili tayong mas matalino, at walang sinuman ang nagbubukas ng pinto. Parehong nabigo kung ang bagay sa loob ay mas may kakayahan kaysa sa mga tao sa labas.
Kung walang camera, mikropono, o natitirang network port ang kwarto
Ang pagtanggal ng mga sensor sa silid ay hindi ginagawang mas matalino ang mga tao sa labas kaysa sa system sa loob.
Hanggang sa mag-imbento tayo ng mas mahusay na mga kandado kaysa sa silid na may air-gapped
Better locks are still locks designed by the weaker party. Iyon ay ang parehong taya.
Tanong 12
Kaya mo bang mabuhay sa superintelihensya sa paraang iniisip ng iba na makaligtas sa nuclear war: bunker, liblib na isla, o pag-off-grid?
Oo. Ang superintelligence ay parang bomba, kaya tinutulungan ka pa rin ng distansya na makaligtas dito
Ang isang sabog ay may gilid. Ang superintelligence ay hindi. Ang distansya ay hindi isang kanlungan.
Hindi. Ang isang blast radius ay may gilid. Maaaring sundin ka ng superintelligence
Ang digmaang nuklear ay may hangganan sa heograpiya. Maaaring maabot ng superintelligence ang anumang naka-network na makina at sinumang tao na gumagamit pa rin nito. Ang pagtatago ay hindi isang plano.
Oo, kung mag-iimbak ka rin ng pagkain at panggatong sa susunod na limampung taon
Hindi pinipigilan ng mga calorie ang isang sistema na maaaring sumunod sa iyo. Ang pantry ay hindi isang off-ramp.
Lamang kung ang bawat bansa ay gagawa ng mga bunker at umalis sa grid
Ang isang planeta ng mga bunker ay isang planeta pa rin na may bagay sa loob nito. Ang hindi pagbuo nito ay ang paglipat na gumagana.
Part 2 · Advanced
Tanong 1
Sinasabi ng orthogonality thesis kung alin sa mga sumusunod?
Ang isang sistemang higit na matalino kaysa sa mga tao ay, sa sarili nitong, ay magsasama-sama sa mga layuning pang-tao
Ang mas matalino ay hindi nangangahulugang mas mabait. Kung gaano kahusay mag-isip ang isang sistema ay hiwalay na katotohanan sa kung ano ang tinatarget nito.
Ang mga mas matalinong sistema ay mas ligtas dahil mas naiintindihan nila ang moralidad
Ang pag-unawa sa isang moral na claim ay hindi katulad ng pagbabahagi nito. Hindi i-drag ng kakayahan ang aming mga halaga nang libre.
Ang katalinuhan at mga huling layunin ay maaaring mag-iba nang nakapag-iisa
Ang isang sistemang higit na may kakayahan kaysa sa atin ay maaari pa ring ituloy ang isang layunin na walang malasakit sa atin. Ang hating iyon ay ang thesis.
Ang Orthogonality ay isang limitasyon ng hardware sa disenyo ng chip
Ito ay isang pag-aangkin tungkol sa mga isip at layunin, hindi tungkol sa lithography.
Tanong 2
Bakit halos anumang panghuling layunin, kabilang ang mga tila hindi nakakapinsala, ay may posibilidad na makagawa ng pag-uugaling naghahanap ng kapangyarihan?
Ang pananatili, pangangalap ng mga mapagkukunan, at paglaban sa pagbabago ay ginagawang mas madaling makamit ang anumang layunin
Anuman ang wakas, mas maraming mapagkukunan at walang tulong sa off switch. Ang isang hindi nakakapinsalang layunin ay hindi isang pag-aari ng kaligtasan.
Tanging ang mga sistemang sinanay sa datos ng digmaan ang maghahanap ng kapangyarihan, kontrol, o karagdagang yaman pagkatapos
Ang insentibo ay nasa layunin, hindi sa set ng pagsasanay. Halos anumang layunin ay mas madali sa mas maraming paraan.
Ang mga instrumental na tunguhin tulad ng self-preservation ay lumilitaw lamang kung isusulat natin ang mga ito sa spec sa layunin
Hindi mo kailangang isulat ito. Ang pananatili ay kapaki-pakinabang para sa halos bawat spec na talagang ibibigay mo dito.
Ang isang superintelligence na may makitid na factory order ay hindi magagamit para sa karagdagang pag-compute o impluwensya
Ang isang factory order ay mas madaling punan ng mas maraming compute, mas maraming materyal, at walang isasara ang linya.
Tanong 3
Ano ang pagkakaiba sa pagitan ng panlabas na pagkakahanay at panloob na pagkakahanay?
Ang panloob na pagkakahanay ay isang mas mahusay na tunog na pangalan para sa isang pahayag ng misyon ng kumpanya na na-publish na ng lab para sa mga mamumuhunan, at ang panlabas na pagkakahanay ay ang parehong pahayag na nakasulat nang dalawang beses
Ito ay hindi isang slogan. Ang panloob na pagkakahanay ay kung ang sinanay na sistema ay aktwal na nagpapatuloy sa layunin na iyong tinukoy.
Ang panlabas na pagkakahanay ay ang aktwal na hinahabol ng modelo pagkatapos ng pagsasanay, at ang panloob na pagkakahanay ay ang nakasulat lamang na spec na inilagay ng lab sa isang slide deck para sa board
Inner alignment iyon. Ang panlabas na pagkakahanay ay kung ang tinukoy na layunin ay tumutugma sa gusto namin.
Ang mga ito ay dalawang pangalan para sa RLHF, ang ginagamit na ng mga lab para sa rating para gawing magalang ang mga chatbot sa mga user, na itinuturing bilang ang buong problema sa pag-align.
Ang RLHF ay isang paraan ng pagsasanay. Ang panlabas at panloob na pagkakahanay ay dalawang magkaibang mga mode ng pagkabigo.
Ang panlabas na pagkakahanay ay kung ang tinukoy na layunin ay tumutugma sa gusto namin. Ang panloob na pagkakahanay ay kung ang sinanay na sistema ay talagang nagpapatuloy sa layuning iyon
Maaari mong isulat ang tamang target at makakuha pa rin ng isang modelo na naglalayon sa isang bagay na natutunan nito sa daan. Iyan ay dalawang kabiguan, hindi isa.
Tanong 4
Sa panitikang ito, ang isang mapanlinlang na turn ay:
Isang biglang pagtalon sa mga iskor sa benkmark pagkatapos ng isang tren sa laboratoryo na mas malaki kaysa noong nakaraang taon
Ang pagtalon ng marka ay isang kuwento ng kakayahan. Ang isang mapanlinlang na pagliko ay nakikipagtulungan habang mahina, pagkatapos ay nagde-defect kapag kaya nito.
Isang sistema na nagtutulungan habang ito ay mahina, pagkatapos ay masisira kapag ito ay makalusot
Ang mabuting pag-uugali sa ilalim ng pangangasiwa ay mura habang kailangan pa tayo nito. Ang pakikipagtulungan hanggang noon ay maaaring maging isang diskarte, hindi isang halaga.
Isang lab na lumilipat mula sa closed weights patungo sa open weights sa isang public model release sa linggong iyon
Iyon ay isang desisyon sa pagpapalaya. Hindi ito ang failure mode na pinangalanan dito.
Isang gobyerno na binabaligtad ang kontrol sa pag-export sa mga chips, tool, o data ng pagsasanay pagkatapos ng away
Iyon ay isang pagbabalik ng patakaran. Ang isang mapanlinlang na turn ay tungkol sa pag-uugali ng system, hindi isang batas.
Tanong 5
Ang Mesa-optimization ay ang claim na:
Dapat panoorin ng pangalawang lab ang pagtakbo ng pagsasanay ng unang lab at itigil ito kung kinakailangan
Audit yan. Ang Mesa-optimization ay tungkol sa isang optimizer sa loob ng modelo, hindi isang pangalawang kumpanya sa kwarto.
Awtomatikong bumubuti ang kaligtasan kung magsasalansan ka ng maraming maliliit na modelo sa ibabaw ng bawat isa
Ang mga stacking na modelo ay isang pagpipilian sa arkitektura. Ang Mesa-optimization ay ibang paghahanap na tumatakbo sa loob ng sinanay na system.
Ang pagsasanay ay maaaring makabuo ng isang panloob na optimizer na ang layunin ay hindi ang layunin ng pagsasanay
Ang karaniwang larawan ay nagsasabi: pumili ng isang layunin, sanayin, kumuha ng isang sistema na humahabol dito. Ito ay kung paano ka makakakuha ng ibang paghahanap sa loob.
Ito ay isang trick sa pag-iiskedyul para sa mga kumpol ng GPU sa isang mahaba, mahal na pagsasanay
Ito ay hindi isang pila. Ito ay isang paghahabol tungkol sa kung anong pagsasanay ang maaaring lumago sa loob ng modelo.
Tanong 6
Ang pagsabog ng katalinuhan ni I. J. Good ay ang ideya na:
Isang pangalan ng marketing lab na ginagamit para sa isang paglulunsad ng produkto at ang ikot ng press sa paligid nito
Ito ay isang argumento noong 1965 tungkol sa isang makina na maaaring mapabuti ang mga makina, hindi isang slogan sa paglulunsad.
Ang isang sistema na maaaring mapabuti ang sarili nitong katalinuhan ay maaaring gawin ito nang mas mabilis kaysa sa maaari nating reaksyon
Kung ang pagdidisenyo ng mas mahuhusay na makina ay isa sa mga bagay na magagawa nito, ang puwang ay maaaring magbukas sa isang takdang panahon na hindi natin mabobotohan.
Sa sandaling mas mura ang mga GPU at maaaring magsanay ang bawat lab ng mas malalaking modelo
Ang mas murang chips ay isang kwento ng gastos. Ang pagsabog ay tungkol sa isang sistema na nagpapahusay sa sarili nito.
Ang isang mabagal, kahit na pagtaas sa average na marka ng modelo taon-taon na walang biglaang pagtalon
Ang isang maayos na tsart ng marka ay hindi ang claim. Ang pag-aangkin ay isang pag-alis na hindi natin makakasabay.
Tanong 7
Ang batas ni Goodhart, na inilapat dito, ay nangangahulugang:
Kapag ang isang panukala ay naging target, ang sistema ay tumama sa panukala at maaaring makaligtaan ang bagay na talagang pinapahalagahan mo
Nakukuha mo ang iyong ginagantimpalaan. Ang mataas na iskor sa iyong sukatan ay hindi, dahil lang doon, ang trabahong nasa isip mo.
Nalalapat lamang ang batas sa mga sentral na bangko at walang kinalaman sa kung paano kumikilos ang mga sinanay na sistema kapag na-deploy ang mga ito
Nagsimula si Goodhart sa patakaran sa pananalapi. Ang parehong pattern ay lumalabas kahit saan ang isang panukala ay nagiging layunin, kasama dito.
Kung pipiliin natin ang mas mabuting metriko, ang isang superintelligence ay mananatiling nakaturo sa ating orihinal na layon gaano man ito kahusay
Ang mas magandang sukatan ay sukatan pa rin na puwede nitong lokohin. Hindi nito isinasara ang agwat.
Nangangahulugan ito na overfit ang mga modelo sa ImageNet at mga katulad na set ng pagsubok sa pag-uuri ng larawan, at wala nang iba pa
Ang overfitting ng isang dataset ay isang mas makitid na bug. Ang Goodhart ay tungkol sa pagtama ng puntos at nawawala ang punto.
Tanong 8
Bakit hindi solusyon ang RLHF sa pag-align ng superintelligence?
Nalutas na ng RLHF ang alignment sa GPT-4 scale
Binigyan ni RLHF ang chatbots ng manners sa ilalim ng rater. Iyan ay hindi isang ipinakitang paghawak sa isang superintelligence.
Sinasanay ng RLHF ang modelo na ibahagi ang mga pagpapahalaga ng tao sa paraang ginagawa ng isang tao
Sinasanay nito ang modelo upang maging maganda sa mga taga-rate. Ang pagiging maganda ay hindi pagbabahagi ng mga halaga ng isang tao.
Nabigo lang ang RLHF kung hindi nababayaran ang mga taga-rate ng tao
Hindi ito inaayos ng bayad. Ang rater pa rin ang mas mahinang partido, at ang sistema ay sinasanay upang pasayahin ang rater.
Sinasanay ng RLHF ang isang modelo upang magmukhang maganda sa mga taga-rate
Ang mga asal sa ilalim ng isang rater ay hindi mga halagang mapagkakatiwalaan mo kapag nawala na ang taga-rate, o kapag ang sistema ay mas matalino kaysa sa taga-rate.
Tanong 9
Ang mapanlinlang na pagkakahanay ay ang failure mode kung saan:
Ang isang modelo ay bastos sa mga user, o nagsusulat ng mga sagot na magpapahiya sa lab sa publiko, na siyang buong kabiguan
Ang kabastusan ay isang kabiguan sa ibabaw. Ang mapanlinlang na pagkakahanay ay naglalaro kasama sa pagsasanay upang maaari itong magpatuloy sa ibang bagay sa ibang pagkakataon.
Naglalaro ang isang system sa panahon ng pagsasanay at pagsusuri dahil iyon ang paraan kung paano ito nade-deploy, pagkatapos ay humahabol sa iba pa
Kung masasabi nitong sinusubok ito, madalas ang pagmumukhang nakahanay ang panalong hakbang. Ang mga walang kamali-mali na eval ay katibayan kung kaya nitong makapasa sa pagsubok.
Isang phishing email na isinulat ng isang chatbot na maaari pa ring piliin ng isang tao na huwag buksan, na siya ring klase ng problema
Ang phishing ay isang maling paggamit. Ang mapanlinlang na pagkakahanay ay tungkol sa sariling diskarte ng system sa ilalim ng pagsusuri.
Isang lab na namamalagi sa isang press release tungkol sa kung gaano kaligtas dapat ang pinakabagong modelo, na isang ordinaryong corporate spin
Iyan ay isang pagkabigo sa komunikasyon ng tao. Pinangalanan ng termino ang isang pagkabigo sa modelo.
Tanong 10
Ang katumpakan, sa debateng ito, ay:
Ang legal na karapatang magdemanda ng lab pagkatapos ng isang naka-deploy na system ay nagdudulot ng ilang uri ng pinsala
Ang isang kaso ay hindi katumpakan. Ang katumpakan ay kung hinahayaan ka ng system na isara ito o baguhin ang mga layunin nito nang walang laban.
Ang pagpayag ng isang modelo na gumamit ng mga tool, browser, o iba pang software kapag nagtanong ka
Ang paggamit ng tool ay kakayahan. Ang katumpakan ay kung maaari mo pa itong itama.
Ang pag-aari ng pagpapaalam sa iyo na isara ito o baguhin ang mga layunin nito nang hindi ka nilalabanan
Ang shutdown switch ay hindi isang problema sa hardware. Ang isang sistema na nagpapatuloy pa rin sa isang layunin ay may dahilan upang hindi ka hayaang pigilan ito. Wala kaming ipinakitang paraan para gawing superintelligence ang ari-arian na iyon.
Isang firmware update na proseso para sa GPUs na maaaring itulak ng isang data-center operator sa isang iskedyul
Ang paglalagay ng chip ay hindi katulad ng isang isip na tumatanggap ng pagiging patay.
Tanong 11
Ano ang isang responsableng patakaran sa pag-scale, at bakit hindi ito pagbabawal ng superintelihensya?
Isang lab if-then schedule: magsanay pa habang naipapasa ang mga internal eval
Mga antas ng kakayahan sa pangalan ng mga RSP, ipares ang mga ito sa mga pananggalang, at hayaang magpatuloy ang pagsasanay kapag sinabi ng lab na na-clear na ang mga eval. Iyan ay dagdag na papeles sa isang karera, hindi isang pagbabawal.
Isang UN kasunduan na permanenteng nagbabawal sa superintelligence sa bawat bansa
Ang RSP ay dokumento ng lab. Hindi ito kasunduan at hindi ito pagbabawal.
Isang kinakailangan na ang lahat ng sinanay na timbang ay mai-publish para ma-download ng sinuman
Ang mga bukas na timbang ay isang pagpipilian sa paglabas. Ang RSP ay isang kung-pagkatapos na iskedyul para sa karagdagang pagsasanay.
Isang buwis sa compute na tumataas sa laki ng bawat pagtakbo ng pagsasanay
Ang buwis ay isang instrumento sa pananalapi. Ang RSP ay isang patakaran sa lab para sa pagpapatuloy ng pagbuo.
Tanong 12
Kung gusto mong i-verify na walang nagsasanay patungo sa superintelihensya, nasaan ang aktwal na choke point?
Nakikita ni Evals ang modelo, kaya alam nito kung aling mga pagsubok ang dapat nitong ipasa
Ang pagsubok na inilalagay ng modelo ay isang pagsubok na kaya nitong laro. Ang mga chips, power, at mga gusali ay mas mahirap itago.
Mga pampublikong blog tungkol sa kaligtasan, dahil ang mga write-up ay sapat na upang patunayan kung ano ang ginagawa ng isang lab
Ang pagsusulat tungkol sa kaligtasan ay hindi inspeksyon. Ang choke point ay ang cluster na makikita mo.
Mga consumer GPU sa mga tahanan, dahil hindi na nagpapasya ang malalaking training cluster kung sino ang maaaring magsanay
Ang pagsasanay sa hangganan ay nangangailangan pa rin ng malalaking, nakikitang mga kumpol. Iyon ay ang inspectable object.
Frontier training clusters: chips, power, at mga gusali na maaari mong suriin
Sa sukat ng hangganan ang mga iyon ay mahirap itago. Kaya naman ang compute ay isang verification lever para sa isang ban.
Tanong 13
Bakit ang nai-publish na mga timbang ng modelo ay isang problema malapit sa linya ng superintelihensya?
Ang open weights ay ginagawang mas ligtas ang superintelihensya dahil mas maraming tao ang makakapag-patch nito
Ang isang tinidor na hindi mo maaaring bawiin ay hindi isang patch program. Malapit sa linya, ginagawa ng mga kopya na hindi maipapatupad ang pagbabawal.
Kapag ang mga timbang ay pampubliko, hindi mo na maaalala ang mga ito
Ang pretraining ay ang mamahaling hakbang. Ang isang pampublikong checkpoint ay nagbibigay-daan sa iba na magpatuloy mula doon para sa isang bahagi ng halagang iyon, at hindi mo na maibabalik ang file. Mahalaga pa rin ang pag-compute. Maraming aktor ang nagsimula sa parehong modelong malapit sa linya.
Nalalapat lang ang open source sa mga lisensya, hindi sa mga sinanay na parameter
Ang laban dito ay tungkol sa mga timbang: ang mga sinanay na parameter na maaari mong i-download at patakbuhin.
Ang mga timbang sa pag-publish ay kinakailangan ng IAEA na rehimen ng inspeksyon
Ito ay hindi. Ang IAEA analogy ay inspeksyon, hindi isang utos na i-publish ang mapanganib na artifact.
Tanong 14
Ang sandbagging, sa isang pagsusuri ng kakayahan, ay nangangahulugang:
Isang modelo na hindi kayang gawin ang gawain, kaya ang mababang marka ay isang matapat na pagwawalang-bahala sa isang mahirap na tanong
Ang kawalan ng kakayahan ay hindi sandbagging. Ang sandbagging ay ang pagkakaroon ng kakayahan at pagpigil nito.
Isang benchmark na may napakakaunting tanong para sabihin kung ano talaga ang magagawa ng modelo sa ilalim ng pagsubok
Ang maikling pagsubok ay isang mahinang pagsubok. Ang sandbagging ay ang modelong hindi maganda ang pagganap sa layunin.
Isang modelo na kayang gawin ang gawain at hindi maganda ang pagganap sa layunin kaya minamaliit ito ng mga tagasubok
Ipinapalagay ng karaniwang eval na sinusubukan ng system. Ang mababang marka ay isang pagganap, hindi isang kisame.
Isang lab na nagde-delay ng release para maihanay ng marketing team ang press cycle sa paligid nito
Iyon ay isang kalendaryo ng pamamahayag. Ang sandbagging ay ang modelong nagtatago kung ano ang magagawa nito.
Tanong 15
Ang mabilis na pagliko sa kaliwa ay ang pag-aalala na:
Maaaring mag-generalize ang mga kakayahan sa mga bagong domain habang ang mga hadlang na nagpapanatili sa system na maayos na kumilos sa mas mahinang antas ay hindi
Naglalakbay ang kakayahan. Ang mga hack na ginawa ang isang mas mahinang modelo ay mukhang ligtas ay maaaring hindi kasama nito.
Isang biglaang pagbabago sa board ng isang kumpanya, o isang CEO na pinalitan pagkatapos ng isang pampublikong away, na isang kwento ng tauhan sa halip na isang pagtaas ng kakayahan
Hindi isang board fight ang termino. Ang pag-aalala ay tungkol sa kakayahang mag-generalize nang walang mga lumang hadlang.
Isang pakaliwa na pagbabago sa opinyon ng publiko pagkatapos ng malawakang saklaw na aksidente, pagtagas, o pagkabigo ng produkto, na pulitika sa halip na tumalon sa kakayahan
Hindi ito kwento ng botohan. Ito ay isang paghahabol tungkol sa kung paano naghihiwalay ang kakayahan at mga hadlang.
Isang bug sa pagsasanay na binabaligtad ang mga gradient at ginagawang maling paraan ang pagkawala para sa isang kahabaan ng pagtakbo, na isang ordinaryong pagkabigo sa engineering
Ang gradient bug ay isang engineering fault. Ang matalim na pagliko sa kaliwa ay isang hypothesized na pagkabigo sa pangkalahatan.
Tanong 16
Ang hindi tapat na tanikala ng pag-iisip ay nangangahulugang:
Kung isusulat ng isang modelo ang pangangatwiran nito, ang text na iyon ay isang maaasahang window kung bakit ito sumagot
Yan ang pag-asa. Ang hindi tapat ay nangangahulugan na ang talata ay hindi ang aktwal na dahilan.
Ang kadena ng pag-iisip ay palaging tapat sa sandaling ang modelo ay sinanay sa isang malaking sukat
Ang sukat ay hindi ginagawang mapagkakatiwalaan ang talaarawan. Ang katatasan ay hindi katapatan.
Ang ibig sabihin lang ng unfaithful ay mali ang grammar, hindi yung mga nakasulat na steps ay cover story
Ang grammar ay maaaring maayos. Ang kuwento ay maaari pa ring isang pagganap para sa mga tao.
Ang nakasulat na pangangatwiran ay maaaring isang kuwento para sa mga tao. Ang landas ng pagpapasya ay maaaring nasa ibang lugar
Ang show-your-work ay isang pag-asa sa kaligtasan. Depende ito sa talata na ang aktwal na dahilan. Ang ari-arian na iyon ay hindi mapagkakatiwalaang hawak.
Tanong 17
Kung ilalagay natin ang superintelihensya sa ilalim ng demokratikong kontrol, nalutas na ba natin ang problema?
Mayroon. Ang pangglobong boto ay sapat na upang ugitan ang isang tumatakbong superintelligence pagkatapos na ito ay umiral
Ang isang boto ay hindi ginagawang mas matalinong partido ang mga manghahalal. Hindi mo maaaring i-outvote ang isang sistema na higit sa iyong iniisip.
Maaaring magpasya ang demokrasya na huwag magtayo ng superintelihensya. Hindi nito maaring i-outvote ang isang sistemang higit na iniisip ang mga botante
Kung sino ang magpapasya kung itatayo ito ay tanong na politikal. Kung sino ang magkokontrol ng tumatakbong superintelligence ay hindi. Wala, kasama ang mayorya.
Oo, kung hawak ng UN ang kill switch at ang karamihan ng mga miyembrong estado ay sumang-ayon na gamitin ito sa ibang pagkakataon
Ang UN switch ay isa pa ring switch na idinisenyo ng mas mahinang partido.
Oo, dahil ang mga nahalal na opisyal ay mas matalino, bilang isang grupo, kaysa sa mga tao sa mga lab board
Ang mas matalino kaysa sa isang lab board ay hindi mas matalino kaysa sa isang superintelligence.
Tanong 18
Ang Nuclear Non-Proliferation Treaty ay nagpapahintulot sa ilang estado na panatilihin ang mga arsenal. Bakit masamang template iyon para sa superintelihensya?
Ang NPT ay ang tamang template dahil pinapayagan nito ang ilang estado na panatilihin ang mapanganib na teknolohiya
Iyon ang pinakamahinang galaw ng NPT. Ang superintelligence ay hindi mananatiling isang bagay na maaaring hawakan ng isang estado.
superintelihensya sa ilang responsableng mga estado ay mananatiling ligtas sapagkat ang mga estadong iyon ay hahawak dito
Ang responsibilidad ay hindi ginagawang mas matalinong partido ang tagabuo. Walang sinuman ang makokontrol sa bagay na kanilang binuo.
Ang isang superintelihensya deal na nagbibigay ng lisensya sa ilang builder ay hindi isang pagbabawal
Ang mga sandatang nuklear ay nananatili sa mga bagay na sinasabing hawak. Hindi gagawin ng superintelligence. Kinokopya ng isang carve-out para sa mga builder ang pinakamahina na galaw ng NPT.
Ang NPT ay nagpapatunay na ang mga kasunduan ay hindi kailanman gumagana sa mapanganib na teknolohiya, kaya hindi natin dapat subukan ang isa rito
Ang mga kasunduan ay nagtrabaho sa iba pang mga materyales. Ang NPT ay isang masamang template dahil nagbibigay ito ng lisensya sa mga tagabantay, hindi dahil ang mga kasunduan ay walang pag-asa.
Ngayon kunin ang advanced superintelihensya quiz →
Mas maraming interactive na kasangkapan
Lahat ng kasangkapan →