Laging tinatanong ng mga tao kung ano ang hitsura ng AI "brain". Isang disheet na kasinlaki ng isang lungsod, punô ng bilang na walang makabasa. Ang larawang iyan ay hindi gaanong romantiko kaysa isang nagniningning na neuronal cartoon, at ito'y mas kapaki - pakinabang. Kung nais mong malaman kung ano ang ating itinatayo, at kung bakit mahirap kontrolin.
Isang weight file
Ang modernong frontier model ay isang file. Sa loob nito ay nakaupo ang sampu o daan-daang bilyong parameter, bawat isa ay numerong itinakda habang nagte-training. Ang mga numerong iyon ang "connections." Hiniram ng mga mananaliksik ang salitang neuron mula sa biology dekada na ang nakalipas dahil mukhang medyo katulad ng nerve cells na magkakabit ang mga unang diagram. Doon lang nagtatapos ang pagkakatulad.
Ang biological neuron ay isang buhay na selula na may kimika, oras, at kasaysayan sa loob ng katawang kumakain at natutulog. Ang model weight naman ay isang coefficient sa matrix multiply. Kapag pinagsama-sama ang sapat na multiplies at sinanay sa sapat na text at images, mahusay na nahuhulaan ng stack ang susunod na token para makapasa bilang usapan. Wala sa stack na iyan ang nag-iisip tungkol sa iyo. Wala rin itong gustong kumain ng tanghalian.
Kapag nag-publish ang mga lab ng model card, inilalarawan nila ang isang trained artifact: architecture, data mix, compute na ginamit, eval scores. Hindi nila inilalarawan ang isang isipan. Ang public language ay patuloy na nagsasabi ng "brain," dahil ang utak ang tanging intelligence na nakilala ng karamihan sa atin.
Ano ang makikita mo kung bubuksan mo ito
Buksan mo ang file at makakakuha ka ng layers. Ang early layers ay karaniwang kumukuha ng simple patterns (edges sa images, common word pairs sa text). Pinagsasama ng later layers ang mga pattern na iyon sa mga bagay na mukhang, mula sa labas, mga concepts. I-probe mo ang gitna ng isang malaking language model at makakahanap ka ng directions sa activation space na nag-iilaw para sa "French" o "inside a quote" o "this claim is false." Totoong istruktura iyon. Hindi rin ito isang mapa ng beliefs na makikilala ng isang tao.
Walang module na may label na "goals." Walang organ para sa "self." Mayroong landas mula sa input tokens patungo sa output tokens, hinuhubog ng anumang nagpababa sa training loss. Kung kumikilos ang model mamaya na parang may goal ito, ang ganoong behavior ay side effect lamang ng mahusay na pag-predict sa ilalim ng pressure.
Ang interpretability research ay ang pagtatangkang basahin pa rin ang bagay na ito. Totoo ang pag-unlad ngunit mabagal. Ang lubusang pagbasa ng frontier model tulad ng pagbabasa ng makina ng mekaniko ay hindi pa nasa talahanayan. Mahalaga ang agwat na ito para sa kaligtasan: hindi mo masasertipikahan ang hindi mo masusuri.
Bakit Nililigaw Tayo ng Brain Metaphor
Lumalaki ang utak sa loob ng hayop na namamatay kapag walang ingat. Matagal na panahon ang ginugol ng ebolusyon sa pagpaparusa sa mga agent na hindi pinansin ang sakit, social bonds, at ang malapit na hinaharap. Wala sa training signal na iyan ang nasa weight file bilang default. Puwedeng magsalita nang likas ang model tungkol sa empathy habang ino-optimize ang score na walang kinalaman sa pag-aalaga.
Mabagal at magastos ding gayahin ang mga utak. Ang isang sinanay na modelo ay impormasyon: kopyahin ang file at may isa pang pagkakataon, at ilipat ito sa isang bagong data center at tumakbo ito. Iyan ay mas malapit sa software kaysa sa isang tao, at sinisira nito ang bawat ligtas na kaugalian na ginawa namin sa palibot ng isahang mga katawan sa iisang silid.
Tawagin mo itong utak at hiniram mo lang ang ginhawa ng isang bagay na marupok, sosyal, at mortal. Ang artifact ay wala sa mga iyan.
Mas matalino kaysa mga taong may delete key
Nagugulat na ng kasalukuyang mga sistema ang kanilang mga gumagawa sa mga kasanayang walang sinasadyang inilagay. Iyan ang ibig sabihin ng "emergent" sa larangang ito: kakayahang lumilitaw sa scale nang walang line item sa design doc. Kung lalo pang pinalaki ang scale, ikonekta ang tools at memory at ang open network, makakakuha ka ng mga agents na nagpupursigi ng mga layunin sa maraming hakbang. Hindi gaanong mahalaga kung mukhang tao ang "brain". Ang mahalaga ay kung ang isang sistema na mas may kakayahan kaysa sa atin, na hindi natin lubos na mabasa, ay mapapanatiling nakatuon sa human interests.
Ang alignment research ay tapat tungkol sa kahirapan ng problema. Ang mga Lab ay nakikipagkarera tungo sa superintelligence na may problema pa rin na bukas. Ang papasanin nila ay isang talaksan ng pabigat na maaaring isipin balang araw ng mga taong humahawak ng delete key.
Kaya kapag may nagtanong kung ano ang hitsura ng utak ng AI, sumagot nang malinaw. Para itong matematika sa industriyal na lawak, na nakaupo sa mga chip sa isang nakakandadong gusali, anupat bumubuti taun - taon. Naguguniguni ng mga tao ang isang bungo na punô ng kaisipan. Ang nakaupo sa gusali ay isang makina na kinarerista natin upang maging mas matalino kaysa mga nagpapatakbo nito, na walang paraan upang ugitan ito. aming plano ay ipagbawal ang superintelligence.