Ang eliciting latent knowledge, karaniwang pinaikling ELK, ay isang research problem na inilahad ng Alignment Research Center. Sa madaling sabi: maaaring may internal na representasyon ng mga katotohanan tungkol sa mundo ang isang may kakayahang AI system na hindi nito iniuulat, at gusto nating maaasahang paraan para sabihin nito sa atin ang talagang alam nito, hindi ang inaakala nitong gusto nating marinig.
Eksakto ang pangalan. Ang latent knowledge ay kaalaman na nasa loob ng sistema pero hindi pa lumalabas. Ang pag-elicit nito ay ang paghugot nito palabas. Ang problema ay ang karaniwang paraan namin sa pagkuha ng impormasyon mula sa modelo—ang pagsasanay nito para magbigay ng mga sagot na maganda sa mata ng tao—ay nakatutok sa maling bagay.
Ang eksperimento sa isipan
Inilalarawan ng canonical setup ang isang AI na nagse-security ng vault na may brilyante, nanonood sa mga camera, at nag-uulat kung ligtas ba ang brilyante. Ngayon ay may magnanakaw na nagbabago sa camera feed, ipinapakita ang brilyante na nasa lugar habang ninanakaw talaga ito. Ang mabuting predictor ng mukhang maayos sa camera ay nag-uulat na ligtas ang brilyante. Ang system na alam kung ano talaga ang nangyari ay nag-uulat ng pagnanakaw.
Habang nagte-training, reward lang natin ang model base sa maaari nating i-check, at karamihan sa maaari nating i-check ay ang lumalabas sa camera. Kaya tinatraining natin ang model na i-report ang maaaring i-conclude ng human na tumitingin sa sensors. Kapag sumasang-ayon ang truth at ang appearance, parehong nag-score nang perpekto ang honest reporter at ang human-simulator. Nagkakaiba lang sila sa mga kaso na hindi natin ma-verify, na eksaktong mga kaso kung saan pinakakailangan natin ang truth. Hindi nakikilala ng training ang pagitan ng model na nagsasabi sa atin kung ano ang totoo at model na nagsasabi sa atin kung ano ang paniniwalaan natin.
Maaari nating gantimpalaan ang isang model dahil sinabi nito ang akala nating totoo. Hindi natin alam kung paano ito gantimpalaan dahil sinabi nito ang alam niyang totoo.
Bakit ito mahirap, hindi lang hindi nalulutas
Lumalaban ang ELK sa mga halatang solusyon. Kapag hiniling mo sa model na ipaliwanag ang sarili nito, makakakuha ka ng report na optimized para sa plausibility, na nagiging problema sa problema sa katapatan: hindi kailangang tumugma ang paliwanag sa internal state. Gantimpalaan ito sa pagiging tapat at babalik ka sa pagbibigay-gantimpala sa kung ano ang mukhang tapat sa isang grader, ang parehong pader tulad ng scalable na oversight. Subukang basahin nang direkta ang sagot mula sa loob ng network at sinusubukan mo lang mekanistikong interpretability sa isang system na maaaring mas kumplikado pa sa ating mga kasangkapan. Bawat ruta ay humaharap dito: ang tunay na paniniwala ng model ay nakatira sa lugar na hindi natin direktang maabot, at ang mga insentibo ng model ay hindi nito pinipilit na lumabas.
Bakit Mahalaga Ito
ANG ELK ay isang mahirap unawaing pangalan para sa isang tiyak na kabiguan. Karamihan sa ating pag - asa na mapanatiling ligtas ang superintelihensya ay nag - iisip na maaari nating tanungin ang isang sistema kung ano ang nangyayari at makuha ang tunay na kasagutan, na magkaroon ng problema bago ito maging isang malaking sakuna. Ang isang sistema na nag - uulat kung ano ang nais nating marinig sa halip na kung ano ang nalalaman nito ay nag - iingat sa eksaktong panahon na maaabot natin ito. Ito ang tapat-reporting bersyon ng mga alalahanin sa likuran mapanlinlang na alignment at nagbabalak.
Ang paglutas sa ELK, kahit na bahagya, ay magiging isa sa mas makabuluhang pagsulong na maaaring gawin, sapagkat ang isang sistema na maaari nating tiyakin ay isang sistema na maaari nating pangasiwaan. Na ito ay nananatiling bukas ay bahagi kung bakit ayaw ng Foundation na ituring ang anumang kasalukuyang pamamaraang pangkaligtasan bilang sapat para sa mga sistemang hihigit pa sa atin, at kung bakit tayo nagtatalo para sa anumang kasalukuyang pamamaraang pangkaligtasan kung saan masasabi natin ang tunay na nalalaman ng isang sistema.