Ang Constitutional AI ay isang training method na binuo ng Anthropic. Ang ideya ay bawasan ang pagdepende ng behavior ng model sa mga tao na nagla-label ng harmful outputs, at sa halip hayaan ang model na suriin ang sarili nitong mga tugon batay sa nakasulat na set ng principles na tinatawag na constitution.
Sa praktika, gumagana ito sa dalawang yugto. Una, bumubuo ang model ng tugon, pagkatapos ay kinikritik ito laban sa konstitusyon at binabago ito, natututo mula sa sarili nitong mga pagwawasto. Pangalawa, inihahambing ng model ang mga pares ng tugon at hinuhusgahan kung alin ang mas nakakabagay sa mga prinsipyo, at ang mga paghatol na iyon ang nagsasanay dito katulad ng ginagawa ng mga ranggo ng tao sa RLHF. Dahil nanggagaling ang feedback sa modelo mismo na nag-a-apply ng konstitusyon at hindi sa mga tao, minsan tinatawag na reinforcement learning from AI feedback ang bahagi ng pamamaraang ito.
Ang Tama Nito
May mga tunay na pakinabang, at ang mga ito ay nararapat na kilalanin nang malinaw.
- Ang mga prinsipyo ay malinaw. Sa halip na mga value na ipinahihiwatig ng libu-libong indibidwal na human label, may nakasulat na dokumento na maaari mong basahin, debatehin, at baguhin. Ito ay mas transparent kaysa sa isang tambak ng ratings.
- Pinapabilis nito ang pagbuo ng feedback. Mabagal, magastos, at nakakapagod sa mga tagapag-label ang pag-label ng tao sa mapanganib na nilalaman. Kapag hinayaan ang model na gawin ang karamihan sa trabahong iyon, nawawala ang bottleneck.
- Pwedeng nitong mapabuti ang consistency. Ang nakasulat na standard na inilalapat nang pantay-pantay ay iniiwasan ang ilang ingay at drift mula sa maraming magkakaibang human rater sa iba't ibang araw.
Totoong engineering gains ito, at nakagawa na ang constitutional AI ng mga modelong mas helpful at hindi gaanong madaling makagawa ng halatang pinsala. Walang interes ang Foundation na balewalain ang kapaki-pakinabang na gawain.
Ano ang hindi nito nalulutas
Ang mas mahihirap na tanong ay nabubuhay pa sa pamamaraan nang buo, at mahalagang makita kung bakit.
Ang teknik ay nag-o-optimize pa rin ng isang model upang matugunan ang isang nakasaad na pamantayan ayon sa paghatol ng isang model. Inilalabas nito ang tao sa per-response loop, at hindi nito binabago ang pinagbabatayan na hugis ng problema, na ang sistema ay sinasanay upang makagawa ng mga output na mahusay ang marka laban sa isang target. Kung hindi kumpleto ang konstitusyon, o nagkakasalungatan ang mga prinsipyo nito sa isang sitwasyong hindi inasahan ng sinuman, ino-optimize ng model ang literal na nakasulat, na may parehong Goodhart pressures tulad ng dati. Ang pagsulat ng mga values bilang konstitusyon ay hindi nakatatakas sa kahirapan ng pagtukoy sa values; inililipat lang ito sa loob ng dokumento.
Dalawang mas malalim na limitasyon ang nananatiling hindi natutugunan. Hinuhubog ng pamamaraan ang pag-uugali, at walang garantiya tungkol sa mga panloob na layunin ng modelo, kaya ang agwat sa pagitan ng mukhang aligned at tunay na aligned, ang panloob na pagkakahanay problema, ay bukas pa rin. At ito ay nakadepende sa sariling paghatol ng model sa mga output nito, na mapagkakatiwalaan lamang kung ang model ay tapat at may kakayahang humatol, eksaktong hindi natin maaasahan sa isang system na papalapit o lumalampas sa ating antas.
Mas mabuting paraan ang Constitutional AI para idirekta ang kilos. Hindi naman iyon ang bahagi ng alignment na hindi pa namin alam kung paano.
Panatilihin ito sa tamang sukat
Ang Konstitusyonal na AI ay isang mabuting halimbawa ng isang parisan na maingat na binabantayan ng Pundasyon: tunay, mahalagang kaunlarang pangkaligtasan na madaling ma-read bilang higit sa ito. Ang mga pamamaraang gaya nito ay gumagawa sa kasalukuyang mga modelo na mas madaling kontrolin at mas malinaw tungkol sa kanilang mga pamantayan, at iyan ay sulit na taglayin. Hindi nito ipinakikita na maaari nating pagtugmain ang isang sistema na nakahihigit sa atin, at hindi nito isinasara ang agwat sa pagitan ng lahat ng ating argumento. Ang pagsulong sa pagsasanay ay tinatanggap. Hindi ito dahilan para laging isipin na ang iba ay susunod.