Inilathala ng Anthropic ang unang Responsible Scaling Policy nito noong Setyembre 2023. Kapag binuksan ang dokumento, makikita ang istruktura sa mga heading bago pa ang retorika. Pinangalanan nang maaga ang capability levels. Bawat level ay may kasamang safeguards na dapat i-activate kapag sinasabi ng evaluations na nalampasan na ng model ang linya: mas mahigpit na weight security, mas mahigpit na deployment rules, mas malalim na red-teaming, at sa mga upper tiers ay written commitment na hindi mag-train o mag-release hanggang sa nasa lugar ang mga tinukoy na proteksyon. Ang industry short name ay RSP. Ang underlying logic ay madalas na tinatawag na if-then commitments.

Ang mga leading frontier labs ang naglathala ng pinakakilalang bersyon, at kumalat ang format. Karaniwang tumatakbo ang mga tier mula sa mga system na halos katulad ng ngayon hanggang sa mga modelong makakapagbigay ng makabuluhang tulong sa bioweapon, seryosong cyberattack, o dangerous autonomy. Nilalayon ng dokumento na sagutin ang isang simpleng tanong bago ang emergency: kapag tumaas ang capability, ano talaga ang gagawin ng kumpanya?

Bakit ang format na ito ay tunay na pagpapabuti

Kumpara sa pangkalahatang pangako na seryosohin ang kaligtasan, ang RSP ay mas kongkreto. Binabanggit nito ang mga kakayahan, threshold, at tugon nang maaga, kaya nagiging isang bagay na maaaring ituro ng mga tagalabas ang isang damdamin. Ito ay anticipatory. Kailangang magpasya ang lab kung magkano ang magagastos ng isang mapanganib na kakayahan bago dumating ang rush ng discovery at ang press cycle nang sabay.

Iniuugnay din ng format ang mga salita sa mga pagsubok pagsusuri ng mapanganib na kakayahan, kaya ang mga pagsisimula ay may kahulugang operasyonal sa halip na sawikain. Ang ilang mga patakaran ay higit pa at ginagawa upang ihinto ang pag - unlad kung ang mga pananggalang ay hindi makasabay sa kakayahan. Ang paglalagay niyan sa isang pangmadlang dokumento ay mahalaga bilang isang tunay na pagsulong.

Ang draft ay hindi konstitusyon

Ang mga pampubliko, espesipiko, pre-grant na mga tuntunin ay kung paano ang mga industriya ay nag-ebolb. Ang RSPs ay maaaring maging isang draft. Ang mga ito ay hindi isang konstitusyon samantalang ang kompaniya ring iyon ay sumusulat, nag - aaral, at nakikinabang sa pagsusulit. Pasiglahin ang draft. Huwag itong ituring na batas na dapat sundin.

Totoo, at structural pa rin ang kahinaan. Ang parehong lab ang sumusulat ng policy, nagde-define ng thresholds, nagpapatakbo ng evaluations, naghuhusga kung nalampasan ang linya, nagdedesisyon kung sapat ang safeguards, at pinapanatili ang kapangyarihang baguhin ang teksto. Kapag nagbanggaan ang commercial pressure na mag-ship at ang commitment na ginawa at pinangangasiwaan ng lab, walang independent party na humahawak ng whistle.

Hindi pabor ang kasaysayan sa optimistikong pagbabasa. Ang rekord ng Kusang - loob na mga pangako sa kaligtasan ng korporasyon sa ilalim ng matinding panggigipit ay isang rekord ng mga pamantayan na lumalambot kapag nagsimula itong makakagat. Ang isang pamamahalang kung-then ay malakas lamang na katulad ng sa noon, at ang pagkatapos ay ipinatutupad ng partido na nakikinabang sa pagpapahina nito. Ang isang tuntunin na itinakda mo, sinusukat, at maaaring baguhin para sa iyong sarili ay isang kapahayagan ng layunin. Hindi ito isang hadlang.

Dalawang karagdagang puwang ang nasa ilalim ng dokumento. Nakadepende ang mga RSP sa evaluations para makita ang nalampasan na threshold, kaya lahat ng naglilimit sa evaluations (kasama ang sandbagging, hindi kilalang kakayahan, at ang kahirapan sa pagpapatunay ng kaligtasan) ay naglilimita sa patakarang itinayo sa mga ito. At ang RSP ay nagbubuklod lamang sa lab na tumanggap nito. Ang isang kakumpitensya na tumanggi, o isang programa ng estado sa labas ng kulturang ito, ay hindi naaapektuhan. Walang iisang kumpanya ang makakapagsara ng problemang koordinasyon na iyon nang mag-isa.

Paano binabasa ng Foundation ang mga ito

Panatilihin ang mabubuting makinarya. Gamitin muli ang threshold logic, ang if-then structure, at ang ugnayan sa mga evaluation. Baguhin kung sino ang humahawak ng panulat at sino ang nagpapatupad ng paghinto. Ilipat ang mga trigger na iyan mula sa boluntaryong patakaran patungong may-bisang batas, sinusuportahan ng isang independent body at ng pamamahala sa compute, kaya hindi maaaring tahimik na baguhin ng isang lab ang sarili nitong ceiling kapag naging inconvenient ito.

Ituring ang mga patakaran bilang mga burador ng ipinatutupad na mga alituntunin, pagkatapos ay tapusin ang trabaho sa labas ng laboratoryo: Pagtatalik sa batas, independent pagpapatupad, compute controls.