Ang AI Safety Institute ay isang government body na itinatag upang suriin ang frontier AI systems para sa mga panganib sa national security at public safety, at upang mabuo ang sariling expertise ng estado sa frontier AI. Ang unang wave ay nagtipon sa paligid ng 2023 international AI summit. Nagbabahagi na ngayon ang mga institute ng methods at findings sa pamamagitan ng international network na itinulak ng Seoul at follow-on meetings.
Ilang pangunahing kapital ang mayroong institute o katumbas nito. Karamihan sa mga ito ay hindi pa rin kayang pigilan ang isang mapanganib na modelo.
Isang tala tungkol sa mga pangalan: ang dalawang founding institute ay pinalitan na ng pangalan. Ang UK body ay naging AI Security Institute noong Pebrero 2025. Ang US institute ay ngayon ang Center for AI Standards and Innovation (CAISI) sa NIST. "AI safety institute" ang nananatiling karaniwang generic term, at ginagamit ito ng gabay na ito sa kabuuan.
Sa loob ng maraming taon, ang tanging organisasyon na lubos na nakauunawa sa frontier models ay ang mga kumpanyang gumagawa nito. Ang isang institute ay pagtatangkang maglagay ng independiyenteng teknikal na kakayahan sa loob ng gobyerno, para masuri ng mga pampublikong awtoridad ang mga sistema sa halip na tanggapin na lang ang briefing ng developer bilang huling salita.
Ano talaga ang ginagawa nila
Ang kanilang gawain ay nagkakumpol sa ilang mga lugar.
- Sinusubukan ang frontier models, minsan bago ilabas, para sa dangerous capabilities sa mga larangan tulad ng cyber, biology, at autonomy, gamit ang mga pamamaraan sa likod ng mga pagsusuri ng kakayahan.
- Pagbuo ng agham ng evaluation mismo, dahil ang pagsukat sa mga panganib na ito ay bukas pa ring problema sa pananaliksik, hindi pa isang naitatag na pamamaraan.
- Pagpapayo sa gobyerno, para ang patakaran ay batay sa mga taong talagang sinuri ang mga sistema.
- Koordinasyon sa buong mundo, upang hindi na muling buuin ang isang model na nasubukan sa isang bansa, at upang magsimulang magtagpo ang mga pamantayan.
Totoong pag-unlad ito sa institusyon. Ang pagbuo ng state capacity para maunawaan ang frontier AI ay kinakailangan para mapamahalaan ito. Hindi mo mapamamahalaan ang hindi mo kayang suriin, at hanggang kamakailan ay halos hindi ito magawa ng mga gobyerno.
Ang kapangyarihang karaniwang kulang sa kanila
Karamihan ng AI Safety Institutes ay maaaring sumubok, magpayo, at maglathala. Iilan lamang ang maaaring mag - udyok, ang paggamit ng mga modelo ay kadalasang depende sa pagtutulungan ng laboratoryo, at ang mga tuklas ay karaniwang nagbibigay ng impormasyon sa halip na magtali. Sa karamihan ng mga kaso ang isang instituto ay hindi makapag - order ng isang mapanganib na modelo na hindi ibinigay. Nakikita ng mga katawang ito ang panganib at inirerekomenda ang pagtugon. Bihira silang humingi ng isa nito.
Ang agwat sa pagitan ng assessment at authority ang structural limit. Ang institute na natutuklasan ng seryosong hazard at makakapayo lamang ay kasing-epektibo lamang ng kagustuhan ng gobyerno na kumilos laban sa commercial at competitive pressure na magpatuloy. Karamihan sa kasalukuyang arkitektura ay isang warning system. Hindi pa ito isang safeguard hanggang sa may sumagot sa alarma na may kapangyarihan.
Ang pagiging walang awtoridad ay kung paano natututuhan ng mga pamahalaan ang masamang balita nang huli at kumikilos pa rin sa dakong huli. Ang pagsubok na hindi maaaring pilitin ang paghinto ay paghahanda para sa pamamahala, hindi ang pamamahala mismo.
Ano ang magagawa nila
Ang nagtatagal na halaga ng AI Safety Institutes ang kanilang tinitipon para sa mga rehimeng nagtatali pagkatapos: independiyenteng teknikal na kapasidad, kabahaging pamantayan, at isang internasyonal na channel sa pagitan ng mga pamahalaan. Sa diwang iyan ang mga ito ang maagang anyo ng uri ng katawan Ang Pundasyon ay nangangatuwiran. Ang IPCC na modelo ipinapakita kung paano makapagpapatibay ang pinagsamang siyentipikong pagtatasa sa internasyonal na patakaran.
Ang kailangang baguhin ay ang awtoridad. Ang asessment ay dapat makipag-ugnayan sa pagpapatupad, maging sa pamamagitan man ng batas domestic na gumagawa sa sign-off ng isang institute na kondisyon ng paglalagay, o sa pamamagitan ng isang internasyonal na balangkas na nagbibigay ng mga napatunayang mga tuklas ng tunay na mga resulta. Bigyan ng lakas ang mga institutong ito na tumutugma sa kanilang kadalubhasaan, at ang karamihan sa mga paghuhusga ng malubhang pamamahala ay bahagya nang naitayo. Itigil ang superintelligence sa ilalim ng batas, na may kakayahan sa pampublikong pagtatasa bilang imprastraktura, hindi bilang pamalit sa pagbabawal at beripikasyon.