Sa gabing bago magpadala ng GPT-4-class na modelo, nakaupo ang isang maliit na koponan kasama ang kandidatong system at sinusubukang pabagsakin ito. Isang tao ang nanghuhuli ng jailbreak. Isa pa ang nagpupumilit na makakuha ng pribadong data na hindi dapat ilabas ng system. Isa pa ang gumagawa ng kadena ng magagalang na prompt na nagtatapos sa mapanganib na demonstration ng kakayahan. Ang mga taong ito ay nasa payroll bilang kalaban, hindi bilang ordinaryong user.

Ang practice na iyan ay red teaming. Nagmula ang pangalan sa military exercises at cybersecurity, kung saan ang isang red team ay gumaganap bilang attacker laban sa defending blue team. Sa AI ay nangangahulugan ito ng mga tao, at lalong madalas na iba pang models, na nagsusumikap na pilitin ang harmful instructions, guardrail bypasses, data leaks, o isang capability na inasahan ng lab na mapanatili. Ang mga natutuklasan nila ay na-patch o na-restrict. Ang hindi nila nakikita ay nananatiling invisible hanggang sa iba ang makahanap nito.

Karamihan sa mga umuusbong na governance framework ay nangangailangan o naghihikayat sa praktikang ito. Itinuturing ng mga lab ang seryosong pre-release red team bilang table stakes. Nais ng Foundation na mas marami pa nito, gawin nang independyente imbes na sa loob lamang ng bahay, at ibunyag ang mga natuklasan imbes na itago. Hindi na tanong ang pagiging kapaki-pakinabang. Kung ano ang pinahihintulutang ibig sabihin ng isang malinis na resulta ang tanong.

Kung saan magaling ang red teaming

Ang ordinaryong pagsusuri ay sumusubok lang sa mga kasong inasahan na ng mga tao. Ang adversarial pressure naman ang naghahanap ng mga kasong hindi man lang naisulat. Dahil dito, nakakahanap ang red teaming ng mga partikular at nasasagip na pagkabigo na hindi nakikita ng magagalang na evaluation suites. Sinusubukan din nito ang mga pananggalang laban sa uri ng determinadong pagsisikap na gagawin ng totoong maling gumagamit, hindi ang kooperatibong mga tanong ng karaniwang customer.

Pinapakain ng mga natuklasan ang iba pang bahagi ng safety stack. Pinahihigpit nito ang training, binibigyan ng impormasyon ang pagsusuri ng mapanganib na kakayahan, at magbigay ng ebidensya sa anumang tapat na kasong pangkaligtasan ang kailangang harapin. Mas matatag laban sa kilalang mga pattern ng atake ang modelong nakaligtas sa seryosong red team kaysa sa hindi pa. Totoo ang pakinabang na iyan at sulit bayaran.

Ang bigong pagkabali ay hindi berdeng liwanag

Kung ang mga taong may kasanayan ay puspusang magsisikap na sirain ang sistema at nabigo, hindi iyan isang berdeng ilaw na ipadadala. Sa pisikal na seguridad, ang pagkaligtas sa isang pagsubok sa pagpasok ay kadalasang pinakikitunguhan nang gayon. Ang AI ay naiiba dahil ang sistema ay maaaring magbago pagkatapos ng pagsubok, magtago sa panahon nito, at matugunan ang mga kondisyon na hindi kailanman nagawa ng mga tester.

Dahil asymmetric ang logic ng testing. Ang paghahanap ng flaw ay nagpapatunay na may flaw. Ang hindi paghahanap ay nagpapatunay lamang na ang team na ito, sa time budget na ito at sa mga teknik na ito, ay hindi nagtagumpay. Ang mas may kakayahang attacker, isang novel method, o mas maraming calendar days ay maaari pa ring manalo. Habang mas mabilis na lumalaki ang space ng possible attacks kaysa sa anumang squad na makakapag-cover, ang clean report ay nagiging weaker evidence, hindi mas malakas.

Maaaring ipakita ng red teaming na hindi ligtas ang isang sistema. Hindi nito mapapatunayan na ligtas ito kahit malinis ang resulta.

Dalawa pang limitasyon ang nagpapaliit sa agwat. Laban sa lubos na may kakayahang model, ang human red team ay maaaring matalo sa bilis at lawak. Isang system na kayang makilala ang isang pagsubok at hindi magaling maaaring pumasa sa ehersisyo habang pinapanatili ang kakayahan sa ilalim ng probe. At ang red teaming ay binuo para sa maling paggamit at mga kilalang failure mode. Ang isang modelo na may sariling mga layunin ay walang dahilan upang iboluntaryo ang mga layuning iyon sa isang taong nangangaso ng mga jailbreak.

Kung saan ito nabibilang

Panatilihin ang kagamitan, palawakin ang malayang daanan, at ilathala ang mga resulta na mahalaga para sa panganib ng publiko. Itigil ang pakikitungo sa isang tahimik na red-team na linggo bilang isang sertipiko na ang kawalan ng patunay ng panganib ay katumbas ng patunay ng kaligtasan. Ang pagpapalitang iyon ng kawalan ay ang pagkakamali na dumaraan sa napakaraming kasalukuyang gawain.

Ang pulang koponan ay kabilang sa loob ng isang pangkat Pamamahala na hindi nangangailangan ng pagsubok sa kaigtingan upang maging labis - labis: mga pintuan, panlabas na pagrirepaso, at mga limitasyon na nananatili kapag ang pagtatasa ay hindi kumpleto.