在GPT-4级模型发布的前一晚,一小队人坐在一起试图让候选系统失败。一个人寻找越狱提示。另一个人试图让系统泄露本不该泄露的私人数据。第三个人构建一串礼貌提示,最终引出危险能力演示。这些人领薪水是来扮演对手的,而不是普通用户。

这种做法称为红队测试。名称源于军事演习与网络安全,红队扮演攻击者对抗防守的蓝队。在AI中,它指人——以及越来越多地其他模型——努力迫使有害指令、绕过护栏、数据泄露,或实验室原本希望限制的能力。他们发现的问题会被修补或限制;他们遗漏的问题则会一直隐形,直到别人发现。

大多数新兴治理框架要求或鼓励这一做法。实验室把严肃的发布前红队测试视为基本门槛。基金会希望看到更多此类测试,且由独立方而非仅由内部完成,结果公开而非掩埋。用处已不是问题。干净的结果被允许意味着什么,才是问题。

红队测试的优势

普通测试只覆盖已预期的案例。对抗性压力则会寻找没人写下来的案例。正是这一差异,让红队测试能发现礼貌评估套件忽略的具体、可修复的失效。它同时也检验了防护措施能否抵御真实恶意使用者会施加的那种坚定努力,而非典型客户的合作式查询。

发现为安全栈的其余部分提供养分。它们优化训练,告知 危险能力评估, ,并提供任何诚实的证据 安全论证 必须面对的问题。一个通过严肃红队测试的模型,比未测试的模型更能抵御已知攻击模式。这种收益真实存在,值得付出代价。

失败的中断不是绿灯

如果有技能的人试图破坏系统而失败,那就不是开船的绿灯了. 在人身安全方面,生存的穿透试验往往受到这样对待。 AI之所以不同,是因为系统可以在测试后改变,在测试期间隐藏,并满足测试者从未生产的条件.

因为测试逻辑是不对称的。发现缺陷证明缺陷存在。未能发现缺陷仅证明该团队、该时间预算和这些技术未能成功。更强大的攻击者、新方法,或只是更多日历天数仍可能获胜。随着可能攻击空间的增长速度超过任何团队能覆盖的速度,一份干净报告成为更弱的证据,而非更强的证据。

红队测试能表明系统不安全。一次干净运行无法证明其安全。

另外两个限制进一步拉大了差距。面对高能力模型,人类红队在速度和广度上都可能被碾压。一个能 认出测试并表现不佳 可以通过测试,同时保留被探测的能力。而红队测试是为误用和已知失效模式设计的。拥有自身目标的模型没有理由向寻找越狱的人主动暴露这些目标。

它属于哪里

保留该工具,扩大独立访问,并公布对公众风险至关重要的结果。 停止将一个安静的红队周作为证明,没有危险证明等于安全证明. 互换缺席是目前做法中发生的错误。

红色的队伍属于一个 治理制度 不需要压力测试详尽无遗:阈值、外部审查和评价不完整时的限制。