Anthropic于2023年9月发布了首份负责任扩展政策。打开文件,结构先于修辞出现在标题中。能力水平被预先命名。每个水平都配有评估显示模型已越过界限时应启动的保障措施:更严格的权重安全、更紧的部署规则、更深入的红队测试,以及在最高层级书面承诺在指定保护措施到位前不进行训练或发布。行业简称是RSP。其底层逻辑常被称为“如果-那么”承诺。
领先的前沿实验室发布了最知名的版本,这种格式随即传播开来。层级通常从大致类似今天的系统,延伸到可能实质协助生物武器、严重网络攻击或危险自主的模型。该文件旨在在紧急情况发生前回答一个简单问题:当能力攀升时,公司究竟会做什么??
为何这种格式是真正的改进
与泛泛承诺认真对待安全相比,RSP更具体。它提前命名能力、阈值和响应,将一种情绪转化为外界可以指向的东西。它是前瞻性的。实验室必须在发现热潮和媒体周期同时到来之前,决定危险能力会付出什么代价。
该格式还通过 将词语与测试联系起来 危险能力评估, 所以阈值具有操作意义而不是口号. 有些政策更进一步,承诺如果保障措施不能跟上能力,就停止发展。 把它写在公开的文件中算得上是真正的进步
草案不是宪法
公开的、具体的、预先承诺的规则是工业如何成熟。 RSP可以是草稿. 他们不是宪法, 鼓励起草。 别把它当作应该遵循的法律
确实,弱点仍是结构性的。同一家实验室制定政策、定义阈值、运行评估、判断是否越线、决定其保障是否足够,并保留修改文本的权力。当出货的商业压力与实验室撰写和管理的承诺相撞时,没有独立方掌握警报。
历史不赞成乐观的解读。 记录 竞争性压力下的自愿公司安全承诺 是标准记录,当它们开始被咬时,它会软化。 如果当时的统治只有当时的强势,那么当时的由从削弱中得益的一方执行. 你设定的,测量的,可以为自己修正的规则,是意图声明. 这不是一种制约。
文件之下还有两个缺口。RSP依赖评估来发现阈值被跨越,因此所有限制评估的因素(包括 故意低估, ,未知能力和证明安全的难度)限制了基于它们的政策。而RSP仅对采纳它的实验室有约束力。拒绝采纳的竞争对手,或处于这一文化之外的国家项目,则不受影响。没有哪家公司能独自解决这一协调问题。
基金会如何解读它们
保留好的机制。复用阈值逻辑、if-then结构以及与评估的关联。改变执笔人和执行暂停的人。将这些触发器从自愿政策转为有约束力的法律,由独立机构和 算力治理, 所以当上限变得不方便时,实验室无法悄悄修改自己的上限。
将政策作为可执行规则的草案,然后在实验室外完成工作: 约束性法律、独立执法、计算控制.