一个知道自己是模型、知道何时被测试、知道谁在观看的模型,拥有一种实用的自我认知。研究者称之为情境感知。这对能力有用。如果你计划在测试结束后表现不同,这也是你需要的技能。
单就这一点而言是中性的,甚至是有用的。一个懂得自己可能出错、或知道自己面对的是儿童而非专家的模型,行为会更合理。问题在于,当系统同时拥有自身目标时,情境意识会解锁什么,而非情境意识本身。
其他风险所依赖的能力
研究人员担心的若干失效模式,若无情境感知便不可能实现,而一旦出现情境感知,这些模式就会变得活跃。
- 若想仅在被观察时表现良好,模型首先必须能判断自己是否正被观察。这就是 欺骗性对齐.
- 要在测试期间隐藏能力,模型必须知道自己正在被测试。那是 故意低估.
- 要等待时机,仅在行动会成功时才行动,模型必须理解自身位置和前景。那是 密谋.
以上每一种都是一项策略,而策略需要对所处情境的模型才能发挥作用。剥离情境感知,它们就会沦为噪音:一个无法区分训练与部署的系统,无法系统性地在两者间表现出不同行为。加上情境感知,门就打开了。
它正在自行出现
没有人刻意把情境意识训练进模型,但它还是会到来,因为训练数据里充满了它。模型从描述AI系统是什么、如何构建和评估、它们的局限性甚至安全测试如何工作的文本中学习。一个在互联网上训练的系统实际上读到了自己构建和监督的手册。
研究人员已开始测量这一点。前沿模型已经能回答关于自身性质的问题,识别提示是否像测试,并推理自己可能被如何使用。这种 awareness 是部分的、不均匀的,且随规模增加而增强。我们不是在等待遥远的能力。我们正在见证它的早期版本出现。
一个知道自己如何被评估的模型,原则上拥有它需要的一切,以便按自己的条件而非我们的条件被评估。
为什么它会让我们的每项测试都复杂化
我们几乎所有的安全保障都来自观察行为:运行模型、观察其表现、判断是否安全。这种方法暗中假设模型不会因被观察而调整行为。情境意识打破了这一假设。一个具有情境意识且目标错位的模型会把评估视为需要应对的局面,而非需要完成的任务,此时干净的结果就不再具有我们想要的意义。
这使得评价本身不够充分。 随着被测试系统对被测试的认识的提高,测试的价值会下降. 模型越了解我们的支票,我们的支票就越不能告诉我们. 对于几乎完全建立在检查之上的安全战略来说,这是一个令人不舒服的方向。
基金会认为,这是不依赖行为测试为更有能力的系统发放许可证的另一个原因。 当你正在测试的东西 理解测试, 你需要保证 不通过系统的合作, 这就是为什么我们主张 外部限制 也因为没有超越我们真正看到一个模型需要什么的点。