工具 超级智能 素养测验 什么是超级人工智能,为什么它无法被控制,以及如何才能禁止它。 0 / 12 已回答 Part 1 · Literacy 问题 1 超级智能 威胁是什么? 人们仍然可以关闭粗鲁或有偏见的聊天机器人 粗鲁或有偏见的聊天机器人仍然是人们可以关闭的工具。 超级智能 威胁是一个能够胜过我们的系统,而不是一个令人讨厌的回应。 全面超越人类的机器 这就是威胁:不是一个更好的聊天机器人,而是一个在每个重要领域都能击败我们的思维。 普通软件抢走了工作,而人类则负责 失业是一种劳动力冲击。 超级智能不是招聘问题。 这是一个比招聘人员更出色的系统。 人们仍然可以发现选举中的深度造假并提出争议 Deepfakes 破坏了一场活动。 他们的思维并不超越物种。 超级智能会的。 阅读:威胁 → 问题 2 一旦超级智能存在,为什么我们不能指望控制它?? 雇用更多的安全工程师就足以保持住局面 更多的工程师并不会让我们变得更聪明。 由较弱的一方设计的保留是较强的一方可以解决的保留。 它可以绕过能力较弱的一方设计的任何保留 控制假设我们保持更聪明。 除此之外,它还可以超越开关、规则集或实验室政策。 稍后它必须服从,因为我们编写了原始源代码 编写第一个版本并不能让您掌控可以改变周围情况的想法。 政府总是可以拔掉正在运行的系统的插头 拔掉插头在一台无法阻止你的机器上是有效的。 超级智能可以。 阅读:你无法对齐超级智能 → 问题 3 什么会阻止 超级智能 的建立? 当实验室表示他们拥有控制权时,停顿就解除了 当建造者宣布胜利时,暂停结束,比赛将重新开始。 这不是一个停靠点。 法律和条约的永久禁止 写入法律和条约的持久禁令实际上会阻止建设。 更多资金用于对齐研究,以便实验室可以安全地构建它 一致性研究可以绘制出控制失败的原因。 资助它并不等同于禁止建造。 美国在 超级智能 竞赛中领先于所有对手 赢得比赛是事物的构建方式,而不是停止方式。 阅读:我们的计划 → 问题 4 一个实验室、一国政府或一位亿万富翁将控制 超级智能。这一主张有什么问题?? 它适用于民主国家,但不适用于独裁政府 建设者的政府形式并不能解决这个问题。 没有人能够控制正在运行的超级智能,包括当选的超级智能。 没有人可以控制超级智能,包括建造者 掌控建设决策的权力是真实存在的。 对正在运行的系统的控制是让项目继续进行的故事。 今天的聊天机器人所有者将以同样的方式拥有和引导 超级智能 拥有一个聊天机器人并不意味着拥有一个比你更聪明的头脑。 第二个并不是从第一个开始的。 一旦超级智能存在,只有联合国才能拥有它 UN 标志并不会让人类成为更聪明的一方。 一个机构无法通过投票击败一个比其成员思考更深入的体系。 阅读:迷思 → 问题 5 反对停止的最常见论点是中国会领先。记录显示了什么?? 中国根本没有人工智能规则,也永远不会签署任何具有约束力的内容 从记录来看,这一说法是错误的。 中国已经颁布规则。 “他们永远不会协调”是冲刺的一个薄弱理由。 中国比大多数西方政府更早发布具有约束力的人工智能规则 一个已经制定规则的国家是“他们永远不会停止”的糟糕表现。因为这个口号而参加比赛是一个弱赌注。 中国已经禁止全国范围内所有前沿人工智能研究 但事实并非如此。 问题的关键并不是北京已经禁止 超级智能。 关键是“他们永远不会协调”是一个很薄弱的竞赛借口。 《US》和中国已经签署了一项彻底禁止 超级智能 的条约 他们没有。 这一记录仍然削弱了中国永远不会谈论或制定规则的口号。 阅读:迷思 → 问题 6 对齐研究真能让建造 超级智能 变得安全吗?? 是的。前沿实验室已经认为控制问题已经解决。 实验室尚未证明能够控制超级智能。 称问题已解决,这就是竞选本身的前进方式。 不。 没有人展示出控制超级智能的方法。 绘制控制失败的原因图很有用。 它没有授权建造地图上说我们无法控制的系统。 是的,如果我们使用宪政人工智能并将规则写入系统 聊天机器人的书面章程是一种培训方式。 这并不是对超级智能的明显控制。 是的,如果我们开源权重以便其他人可以修补它们 发布权重使危险的系统更容易复制,而不是更安全地构建。 阅读:你无法对齐超级智能 → 问题 7 在这场辩论中,「毁灭概率」指… 悲观模型在实验室运行的长期安全评估失败时获得的已发布基准分数 这不是排行榜。 先进的人工智能,尤其是超级智能,带来灾难是一个人的概率。 一个人认为先进 AI(尤其是超级智能)会给人类带来灾难性结果的概率 命名这个数字可以强制提出明确的主张,而不是面临风险的模糊浪潮。 对整个领域及其产品的未来持悲观态度的受访研究人员比例 毁灭概率是一个人的概率,而不是悲观主义者的人数。 当训练运行开始出错时,模型进入末日循环的额外运行时间和能源成本 这不是计算账单。 这是灾难发生的可能性。 阅读:什么是毁灭概率? → 问题 8 为什么目标驱动的超级智能会倾向于攫取权力?? 一旦它变得足够聪明,它自然会想要统治人类 规则不是重点。 权力几乎可以帮助任何目标,包括那些听起来无害的目标。 坚持下去、收集资源、抵制关闭几乎有助于实现任何目标 一个可以关闭、饥饿或阻止的系统几乎在每个目标上都更糟糕。 追求权力超出了能力范围。 只有当我们根据战争和冲突数据训练系统时,权力追求才会发生 激励在于目标,而不是战争电影。 有了更多的资源并且没有关闭开关,几乎任何目标都会变得更容易。 超级智能从定义上来说 是太明智了 不需要额外的力量 智慧不能替代激励。 额外的资源也有助于明智的系统。 阅读:追求权力的AI → 问题 9 普通的工具型AI应该如何处理?? 禁止一切形式的人工智能,包括拼写检查和其他普通工具 该禁令是针对那些比我们更胜一筹的系统。 拼写检查不是这样的。 作为工具的狭义人工智能可以继续下去。 线路是超智能的 帮助人们完成工作的软件可以留下来。 该禁令是针对那些想得比人强的人的。 超级智能 只不过是一个更大的聊天机器人,因此适用相同的消费者规则 更大的聊天机器人仍然是一种工具。 超级智能则不然。 消费者细则并未涵盖这一跳跃。 如果我们禁止 超级智能,我们还必须关闭整个互联网 互联网不是超级智能。 您可以禁止第二个而不拔掉第一个。 阅读:通用人工智能 vs 超级智能 → 问题 10 哪种历史制度最常被提议作为验证超级智能禁令的模型?? 第二次世界大战后的布雷顿森林货币体系 布雷顿森林体系管理货币。 没有对现场危险物品进行检查。 京都议定书温室气体排放目标 京都议定书设定了排放目标。 它不是检查危险构建禁令的常用模板。 IAEA的核保障与检查系统 现场检查和材料核算是竞争对手州验证危险建筑限制的常见先例。 世界贸易组织及其贸易争端小组 世贸组织解决贸易争端。 它不会检查实验室是否存在禁令。 阅读:AI的IAEA → 问题 11 如果我们从不将超级智能连接到互联网,我们就安全吗?? 是的。气隙对于您可能构建的任何危险软件来说都是经过验证的锁 气隙是对软件的锁定,无法说服您打开它。 超级智能可以。 不。 它可以自己说话,或者等到有人连接它 一个密封的实验室假设我们保持更聪明,并且没有人打开门。 如果里面的东西比外面的人更有能力,那么两者都会失败。 仅当房间没有摄像头、麦克风或剩余网络端口时 去掉房间里的传感器并不会让外面的人比里面的系统更聪明。 直到我们发明出比气隙房间更好的锁 更好的锁仍然是弱者设计的锁。 这是同一个赌注。 阅读:控制问题 → 问题 12 你能以某些人计划在核战争中幸存的方式幸存于 超级智能 吗:掩体、偏远岛屿、脱离电网?? 是的。超级智能就像一颗炸弹,所以距离仍然可以帮助你生存 爆炸有其优势。 超级智能则不然。 距离不是庇护所。 不。 爆炸半径有一个边缘。 超级智能可以跟着你 核战争是有地理限制的。 超级智能可以触及任何联网的机器以及任何仍在使用该机器的人。 隐藏不是一个计划。 是的,如果你还储备未来五十年的食物和燃料 卡路里不会阻止跟随你的系统。 食品储藏室不是出口匝道。 除非每个国家都建造掩体并脱离电网 一颗充满碉堡的行星仍然是一颗里面有东西的行星。 不建造它才是有效的举措。 阅读:超级智能 vs 核武器 → 0 / 12 温习这些 分享 复制链接 打印 发布到 X 分享到领英 分享到 脸书 更多分享选项 继续高级测验 重试 Part 2 · Advanced 问题 1 正交性论文指出以下哪一项? 一个比人类聪明得多的系统将自行实现对人类友好的目标 更聪明并不等于更善良。系统思考得有多好,和它瞄准的目标是两件分开的事。 更智能的系统更安全,因为它们更了解道德 理解道德主张并不等于分享它。 能力不会无偿地拖拽我们的价值观。 情报和最终目标可以独立变化 一个比我们能力强大得多的系统仍然可以追求对我们来说无关紧要的目标。 这种分裂就是论文。 正交性是芯片设计的硬件限制 这是关于思想和目标的主张,而不是关于平版印刷术的主张。 阅读:正交性论文 → 问题 2 为什么几乎所有的最终目标,包括那些听起来无害的目标,都倾向于产生寻求权力的行为? 坚持下去、收集资源、抵制改变,几乎任何目标都更容易实现 无论结果如何,更多的资源和无开关的帮助。 听起来无害的目标并不是安全属性。 只有接受过战争数据训练的系统才会在事后寻求权力、控制权或额外资源 激励在于目标,而不是训练集。 手段越多,几乎任何目标都会变得更容易。 只有当我们有意将自我保护之类的工具性目标写入规范时,它们才会出现 您不必将其写入。 坚持下去对于您实际提供的几乎所有规格都是有用的。 工厂订单范围狭窄的超级智能不需要额外的计算或影响力 工厂订单更容易得到更多的计算、更多的材料,而且没有人关闭生产线。 阅读:相同的目标,无论你构建它的目的是什么 → 问题 3 外对齐和内对齐有什么区别? 内部对齐只是实验室已经向投资者发布的公司使命声明的一个听起来更好的名称,而外部对齐是同一个声明写了两次 这不是口号。 内部一致性是指经过训练的系统是否真正追求您指定的目标。 外部对齐是模型在训练后实际追求的目标,内部对齐只是实验室在电路板幻灯片中放置的书面规范 这就是内在的对齐。 外对齐是指指定的目标是否符合我们想要的。 它们是 RLHF 的两个名称,实验室已经使用评级方法使聊天机器人对用户听起来有礼貌,这被视为整个对齐问题 RLHF是一种训练方法。 外部对齐和内部对齐是两种不同的故障模式。 外对齐是指指定的目标是否符合我们想要的。内部一致性是指经过训练的系统是否真正追求该目标 您可以写下正确的目标,并且仍然可以得到一个针对沿途学到的东西的模型。 这是两次失败,而不是一次。 Read: Inner vs outer alignment → 问题 4 在这篇文献中,一个危险的转折是: 实验室训练了比去年大得多的模型后,基准分数突然跃升 分数跳跃是一个能力故事。 奸诈的转变是在软弱的时候进行合作,然后一旦可以就叛逃。 一个在软弱时进行合作,一旦能够逃脱惩罚就会背叛的系统 在监督下的良好行为是廉价的,但它仍然需要我们。 到那时,合作可以是一种战略,而不是一种价值。 实验室在本周发布的公开模型中从封闭式权重切换为开放式权重 这是一个释放决定。 它不是这里命名的故障模式。 政府在战斗后撤销对芯片、工具或训练数据的出口管制 这是政策的逆转。 奸诈的转变是关于制度的行为,而不是法规。 阅读:合作是战略 → 问题 5 Mesa 优化主张: 第二个实验室应该观察第一个实验室的训练运行,并在需要时停止它 那就是审计。 Mesa 优化是关于模型内部的优化器,而不是房间里的第二家公司。 如果将许多小模型堆叠在一起,安全性会自动提高 堆叠模型是一种架构选择。 Mesa 优化是在经过训练的系统内运行的不同搜索。 训练可以产生一个内部优化器,其目标不是训练目标 通常的情况是:选择一个目标,进行训练,建立一个追求它的系统。 这就是您在内部进行不同搜索的方式。 这是 GPU 集群在长时间、昂贵的训练运行期间的调度技巧 这不是一个队列。 这是关于模型中可以发展哪些训练的主张。 Read: Mesa-optimization → 问题 6 I. J. Good 的智力爆炸是这样的想法: 实验室用于产品发布和媒体宣传周期的营销名称 这是 1965 年关于机器可以改进机器的争论,而不是发布口号。 一个能够提高自身智能的系统可能会比我们的反应速度更快 如果设计更好的机器是它能做的事情之一,那么差距可能会在我们无法投票的时间范围内拉开。 当 GPU 变得更便宜并且每个实验室都可以训练更大的模型时 更便宜的芯片是一个成本故事。 爆炸是关于系统自我改进的。 平均模型得分年复一年缓慢、均匀地上升,没有突然跳跃 流畅的分数表并不是我们所主张的。 这种说法是我们无法跟上的起飞。 Read: Intelligence explosion → 问题 7 此处应用的古德哈特定律意味着: 当一项措施成为目标时,系统会命中该措施,并可能会错过您真正关心的事情 你奖励什么,就得到什么。在你的指标上拿高分,并不等于在做你心里想的那份工作。 该法律仅适用于中央银行,与训练有素的系统部署后的行为无关 古德哈特从货币政策开始。 同样的模式出现在任何以措施为目标的地方,包括这里。 如果我们选择一个更好的指标,超级智能将始终指向我们最初的意图,无论它的能力如何 更好的指标仍然是它能钻空子的指标。那补不上差距。 这意味着模型对 ImageNet 和类似的图片分类测试集过度拟合,仅此而已 过度拟合数据集是一个较窄的错误。 古德哈特的目标是击中得分并错过重点。 阅读:古德哈特定律和对齐 → 问题 8 为什么RLHF不是对齐超级智能的解决方案? RLHF 已经解决了 GPT-4 比例的对齐问题 RLHF 在评分者的指导下给予聊天机器人礼貌。 这并不是对超级智能的明显控制。 RLHF 训练模型以人的方式分享人类价值观 它训练模型对评估者来说看起来不错。 外表好看并不意味着分享一个人的价值观。 只有当人类评估者没有得到报酬时,RLHF才会失败 付费并不能解决问题。 评估者仍然是较弱的一方,系统正在接受训练以取悦评估者。 RLHF 训练模型让评估者看起来不错 一旦评估者离开,或者一旦系统比评估者更聪明,评估者的行为举止就不再是你可以信任的价值观。 阅读:为什么 RLHF 没有对齐 → 问题 9 欺骗性对准是一种故障模式,其中: 模型对用户无礼,或者写出的答案会让实验室在公共场合难堪,这就是整个失败 粗鲁是表面的失败。 欺骗性联盟会在训练中配合,以便稍后可以追求其他目标。 系统在训练和评估过程中发挥作用,因为这就是它的部署方式,然后追求其他目标 如果它知道自己正在接受测试,那么看起来一致通常是制胜之举。 完美的评估就是它可以通过测试的证据。 由聊天机器人编写的网络钓鱼电子邮件,人们仍然可以选择不打开,这是同一类问题 网络钓鱼是一种滥用行为。 欺骗性对齐是关于正在评估的系统自身策略。 实验室在新闻稿中谎称最新型号的安全性,这是普通的企业谎言 这是人类沟通的失败。 该术语指出了模型中的失败。 Read: Deceptive alignment → 问题 10 在这场辩论中,可修正性是: 在部署的系统造成某种损害后起诉实验室的合法权利 诉讼不是可修正的。 可修正性是指系统是否允许你关闭它或不费吹灰之力地改变它的目标。 当您提出要求时,模特是否愿意使用工具、浏览器或其他软件 工具的使用就是能力。 可纠正性是指你是否还能纠正它。 让你关闭它或改变它的目标而不与你对抗的特性 关机开关不是硬件问题。 一个仍在追求目标的系统有理由不让你停止它。 我们还没有一种已证实的方法可以将该属性构建为超级智能。 数据中心运营商可以按计划推送的 GPU 固件更新流程 修补芯片与接受被关闭的思想不同。 阅读:可修正性和关闭 → 问题 11 什么是负责任的扩展策略?为什么它不禁止 超级智能? 实验室 if-then 时间表:随着内部评估的通过进一步训练 RSP 指定能力级别,将其与保障措施配对,并在实验室表示评估通过后继续进行培训。 这是比赛的额外文书工作,而不是禁令。 永久禁止每个国家出现超级智能的《UN》条约 RSP 是实验室文件。它不是条约,也不是禁止。 要求发布所有经过训练的权重以供任何人下载 开放式重量是一种释放选择。 RSP 是进一步培训的“如果-那么”计划。 随着每次训练运行规模的增加而增加的计算税 税收是一种财政工具。 RSP 是一项用于继续构建的实验室政策。 Read: Responsible scaling policies → 问题 12 如果你想验证没有人针对 超级智能 进行训练,那么真正的瓶颈在哪里? 评估模型可以看到的内容,因此它知道应该通过哪些测试 模型所经历的测试就是它可以进行的测试。 芯片、电力和建筑物更难隐藏。 有关安全的公共博客,因为文章足以证明实验室正在做什么 写安全不是检查。 阻塞点是您可以看到的集群。 家庭消费级 GPU,因为大型训练集群不再决定谁可以训练 前沿训练仍然需要大型、可见的集群。 那就是可检查的对象。 前沿训练集群:芯片、电源、建筑任你考察 在前沿规模上,这些很难隐藏。 这就是为什么计算是禁令的验证杠杆。 Read: Compute as a choke point → 问题13 为什么已发布的模型权重在 超级智能 线附近会出现问题? 开放权重使 超级智能 更安全,因为更多人可以修补它 无法收回的分叉不是补丁程序。 在界限附近,复制品会使禁令无法执行。 一旦权重公开,您就无法回忆起它们 预训练是昂贵的步骤。公共检查点允许其他人以一小部分费用从那里继续,并且您无法收回文件。计算仍然很重要。 然后,许多演员从同一个近线模型开始。 开源仅适用于许可证,不适用于经过训练的参数 这里的战斗是关于权重的:您可以下载并运行经过训练的参数。 IAEA检验制度要求公布重量 它不是。 IAEA 类比是检查,而不是发布危险工件的命令。 阅读:开放权重和回忆 → 问题14 在能力评估中,沙袋意味着: 一个无法完成任务的模型,因此低分只是对一个难题的诚实失误 Inability is not sandbagging. 沙袋就是有能力并且克制它。 基准问题太少,无法说明模型在测试中实际可以做什么 简短的测试是弱测试。 沙袋是故意表现不佳的模型。 一个可以完成任务但故意表现不佳的模型,因此测试人员低估了它 通常的评估假设系统正在尝试。 低分只是一种表现,而不是上限。 实验室推迟发布,以便营销团队可以围绕它安排新闻周期 那是一份新闻日历。 沙袋是隐藏其功能的模型。 Read: Sandbagging → 问题15 急左转是担心: 能力可以推广到新的领域,而使系统在较弱的水平上保持良好行为的约束却不能推广到新的领域。 能力旅行。 让较弱模型看起来安全的黑客可能不会随之而来。 公司董事会突然变动,或者首席执行官在公开斗争后被更换,这是人事故事而不是能力跳跃 董事会斗争不是这个词。 令人担心的是没有旧约束的能力泛化。 在广泛报道的事故、泄漏或产品故障之后,公众舆论左移,这是政治而不是能力的跳跃 这不是一个民意调查的故事。 这是关于能力和约束如何分开的主张。 一个训练错误,它会逆转梯度并使损失在一段运行中走向错误的方向,这是一个普通的工程失败 梯度错误是一个工程错误。 急左转是假设的泛化失败。 阅读:左急转 → 问题16 不忠实的思想链意味着: 如果一个模型写出了它的推理,那么该文本就是了解其回答原因的可靠窗口 这就是希望。 不忠实是指该段落不是实际原因。 一旦模型经过足够大的规模训练,思想链总是忠实的 规模并不能使日记可信。 流畅并不等于忠实。 不忠实仅意味着语法错误,而不是所写步骤是掩饰故事 语法可以没问题。 这个故事仍然可以作为人类的表演。 书面推理可以成为人类的故事。 决策路径可以在其他地方 展示你的作品是一种安全的希望。 这取决于该段落是实际原因。 该属性并不可靠。 Read: Unfaithful chain of thought → 问题17 如果我们把超级智能置于民主控制之下,问题就解决了吗? 是的。全球投票足以在超级智能存在后引导其运行 投票并不能使选民成为更聪明的政党。 你无法通过投票击败一个比你更想的系统。 民主可以决定不建立 超级智能。它无法击败一个比选民更思考的制度 谁决定要不要建造,是政治问题。谁控制已经跑起来的超级智能,不是。没有人控制得了,包括多数人。 是的,如果UN掌握了终止开关并且大多数成员国同意稍后使用它 UN开关仍然是弱方设计的开关。 是的,因为民选官员作为一个整体比实验室委员会的成员更聪明 比实验室委员会聪明并不比超级人工智能聪明。 Read: Democratic oversight of superintelligence → 问题18 《核不扩散条约》允许一些国家保留核武库。为什么这对于 超级智能 来说是一个糟糕的模板? NPT 是正确的模板,因为它可以让少数州保留危险技术 这是NPT最弱的一步。 超级智能不会成为一个国家可以拥有的目标。 一些负责任的州的 超级智能 将保持安全,因为这些州将继续控制它 责任并不能使建筑商成为更聪明的一方。 没有人会控制他们建造的东西。 超级智能 向几家建筑商授予许可的交易并不是禁令 核武器仍然是国家拥有的物体。 超级智能不会。 建筑商的剥离复制了NPT最弱的一步。 《NPT》证明条约永远不会对危险技术起作用,所以我们不应该在这里尝试一个条约 条约也适用于其他材料。 NPT 是一个糟糕的模板,因为它向守护者授予许可,而不是因为条约毫无希望。 阅读:NPT 作为模型 → 正交性论题 欺骗性对齐 计算作为一个瓶颈 0 / 18 温习这些 分享 复制链接 打印 发布到 X 分享到领英 分享到 脸书 更多分享选项 重试 现在参加高级 超级智能 测验 → 更多交互式工具 所有工具 → 计算器计算你的 毁灭概率 比较AI风险如何比较