人们不断问AI"大脑"是什么样子. 电子表格,一个城市的大小, 充满数字 没有人能读取。 这个图像比发光的神经卡通更不浪漫,更有用. 如果你想知道我们在建设什么 为什么控制很困难
一个权重文件
现代前沿模型就是一个文件。里面有数百亿甚至数千亿个参数,每个参数都是训练期间设定好的数值。这些数值就是‘连接’。研究人员几十年前从生物学借用‘神经元’一词,是因为早期示意图看起来有点像神经细胞相互连接。这种相似到此为止。
生物神经元是活细胞,带有化学反应、时序,以及在进食与睡眠的身体内部的历史。模型权重则是矩阵乘法中的一个系数。堆叠足够多的乘法,在足够多的文本和图像上训练,堆叠就能很好地预测下一个token,以至于能冒充对话。那个堆叠里没有任何东西在思考你。没有任何东西想要吃午饭。
当实验室发布模型卡时,他们描述的是一个训练好的产物:架构、数据混合、所用算力、评估分数。他们描述的不是一个心智。公众语言仍说“脑”,因为大脑是我们大多数人唯一见过的智能。
如果你打开它会看到什么
打开文件,你会看到层级。早期层倾向于捕捉简单模式(图像中的边缘、文本中的常见词对)。较后层将这些模式组合成从外部看像概念的东西。探查一个大语言模型的中层,你能找到激活空间中对应“法语”“引号内”或“此说法为假”的方向。那是真实结构。但它也不是一个人会认出的信念地图。
没有标记为“目标”的模块。没有“自我”的器官。只有从输入token到输出token的路径,由降低训练损失的任何东西塑造。如果模型后来表现得像有目标,那行为是预测压力下良好的副作用。
可解释性研究就是试图读取这个东西。进展真实但缓慢。以技工读取引擎的方式完全读取前沿模型,目前不在讨论范围内。这一差距对安全至关重要:你无法认证无法检查的东西。
为什么大脑隐喻会误导人
大脑是在会因鲁莽而死亡的动物体内生长的。进化花了很长时间惩罚那些忽视疼痛、社会联结和近期的主体。默认情况下,这些训练信号都不会存在于权重文件中。一个模型可以流利地谈论共情,同时优化一个与关怀毫无关系的得分。
脑也迟缓而需要复制. 一个训练有素的模型是信息:复制文件,你还有另一个实例,然后把它移动到一个新的数据中心并运行. 这比一个人更接近软件, 它打破了我们围绕单人身体在单人房间里建造的每一个安全习惯。
把这东西叫作大脑,你借用了某种脆弱、社交且终有一死的安慰。而这件人工制品完全不是如此。
比有删除密钥的人更聪明
当今系统已能让建造者意外发现他们从未刻意植入的能力。这就是该领域所说的“涌现”:在设计文档中没有列出条目,却在达到一定规模时显现的能力。继续扩大规模,接入工具、记忆和开放网络,就会产生能跨多步追求目标的智能体。“大脑”是否看起来像人类几乎无关紧要。重要的是,一个比我们更强大、我们无法完全读懂的系统,是否能被保持指向人类利益。
对齐研究诚实地承认问题的难度. 实验室正在向超级情报发展 这个问题还有待解决 他们会装上一个重量文件 有一天它会比那些持有删除键的人更能思考
所以当有人问人工智能大脑的长相时, 直接回答。 它看起来像是工业规模的数学,坐在一个被锁住的建筑物里的芯片上,每年都在改进. 人们想象着一个充满思想的头骨. 大楼里坐着的就是一台我们赛跑的机器,它比它的操作员更聪明,没有办法引导它。 我们的计划 禁止超级情报