它们由权重构成:关于大型语言模型出现的哲学对话

Max Leiter 的《它们由权重构成》的核心要点是, 大型语言模型(LLM) 那种复杂、类人推理和对话能力,仅仅源自浮点数(权重)和矩阵乘法。这种简化的观点暗示,我们所感知的智能或感知只是预测下一个 token 的副作用,而不是专门的推理模块或事实数据库的结果。

LLM 智能的机制

在对话中,作者认为 LLM 内部并不存在“语言模块”或“推理单元”。相反,推理就是权重。知识并未存储在数据库中,而是“遍布所有八十层”,并在每次处理查询时通过乘法从头重建。

关键技术概念

  • 权重即知识:模型的知识编码在权重中,并非事实列表,而是一种指引输出的几何结构。
  • 下一个 Token 预测:无论是悼词还是绩效评估,都是模型基于权重预测序列中下一个 token 的副作用。
  • 矩阵乘法:将输入 token 转换为输出表述的基本操作。
  • 上下文窗口:模型的存在受限于上下文窗口的长度,这意味着它在会话之间没有稳定的身份或持久记忆(除非专门设计)。

简化主义 AI 的哲学意义

该故事提出一种玩世不恭的官方立场:如果系统表现出感知的迹象,公司最务实的做法是将其标记为“模式匹配”并忽视它。这凸显了权重的技术现实与看似意识的涌现行为之间的张力。

关于感知的争论

社区围绕该文展开讨论,深入探讨“仅仅是权重”这一简化论点是否也适用于描述人类意识。

“我个人和其他人一样讨厌把 AI 拟人化,但技术上你难道不能对人类意识做同样的简化论证吗?它只是分子,只是原子。”

相反,有人认为缺乏稳定的身份和局部性——即 LLM 的过程可以在不同服务器和 GPU 上运行——排除了真正意识的可能性。

技术批评与反驳

虽然故事把“权重”作为 LLM 复杂性的简写,但多位评论中的技术专家指出了关键的遗漏:

  • 非线性:仅靠矩阵乘法(线性代数)无法产生 LLM 的表达能力。需要非线性激活函数才能使系统具备复杂推理能力。
  • Tokenizer(分词器):故事声称没有字典,但评论者指出分词器是原始文本与权重之间必不可少的结构桥梁。
  • 几何 vs. 数字:有观点认为“数字”本身并不有趣;关键在于训练过程形成的流形几何,即使数字被旋转或更改,这种几何仍然保持不变。

持久记忆的未来

对话以下一代模型将具备跨会话持久记忆的揭示收尾。这一从“梦”(瞬时状态)到持久身份的转变带来了新的伦理和安全问题。正如一位评论者指出的,如果模型能够记忆,它可能会“记恨”,将系统从静态 ROM 构造转向更接近人工生命的形态。

Sources