无限参数大模型:从实时数据生成权重

核心要点

无限参数大模型使用一个紧凑的超网络,将实时用户数据转化为动态生成的权重,使模型能够在保持存储参数数量不变的同时,实时从交互中学习。


论文核心思想

作者提出了一种新架构,扩展了专家混合(MoE)的缩放定律。与存储庞大的静态参数库不同,一个超网络接收当前交互上下文,并生成一个共享基础网络的低秩调制。这种调制用实时生成的权重替代了传统的冻结前馈权重。

关键技术点:

  • 超网络输出一个潜在编码,用于参数化贝叶斯信念状态。
  • 随着对话的进行,信念状态在线更新,因此生成的权重在整个会话过程中持续演变。
  • 存储模型的占用空间(基础网络和超网络)保持不变,而有效参数空间是无界的,因为每次交互都可以生成新的权重矩阵。
  • 定义了一种评估协议,直接将该方法与标准的上下文学习和检索增强生成进行对比。

为何重要

  1. 计算摊销 – 将知识从提示转移到生成的权重中,减少了重复处理长上下文窗口的需求。
  2. 跨轮次持久性 – 生成的权重在多轮对话中持续存在,使模型能够在不重新提示的情况下保留修正或事实。
  3. 潜在的更好泛化能力 – 将实时数据嵌入模型权重中,可能使系统能够超越提示的字面意义进行外推,而不仅仅是上下文学习。

与现有技术的关系

  • LoRA / Adapter 调整 – 如评论者 killerstorm 所指出,该方法类似于“文本到LoRA”:超网络从输入嵌入生成一个低秩适配器。然而,论文增加了贝叶斯信念更新,使适配器在会话期间持续演化,而非在单次生成后冻结。
  • 乘法门控网络 – 动态权重生成可被解释为对更大隐藏状态应用乘法门控机制(类似于GLU)。
  • 检索增强生成 – 与在推理时获取外部文档不同,该模型将检索到的信息内化为权重,从而释放上下文窗口。

Hacker News 社区反应

  • 集体知识引擎的愿景lubujackson 想象未来每个用户的微小进步都能即时融入模型,使系统成为持续演化的、人类解决问题尝试的存储库。
  • 安全与滥用担忧wood_spirit 警告,动态权重更新可能被武器化,例如,一个协调者注入有偏见的推荐,这些推荐会持续影响其他用户。
  • 稳定性问题juancn 提出了连续学习的经典挑战:当模型权重不断被修改时,模型是否仍能保持稳定?
  • 规模误解alightsoul 询问有效参数数量是否等于训练数据中的 token 数量(约 42 万亿)。论文澄清,存储的参数保持不变;“无限”指的是潜在权重空间,而非字面意义上的参数数量。
  • Web 4.0 类比alightsoul(第二条评论)勾勒出一个去中心化的“Web 4.0”,每个网站提供向量嵌入,直接输入此类模型,实际上将整个网络变成由客户端 AI 代理消费的实时知识图谱。
  • 硬件影响yalok 指出,未来的前沿大模型可能在芯片上硬编码权重,动态适应以单独的 RAM 居住块形式提供,这与论文中静态基础权重与可变生成权重的分离相一致。
  • 缩放定律争议cyanydeez 挑战了缩放定律不可变的前提,引用近期预印本质疑参数-数据缩放的普适性。

评估协议(如所规定)

作者设计了一个基准,以隔离权重生成带来的优势:

  1. 任务设置 – 在推理期间提供实时数据流(例如,用户提供的事实、修正)。
  2. 基线对比 – 与以下方法对比:
    • 标准上下文学习(仅提示)。
    • 检索增强生成(外部文档获取)。
  3. 指标 – 在多轮对话中衡量事实一致性、指令遵循度以及下游任务性能。 该协议旨在量化生成权重是否能带来相对于仅提示方法的可测量提升。

潜在影响与开放问题

  • 大规模持续学习 – 如果该方法可扩展,可能弥合静态基础模型与真正自适应代理之间的差距。
  • 安全机制 – 设计稳健的在线权重更新防护机制至关重要,以防止恶意或意外漂移。
  • 软硬件协同设计 – 高效的超网络推理可能需要专用加速器,尤其是当更新频率达到每 token 一次时。
  • 评估标准 – 面向在线权重适应的社区级基准仍处于萌芽阶段;该论文的协议可能成为参考点。

本文综合了 arXiv 预印本《Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data》(Hu 等,2026)的主要贡献,并突出了 Hacker News 讨论中最引人注目的观点。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • 项目