Poolside 的 Model Factory、Laguna S 与开放模型:Eiso Kant 谈如何构建用于 AGI 的代码模型
Poolside 的 Model Factory、Laguna S 与开放模型:Eiso Kant 谈如何构建用于 AGI 的代码模型
Model Factory 实现快速实验
Poolside 的 Model Factory 通过整合流式数据、版本化代码和自动化 agents,将模型开发周期从数月缩短至数周。 该团队已将模型周期从六个月缩短至五到八周,推出了如 Laguna XS2 和 Laguna S 等模型。 他们每月运行 10,000 到 20,000 次实验,对机器的信任程度之高,使得前一天所做的更改可以在下一次运行中直接应用。 Agents 负责编写代码、启动训练任务、评估结果并修改流水线,从而缩小了人工干预的环节。 不可变数据和版本化代码提供了完美的复现性,允许任何实验都能被精确地重新运行。
Laguna S 强调持久性而非单纯的原始智能
Laguna S 通过验证、回溯和持续推理而非仅仅依靠规模来实现强大的性能。 该模型总参数量为 1180 亿,其中 80 亿为激活参数,可以运行在 DGX Spark 上,运行速度约为每秒 30-40 个 tokens。 应用研究联席负责人 Peng 表示,Laguna S 的进步“并非来自更高的智能,而更多地来自于不同的行为、更多的验证、减少对事物的想当然、不过早宣布胜利,以及更强的持久性”。 该模型可以通过不断的试错来独立解决 Erdos 397,并在无需外部库的情况下处理复杂的编程任务。
权重开放与研究开放是两回事
仅仅发布模型权重并不能实现复现;实现真正的开放需要分享研究细节。 仅仅向某人提供权重并不能让他们重现你的工作,因为底层的研究、数据混合方式和训练流水线仍然是隐藏的。 因此,Poolside 发布了详细介绍模型构建方式的技术报告,包括数据源、优化器选择和训练程序。 他们将开放研究视为一种有意义的贡献,让其他人可以从成千上万次实验中学习。
全球人才战略避开湾区竞争
Poolside 在湾区以外建立了一个分布式团队,以获取全球专业知识并避免人才大战。 从第一天起,创始人就决定不在湾区招聘任何研究人员,而是从美国中部到塞尔维亚、台湾和新加坡进行全球搜寻。 他们在巴黎和伦敦开设了办事处,同时保持在美国的存在,因为他们相信最好的创新想法不会局限于一个地区。 这种全球化方法增强了团队的韧性和持久性,多年来流失的人员极少。
模型构建主要是工程问题
在基础模型开发中,超过 90% 的工作是工程问题,而非理论突破。 Poolside 早期的观点是,模型构建最终 90% 是工程问题,研究人员大部分时间都在编写代码、检查数据和运行实验。 该公司将这一过程视为一个工业化系统,其中每个组件——数据流水线、分布式训练、可靠性——都有其自身的机制。
数据和计算效率驱动进步
提高数据质量或计算效率构成了模型构建的大部分进展。 Eiso 估计,90% 的模型构建可以简化为两个杠杆:更好的数据或更好的计算效率。 诸如低精度训练(Laguna S 使用 FP8)和更智能的网络技术等进步,从现有硬件中榨取了更多能力。 更好的数据涉及过滤、清洗、转换,以及创建在训练早期教导模型进行推理的课程。
流式数据与复现性加速研究
将数据直接喂入训练并保持数据集的不可变性,可以实现快速、可靠的实验。 Poolside 不是在每次运行前都实例化一个完整的数据集,而是实时流式传输数据,因此在其余数据到达时,训练就可以开始。 数据层被视为不可变的,代码是版本化的,这让研究人员可以将每个 token 追溯到其确切的来源和代码版本。 这种复现性将早期的 YOLO 式运行转变为严谨的科学实验,每次尝试都是一次干净的消融实验。
Agents 自动化 Model Factory
Agents 现在负责编写代码、启动训练任务、评估结果并修改流水线,减少了人工干预时间。 在办公室走动时,Eiso 会看到研究人员的屏幕上充满了正在编写代码、提交任务、检查结果并调整训练基础设施的 agents。 这些 agents 在预训练和后训练流水线以及合成数据生成方面发挥作用,并开始影响架构决策。 这种自动化创造了递归自我改进的早期迹象,即系统在改进其自身的训练过程。
强化学习将提前介入
Eiso 预计强化学习将移至预训练阶段,以便更早地教导推理能力。 他持有一种非主流观点,即 RL 将越来越早地进入预训练阶段,而不是作为一个独立的后训练阶段存在。 早期的 RL 可以在模型还在接触原始网页文本时就诱导其产生推理能力,将 next-token prediction 转化为一个思考过程。
Next-Token Prediction 对网页知识利用不足
目前的预训练从网页中提取的信息太少;需要更好的方法将原始文本转化为推理。 Eiso 认为 next-token prediction 预训练是不够的,我们从网页中榨取出的东西还远远没有达到应有的水平。 研究正在进行中,旨在利用网页作为一种在训练早期教导模型思考的方式,从而超越纯粹的统计预测。
视觉模态优先,音频计划推迟
Poolside 将视觉理解视为语言之后的下一步,推迟了音频工作。 目前的模型缺乏视觉理解能力,但团队认为这非常重要,并已开始着手构建。 音频不是近期的重点,因为 Eiso 不认为它能让系统更接近 AGI,他更倾向于将计算资源投入到语言和视觉上。
Poolside 的命名与雄心
Poolside 这个名字提醒创始人永远不要降低雄心,这灵感源于一次偶然的会议。 在与一位潜在合作伙伴的早期交谈中,首席科学家建议去餐厅的池畔(poolside),这个名字就此留了下来,作为追求艰难道路而非接受轻松收购协议的提醒。 它象征着在构建基础模型时拒绝降低雄心。
融资与投资者的怀疑
尽管许多投资者仍怀疑 AGI 的可行性,Poolside 还是筹集了 5 亿美元。 在融资过程中,大部分投资者对话仍在试图解释这些模型不仅仅是随机鹦鹉,并且它们会持续改进。 尽管对于 AGI 是否是一个现实的近期前景存在怀疑,资金还是到账了。
过度限制开放模型的风险
过早限制开放模型的发布可能会导致权力集中并阻碍创新。 Eiso 更喜欢一个拥有 100 家基础模型公司的世界,而不是只有 5 家的世界,即使 Poolside 是其中之一。 他警告说,限制开放发布的监管或安全担忧可能会意外地创造出两三家 AI 公司的寡头垄断,就像香烟广告禁令巩固了几家烟草公司的地位一样。
硬件瓶颈与 RL 的墙钟时间
尽管硬件有所进步,但受限于 batch size 的强化学习墙钟时间(wall-clock time)仍然是一个主要瓶颈。 由于 RL 任务是有限的,增加 batch size 很困难,因此扩展 RL 的计算规模并不遵循与预训练相同的曲线。 Eiso 将此视为 Poolside 当前最大的瓶颈之一,并期待能够实现跨不同芯片分离 prefill 和 decode 的技术,以提高 RL 的效率。
从头开始训练而非蒸馏
Poolside 从头开始训练模型,而不是简单地蒸馏更大的模型,以保持完整的研究控制权。 蒸馏会掩盖从训练过程中学到的经验,使得改进 model factory 变得更加困难。 从头开始训练让团队可以在每个数量级上研究稳定性、数据混合和优化器行为,并将这些见解反馈回系统。
招聘涵盖所有模型构建职能
该公司正在为预训练、后训练、架构、评估和工程职位招聘研究人员和工程师。 Poolside 在模型构建的全谱系中进行招聘,寻求能够对实验和基础设施负责的高自主性人才。 凭借不到 70 名研究人员和约 35 名工程师,每一次招聘都对 model factory 的速度和能力产生巨大影响。