美国能源部Genesis开放模型计划发布Genesis-Science-1开源权重基础模型

美国能源部Genesis开放模型计划旨在推动科学领域的人工智能民主化

美国能源部(DOE)启动了Genesis开放模型计划,并发布了Genesis-Science-1,这是首个专为科学发现构建的开源权重基础模型。通过公开模型的权重和架构,DOE希望为研究人员、国家实验室和产业合作伙伴提供一个透明、可扩展的人工智能工具,该工具可针对材料科学、能源系统、地球建模、聚变、生物学和高能物理等领域的任务进行微调。


Genesis-Science-1是该计划的旗舰模型

  • 与Arcee AI合作,这是一家美国开源模型实验室,提供了完整的模型栈——从数据流水线到一个4000亿参数的稀疏专家混合(MoE)变体Trinity Large
  • 该模型采用开源权重许可,意味着完整的参数集和训练来源均可公开获取。
  • 发布声明中未披露具体规模或训练数据细节,引发了社区对模型规模和语料库的疑问。

贡献门户今日开放;首个截止日期为2026年8月14日

DOE创建了一个公共门户(https://genesisopenmodels.anl.gov/),组织可提交:

  • 基础阶段数据 – 科学文本、代码、文档和结构化数据集,用于预训练或中期训练。
  • 训练后资产 – 微调示例、工作流环境、强化学习任务、保留评估、评分标准和验证套件。
轨道 提交内容 申请截止日期 交付截止日期
基础阶段数据 文本、代码、文档、结构化语料库 2026年8月14日(每3个月重复一次) 2026年8月28日
训练后数据与环境 微调演示、强化学习环境、评估套件 2026年8月25日(每3个月重复一次) 2026年9月14日

入选贡献者将获得模型评估的早期访问权限、技术报告的共同作者资格,并在发布材料中获得署名。未提及直接资金支持;贡献者需提供数据、专业知识或计算资源。


社区在Hacker News上的反应

美国现有开源权重模型稀缺

"目前基本上没有美国的开源模型了,自从Llama系列被放弃后。大概只有Gemma和GPT-OSS吧?" – firasd

该评论指出了美国在开源权重模型方面的明显缺口,认为Genesis-Science-1可能填补这一空白。

对性能目标和扩展性的疑问

"我很想知道他们希望在性能上达到什么水平(即,他们选择在扩展曲线上哪个点),以及他们想开拓的细分领域。" – lithobraking

用户期待了解模型规模、计算预算,以及DOE如何与国际前沿模型竞争的细节。

对激励机制的不确定性

"入选参与者能获得什么?看起来没有资金支持的承诺?" – Smith42

缺乏明确的经济激励被指出;评论者建议DOE可附加博士后或学生资助以吸引贡献。

对透明度和架构的怀疑

"这些模型之间是否存在显著的架构差异或训练数据来源?影响其性能多样性的因素是什么?" – an0malous

社区在探究Genesis-Science-1是否仅在开源权重层面与现有大语言模型不同,例如是否采用多模态或科学专用架构。

地缘政治与出口管制担忧

"参与此类项目似乎是个让自己被出口管制的好方法。" – victor9000

潜在贡献者对参与联邦资助的人工智能项目可能带来的出口管制影响表示担忧。


Genesis如何融入更广泛的DOE Genesis使命

由2025年11月行政命令启动的Genesis使命,旨在在十年内将美国科学与工程的生产力翻倍。该使命协调了DOE下属的17个国家实验室、世界级超级计算机和科学数据资源。Genesis-Science-1是该使命的首个具体人工智能成果,旨在作为下游科学工作流的共享基础设施。


参与者可合理期待的成果

  1. 技术认可 – 在DOE技术报告中获得共同作者资格,并获得公开署名。
  2. 早期评估访问 – 在模型公开发布前,可测试并基准测试不断演进的模型。
  3. 治理影响力 – 通过DOE的五阶段评审流程,参与模型许可、数据使用政策和评估标准的制定。
  4. 潜在的间接资助 – 虽未承诺,但DOE未来可能为特定贡献轨道附加资助计划或博士后职位(如社区反馈所建议)。

仍待解答的问题

  • 模型的确切规模、架构和训练数据构成。
  • DOE将如何处理国际合作者的出口管制合规问题。
  • DOE是否会为贡献者提供计算积分或其他实际资源。
  • 除Genesis-Science-1之外后续模型的路线图,以及社区如何参与塑造它。

总结

美国能源部的Genesis开放模型计划标志着一项重大的联邦举措,旨在为科学研究创建开源、高性能的人工智能模型。通过发布Genesis-Science-1并开放贡献门户,DOE正在邀请科研生态系统共同开发下一代科学人工智能——尽管该计划的成功将取决于模型规格的清晰度、对贡献者的激励机制,以及对监管约束的妥善应对。

Sources

相关