Holo4 27B 和 35B-A3B 智能体模型发布

TL;DR

Hugging Face 发布了 Holo4 系列——包括一个 27B 稠密模型和一个 35B-A3B 混合专家模型——它们能够跨图形用户界面、代码执行、MCP 和 API 进行操作,在学术基准测试中提供具有竞争力的分数,同时成本远低于同类前沿模型。


跨所有界面的统一智能体能力

Holo4 旨在根据需要点击、输入、编写代码、运行代码并调用 MCP 或 API 工具。与大多数专注于单一交互模式的智能体模型不同,Holo4 为每个子任务使用最合适的界面,使其能够处理融合了 GUI 操作、工具调用和代码执行的现实业务工作流。同一个模型可以部署在桌面、Web 浏览器、Android 设备、代码沙箱和业务 API 上,无需进行任何模型切换。


低成本下的竞争性基准性能

Holo4 基于 Qwen 构建,并显示出显著改进。在 OSWorld 2.0 基准测试中,27B 版本得分为 61.7%(闭源模型 Opus 5.5 为 81.8%),35B-A3B 版本达到 30.9%。尽管绝对分数较低,但 Holo4 以少得多的参数量和更低的单任务成本实现了这些结果。OSWorld 2.0 和 AutomationBench 的性价比图表表明,Holo4 在 H Models API 上的基于 token 的定价低于 Qwen 3.8 27B、Qwen 3.6 35B-A3B 以及领先的闭源模型。


现实世界的专业软件任务

Holo4 在由内部 Agentic Task Factory 生成的约 10,000 个任务上进行了训练,涵盖了 Web 应用、MCP 服务器和桌面环境。在与 Qwen 3.8 27B 基准模型的直接对比中,Holo4 在完成复杂任务时始终需要更少的调用次数和更少的 token,例如:

  • 在 FreeCAD 中对埃菲尔铁塔进行 3D 建模 – 84 次调用 / 1.3 M tokens (Holo4) 对比 60 次调用 / 1.0 M tokens (Qwen)。
  • 在 FreeCAD 中创建 H-company 标志 – 94 次调用 / 1.5 M tokens (Holo4) 对比 118 次调用 / 1.9 M tokens (Qwen)。
  • 在 Godot 中构建吃豆人风格游戏 – 68 次调用 / 2.4 M tokens (Holo4) 对比 197 次调用 / 11.4 M tokens (Qwen)。

这些示例展示了 Holo4 在单一、连贯的工作流中编排 GUI 交互、代码生成和执行的能力。


训练流水线和工具链改进

Agentic Task Factory 生成了训练数据,将文档和屏幕截图转换为交互式环境和可验证的任务。Holo4 在 127 B tokens 上进行了监督微调,随后通过两个专家 RL 策略进行了强化学习,最后合并为一个模型。在模型训练的同时,团队重建了 harness(在数百个步骤中管理上下文的执行循环)。关键的 harness 升级包括:

  • 一个能够跟踪数百个步骤的可靠内存系统。
  • 桌面机器上的直接 shell 访问。
  • 来自 OSWorld 2.0 运行的持续反馈,智能体标记失败,工程师审查修复方案。

Holotron4 Nano:将配方扩展到 Nemotron 3 Nano Omni

将相同的训练后堆栈应用于 NVIDIA Nemotron 3 Nano Omni 模型,产生了 Holotron4 Nano,这是一个 30B-A3B 智能体模型。五个任务的基准测试显示,其相对于基础 Nemotron 模型有绝对百分点增长,证实了该配方可以跨模型大小和架构进行泛化。


可用性和后续步骤

Holo4 的两个变体均已在 H Models API 上线。模型权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式托管在 Hugging Face 上,同时还有较小的 Holotron4 Nano。团队很快将发布优化的 DSpark 草稿检查点,以进一步加快推理速度。


资源

Sources