Z.AI Ox Alpha: 新的开源权重 GLM 系列模型
Z.AI 确认 Ox Alpha 为 GLM 系列模型
总部位于中国的 Z.AI Co.(也称为 Zhipu)已正式确认 Ox Alpha 模型是其 GLM 系列的新迭代版本。在回应 Bloomberg News 于 2026 年 8 月 26 日的查询时,该公司宣布其有意发布该模型的权重,将 Ox Alpha 定位为 DeepSeek 等其他开源权重模型的强力竞争对手。
早期用户性能与能力
来自通过 OpenRouter 和 OpenCode Zen 等平台访问 Ox Alpha 的用户的初步报告表明,该模型具有强大的编程能力,但存在明显的稳定性问题。
编程与技术任务
- Java Bindings: 一位用户报告称,该模型在单轮对话中成功为
latticedb项目生成了 Java bindings,使用了大约 100K 输入 token,60K 输出 token 和 80K thinking token。 - UI 开发: 一些用户发现 Ox Alpha 在 UI 任务方面优于 GPT 5.6 Sol。
- 通用编程: 用户将其编程性能描述为介于 Anthropic 的 Sonnet 和 Opus 模型之间,并指出其编写的代码整洁且能很好地维持上下文。
稳定性与可靠性问题
尽管其具备这些能力,早期测试人员已强调了显著的可靠性问题:
- 无限循环: 多位用户报告该模型会进入“末日循环”(doom loops),例如重复执行相同的 bash 命令(多达一千次),使其不适合无人值守的智能体工作流(agentic workflows)。
- 复杂脚本: 据报道,该模型在处理涉及管道(pipelines)的复杂 bash 脚本时表现挣扎,往往会“迷失方向”。
- 推理速度: 早期访问用户指出推理速度较差,表现为频繁的超时。
社区分析与推测
Hacker News 上的技术观察者对该模型的架构和定位提出了几个问题:
- Model Size: 对于模型的参数量存在极大的好奇。分析师建议,如果该模型的大小与 GLM 5.3 相似,则代表了效率上的重大飞跃;如果它更接近 DeepSeek Pro 或 Kimi K3,则被视为具有竞争力但差异化程度较低。
- Benchmarking Discrepancies: 用户注意到公开基准测试中存在矛盾的信号,一些报告显示它在 LiveBench 上表现低于 GPT-5.4 Nano,而其他内部网站则声称其表现优于 Fable。
- Infrastructure: 有推测认为,通过 OpenRouter 提供的大量可用性可能是由使用中国 AI 加速器的非 Nvidia 硬件栈驱动的。
战略背景
社区认为,发布 Ox Alpha 权重的决定是一个战略举措,旨在开源权重生态系统中保持与 DeepSeek 的竞争力。这紧随着中国 AI 实验室发布模型权重以获得关注并建立针对全球竞争对手的基准测试的大趋势。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch