Ox Alpha: 用于编程和智能体工作流的隐形推理模型
Ox Alpha 是一款面向生产工程的多模态推理模型
Ox Alpha 是一款专为编程、持续性智能体工作和生产负载设计的推理模型。它针对长程软件工程、复杂推理任务以及需要将文本与视觉上下文相结合的工作流进行了专门优化。该模型于 2026 年 8 月 20 日发布,目前作为“隐形”模型在 OpenRouter 上提供,这意味着它是由一家匿名的第三方提供商开发并运营的。
技术规格与能力
Ox Alpha 提供高容量上下文和多模态输入支持,以促进复杂的软件开发和智能体任务。
上下文与模态
- Context Window: 1,048,576 tokens。
- Maximum Output: 131,072 tokens。
- Input Modalities: 支持文本、图像和视频。
- Output Modalities: 返回文本。
功能支持
- Tool Calling: 支持
tools和tool_choice进行函数调用。 - Structured Outputs: 支持
response_format进行 JSON 输出(不强制执行 JSON-schema)。 - Reasoning: 支持启用推理的请求,允许用户通过 API 响应中的
reasoning_details数组访问模型的内部思考过程。
性能与定价
Ox Alpha 目前通过 OpenRouter 免费提供,不对提示词或补全 token 进行收费。
延迟与吞吐量
基于 OpenRouter 的 P50 指标:
- Throughput: 每秒 33 个 token (tps)。
- Latency: 3.76 秒。
- Availability: 三天内的可用性为 98.47%。
- Cache Hit Rate: 平均为 72.97%。
生产环境使用情况
Ox Alpha 的高流量主要由智能体编程工具和自主智能体驱动,包括:
- Claude Code: 27.7B tokens
- Hermes Agent: 21.7B tokens
- Oh-My-Pi: 19.9B tokens
- DeepSeek Harness: 17.2B tokens
- ZCode: 13.4B tokens
社区分析与推测
由于模型的提供商保持匿名,开发者社区已使用文体学和行为分析来推测其来源。
可能的来源:GLM 系列
多位用户指出该模型是 GLM (General Language Model) 系列的一个变体,并引用了特定的推理模式和风格特征。
"基于其在面对复杂指令时表现出的犹豫不决且过于冗长的思考轨迹……以及初步的文体学特征……这几乎可以肯定是一个 GLM 模型。"
其他理论认为它可能是 GLM-5.3 Flash 或 GLM-5.3 的视觉增强变体,可能旨在与 DeepSeek 的 flash 模型竞争。
行为观察
- Knowledge Cutoff: 测试表明其知识截止日期在 2025 年中期左右。
- Content Filtering: 用户报告该模型拒绝回答有关天安门广场的问题,但对于其他前沿模型通常会拦截的电子战技术指令则更为宽松。
- Coding Performance: 虽然一些用户认为它在通用编程方面表现出色,但也有用户报告在特定任务中失败,例如实现 CSS
color-mix()函数时,该模型据称将动态逻辑替换成了硬编码的十六进制值。 - Creative Tasks: 一些用户报告该模型在创意和“较松散”的任务上表现优于其他高端模型(如 "K3"),尽管视觉推理被认为是其弱点。
数据隐私与条款
Ox Alpha 受 OpenRouter 的 Stealth Model Terms 管理。虽然提供商声明提示词和补全内容会被保留但不会用于训练,但提供商的匿名性导致社区在提交专有或机密数据时持有了谨慎态度。
Sources
- HNOx Alpha
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- Dispatch