Ox Alpha: 一款用於程式碼編寫與代理工作流的隱形推理模型
Ox Alpha 是一款用於生產工程的多模態推理模型
Ox Alpha 是一款專為程式碼編寫、持續性的代理工作以及生產負載設計的推理模型。它特別針對長程軟體工程、複雜推理任務以及需要整合文本與視覺上下文的工作流進行了優化。該模型於 2026 年 8 月 20 日發布,目前作為「隱形」模型在 OpenRouter 上提供,這意味著它是由一家匿名的第三方供應商開發並營運的。
技術規格與能力
Ox Alpha 提供高容量的上下文與多模態輸入支援,以促進複雜的軟體開發與代理任務。
上下文與模態
- Context Window: 1,048,576 tokens。
- Maximum Output: 131,072 tokens。
- Input Modalities: 支援文本、圖像與影片。
- Output Modalities: 回傳文本。
功能支援
- Tool Calling: 支援
tools與tool_choice進行函式呼叫。 - Structured Outputs: 支援
response_format以進行 JSON 輸出(不含 JSON-schema 強制執行)。 - Reasoning: 支援啟動推理的請求,允許使用者透過 API 回應中的
reasoning_details陣列存取模型的內部思考過程。
效能與定價
Ox Alpha 目前透過 OpenRouter 免費提供,不收取提示詞(prompt)或生成(completion)token 的費用。
延遲與吞吐量
根據 OpenRouter 的 P50 指標:
- Throughput: 每秒 33 個 tokens (tps)。
- Latency: 3.76 秒。
- Availability: 三天期間的可用性為 98.47%。
- Cache Hit Rate: 平均為 72.97%。
生產環境使用情況
Ox Alpha 的高流量主要由代理程式碼編寫工具與自主代理驅動,包括:
- Claude Code: 27.7B tokens
- Hermes Agent: 21.7B tokens
- Oh-My-Pi: 19.9B tokens
- DeepSeek Harness: 17.2B tokens
- ZCode: 13.4B tokens
社群分析與推測
由於模型的供應商仍保持匿名,開發者社群已利用文體學與行為分析來推測其來源。
可能的來源:GLM 系列
多位使用者建議該模型是 GLM (General Language Model) 系列的一個變體,並引用了特定的推理模式與風格特徵。
"根據其在面對複雜指令時,表現出猶豫不決且過於冗長的思考軌跡... 以及初步的文體學分析... 這幾乎可以肯定是一個 GLM 模型。"
其他理論認為它可能是 GLM-5.3 Flash 或 GLM-5.3 的視覺功能變體,可能旨在與 DeepSeek 的 flash 模型競爭。
行為觀察
- Knowledge Cutoff: 測試顯示其知識截止日期約在 2025 年中。
- Content Filtering: 使用者回報該模型拒絕回答有關天安門廣場的問題,但對於其他尖端模型通常會攔截的電子戰技術指令,其限制較為寬鬆。
- Coding Performance: 雖然部分使用者認為其在一般程式碼編寫方面表現出色,但也有人回報在特定任務中失敗,例如實作 CSS
color-mix()函式時,該模型據稱將動態邏輯替換成了硬編碼的十六進位值。 - Creative Tasks: 部分使用者回報該模型在創意與「較鬆散」的任務上表現優於其他高階模型(如 "K3"),儘管視覺推理被指出是其較弱的一環。
數據隱私與條款
Ox Alpha 受 OpenRouter 的 Stealth Model Terms 規範。雖然供應商聲明提示詞與生成內容會被保留但不會用於訓練,但供應商的匿名性使得社群對於提交專有或機密數據保持謹慎。
Sources
- HNOx Alpha
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- Dispatch