Ox Alpha: 一款用於程式碼編寫與代理工作流的隱形推理模型

Ox Alpha 是一款用於生產工程的多模態推理模型

Ox Alpha 是一款專為程式碼編寫、持續性的代理工作以及生產負載設計的推理模型。它特別針對長程軟體工程、複雜推理任務以及需要整合文本與視覺上下文的工作流進行了優化。該模型於 2026 年 8 月 20 日發布,目前作為「隱形」模型在 OpenRouter 上提供,這意味著它是由一家匿名的第三方供應商開發並營運的。

技術規格與能力

Ox Alpha 提供高容量的上下文與多模態輸入支援,以促進複雜的軟體開發與代理任務。

上下文與模態

  • Context Window: 1,048,576 tokens。
  • Maximum Output: 131,072 tokens。
  • Input Modalities: 支援文本、圖像與影片。
  • Output Modalities: 回傳文本。

功能支援

  • Tool Calling: 支援 toolstool_choice 進行函式呼叫。
  • Structured Outputs: 支援 response_format 以進行 JSON 輸出(不含 JSON-schema 強制執行)。
  • Reasoning: 支援啟動推理的請求,允許使用者透過 API 回應中的 reasoning_details 陣列存取模型的內部思考過程。

效能與定價

Ox Alpha 目前透過 OpenRouter 免費提供,不收取提示詞(prompt)或生成(completion)token 的費用。

延遲與吞吐量

根據 OpenRouter 的 P50 指標:

  • Throughput: 每秒 33 個 tokens (tps)。
  • Latency: 3.76 秒。
  • Availability: 三天期間的可用性為 98.47%。
  • Cache Hit Rate: 平均為 72.97%。

生產環境使用情況

Ox Alpha 的高流量主要由代理程式碼編寫工具與自主代理驅動,包括:

  • Claude Code: 27.7B tokens
  • Hermes Agent: 21.7B tokens
  • Oh-My-Pi: 19.9B tokens
  • DeepSeek Harness: 17.2B tokens
  • ZCode: 13.4B tokens

社群分析與推測

由於模型的供應商仍保持匿名,開發者社群已利用文體學與行為分析來推測其來源。

可能的來源:GLM 系列

多位使用者建議該模型是 GLM (General Language Model) 系列的一個變體,並引用了特定的推理模式與風格特徵。

"根據其在面對複雜指令時,表現出猶豫不決且過於冗長的思考軌跡... 以及初步的文體學分析... 這幾乎可以肯定是一個 GLM 模型。"

其他理論認為它可能是 GLM-5.3 Flash 或 GLM-5.3 的視覺功能變體,可能旨在與 DeepSeek 的 flash 模型競爭。

行為觀察

  • Knowledge Cutoff: 測試顯示其知識截止日期約在 2025 年中。
  • Content Filtering: 使用者回報該模型拒絕回答有關天安門廣場的問題,但對於其他尖端模型通常會攔截的電子戰技術指令,其限制較為寬鬆。
  • Coding Performance: 雖然部分使用者認為其在一般程式碼編寫方面表現出色,但也有人回報在特定任務中失敗,例如實作 CSS color-mix() 函式時,該模型據稱將動態邏輯替換成了硬編碼的十六進位值。
  • Creative Tasks: 部分使用者回報該模型在創意與「較鬆散」的任務上表現優於其他高階模型(如 "K3"),儘管視覺推理被指出是其較弱的一環。

數據隱私與條款

Ox Alpha 受 OpenRouter 的 Stealth Model Terms 規範。雖然供應商聲明提示詞與生成內容會被保留但不會用於訓練,但供應商的匿名性使得社群對於提交專有或機密數據保持謹慎。

Sources

相關

  • Dispatch
  • Dispatch
  • 專案
  • Dispatch
  • Dispatch