Ornith-1.5 發佈:用於推理與編碼的端到端自我改進
Ornith-1.5 是一系列專為高性能推理、代理(agentic)與編碼任務設計的基礎模型。它將 Ornith-1.0 的自我腳手架(self-scaffolding)框架演進為一個完整的自我改進迴圈,使模型能夠自主提出新任務、生成特定任務的腳手架,並為強化學習產生解決方案的展開(rollouts)。
模型性能與擴展
Ornith-1.5 提供三種規模,在各種基準測試中展現出與專有模型和開源模型相抗衡的競爭力。
Ornith-1.5-397B (MoE)
旗艦級 397B Mixture-of-Experts (MoE) 模型在多項關鍵基準測試中的表現與 Claude Opus 4.8 持平。它在 Terminal-Bench 2.1 獲得 86.1 分,在 DeepSWE 獲得 56.0 分,表現優於 GLM-5.2 (82.7 與 46.2) 和 DeepSeek-V4-Flash-0731 (82.7 與 54.4) 等開源同儕。
Ornith-1.5-35B (MoE)
35B MoE 模型在每個 token 時僅啟動 3B 參數,但其表現顯著優於較大的密集(dense)模型。在 Terminal-Bench 2.1 上,它獲得 68.5 分,而 Gemma 4-31B 為 43.4 分,Muse Glimmer-30B 為 51.7 分。它在 SWE-Bench Verified 上也達到了 79.0 分,超越了 Gemma 4-31B (52.0) 和 Muse Glimmer-30B (76.0)。
Ornith-1.5-9B (Dense)
專為 iPhone 和 Android 設備上的邊緣部署設計,9B 密集模型在性能上可與甚至超越更大規模的模型。它在 Terminal-Bench 2.1 獲得 47.0 分,在 SWE-Bench Verified 獲得 70.6 分,在多個類別中表現優於 Gemma 4-31B 和 Qwen 3.6-35B。
自我改進迴圈
Ornith-1.5 取代了人工策劃的任務與手動搭建的測試框架(harnesses),改用任務生成、腳手架構建與解決方案產出的自主迴圈。這種閉環機制允許模型持續擴展其自身的課程,並調整其問題解決策略。
三階段訓練週期
- 任務提案:系統根據模型的先前歷史與目標環境,提出難度遞增的任務,特別針對能力缺口。
- 腳手架生成:針對每個任務,模型會生成一個特定任務的腳手架,其中包含解決問題所需的指令、工具、分解策略與編排(orchestration)。
- 解決方案展開:策略(policy)根據任務與腳手架產生解決方案的展開(rollout)。
來自展開的獎勵會透過 Group Relative Policy Optimization (GRPO) 傳回所有三個階段,藉此優化模型生成有用任務與有效腳手架的能力。
獎勵機制
為了確保自我改進迴圈能產生高品質的訓練數據,Ornith-1.5 對任務、測試框架與展開進行了特定的獎勵信號處理。
任務獎勵
任務獎勵是根據三個信號的乘法公式計算的:
- 有效性:確保任務是連貫、可解的,且腳手架執行正確。這作為一個硬性門檻,以防止錯誤格式的任務獲得獎勵。
- 前沿難度:衡量任務是否具有挑戰性但仍可學習。系統目標成功率 ($π_{target}$) 為 0.2,隨著模型能力的提升,將驅動生成器朝向更難的問題邁進。
- 新穎性:透過獎勵相對於先前生成任務緩衝區中具有多樣性的任務,來減少冗餘。
測試框架與展開獎勵
- 測試框架獎勵:測試框架根據其與任務規範的對齊程度、追蹤真實解決方案品質的能力,以及對獎勵黑客行為(reward hacking)的抵抗力來獲得獎勵。
- 展開獎勵:每個展開由生成的測試框架進行評分,對於可驗證任務使用二元通過/失敗評分,對於複雜環境則結合正確性、效率與約束滿足度進行評分。
社群洞察與觀察
用戶討論突顯了該發佈的實際效用與技術上的懷疑論:
- 本地部署:用戶注意到 35B-A3B 模型的效率,有人報告其表現與 Qwen 3.8 27B 持平,同時在高量化水平下保持較高的速度。
- 模型身份:部分用戶觀察到模型在身份提示詞中偶爾會聲稱自己是 Claude。
- 技術懷疑:部分社群成員質疑「自我改進」是在權重層級發生,還是僅僅是一個代理(agentic)外殼,而其他人則對將遞歸自我改進 (RSI) 作為融資輪的行銷手段表示懷疑。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch