Qwen3.8 27B 性能分析

Qwen3.8 27B 在智能指數上超越了更大規模的模型

Qwen3.8 27B 在 Artificial Analysis Intelligence Index v4.1.1 上獲得了 52 分,使其與 GLM 5.2 和 GPT 5.6 Luna 等顯著更大的模型旗鼓相當。這項性能表現標誌著其前身 Qwen3.6 27B 的重大飛躍,後者獲得了 38 分,曾是小模型類別(4B–40B)中的頂尖模型。

根據社群數據,Qwen3.8 27B 現在擊敗了中型模型類別(40B–150B)中的所有模型,並與在大型模型類別(>150B)中排名第五的 DeepSeek V4 Flash 0731 的得分相當。

高可靠性與低幻覺率

Qwen3.8 27B 最顯著的技術成就之一是其可靠性。該模型展示了 70% 的「1-幻覺率」,這一數字與其他高性能模型形成了鮮明對比。作為比較,社群成員指出 GPT-5.6-Sol 在這一特定指標上為 8%。

進階代理行為與問題解決能力

Qwen3.8 27B 展現了強大的代理能力,在代理指數上總排名第七,位居 Terra 之上。用戶報告指出,該模型在解決複雜問題時特別具有持久性與創意,當明顯的路徑失敗時,經常採用非常規方法來達成解決方案。

與 Opus 4.6 的比較

用戶觀察到 Qwen3.8 27B 的得分高於 Opus 4.6。雖然 Opus 4.6 先前被認為是尖端(SOTA)模型,但用戶將其描述為在代理任務中更具「人味」且偶爾會「懶惰」,而 Qwen3.8 27B 則被描述為在解決問題的方法上非常「執著」且具有持久性。

本地部署與硬體效率

由於 Qwen3.8 27B 是一個 27B 參數模型,因此可以在高端消費級桌面 PC 和電競 GPU 上進行本地部署。這種能力讓用戶可以在不依賴雲端基礎設施的情況下,在本地運行尖端級別的 intelligence 性能。

量化效果

實際測試表明,量化程度會顯著影響模型的行為:

  • Q8 量化:傾向於在第一次嘗試時就能正確完成更多任務,並更快地達成解決方案。
  • Q4 量化:可能會產生 2-3 倍更多的「思考」token,並且需要更多輪次來從錯誤中恢復,儘管最終輸出品質仍然大致相似。

市場與經濟影響

Qwen3.8 27B 的效率激發了關於大規模數據中心經濟可行性的討論。將尖端級別的能力封裝進一個 27B 參數模型的能力,挑戰了為了追求智能增益而建造前所未有的大型且昂貴的基礎設施的必要性。

定價與吞吐量

儘管其規模較小,但一些用戶注意到,模型託管提供商(例如 OpenRouter)對該模型維持著相對較高的定價(例如,$0.45/M input 與 $3.20/M output tokens),以及適度的吞吐量(大約 27 tps),這引發了關於此特定架構推理優化限制因素的疑問。

Sources

相關