Tencent Hy4 Preview 發佈
Tencent 已發佈 Hy4 Preview,這是一款專為高規模效能與效率設計的次世代大型語言模型 (LLM)。該模型的特點是採用混合專家 (Mixture-of-Experts, MoE) 架構,總參數達 7700 億,其中 490 億為啟動參數,並支援超過 100 萬個 token 的上下文窗口。
Training 中的遞迴自我改進
Hy4 Preview 引入了遞迴自我改進迴圈,讓模型直接參與其自身的開發。Hy4 首次參與了其訓練流程中幾個核心組件的自動化優化,包括:
- Training 方法
- Data 策略
- Evaluation 框架
- Low-level operators
根據發佈內容,該模型提出了特定方法、執行實驗,並根據產生的 logs 與回饋進行迭代,建立了一個為後續探索提供資訊的迴圈。
效能與市場吸引力
早期採用數據顯示,市場對該模型展現出極大的興趣,特別是透過第三方 API 提供商。
API 採用與成本
報告指出,Hy4 在 OpenRouter 上獲得了快速的成長,在發佈後的幾天內處理了數兆個 token。這種採用率的部分原因歸功於其定價結構,特別是僅 5% 的 cache cost,這低於其他提供商通常看到的 10-20% cache cost。
Benchmarking 與比較效能
使用者回報的基準測試結果對該模型的能力提供了不同的看法:
- General Purpose Agentic Tasks:部分使用者回報,Hy4 的前身 Hy3 在 agentic 測試中表現與 DeepSeek-4-Flash 非常接近。
- German Language Evaluation:在 DACH PeerBench 指標中,Hy4 被指出較 Hy3 有顯著改進,儘管仍低於 DeepSeek Pro 與 GLM 5.3 Flash,總排名約第 14 位。
- Coding Capabilities:透過 Novita.ai 等提供商使用該模型的開發者回饋較不理想,部分使用者回報其作為 coding agent 的實用性有限。
社群群體批判與技術觀察
圍繞此次發佈的技術討論突顯了幾個關於透明度與呈現方式的爭議點。
Open Source vs. Open Weights
A 社群中的爭議點在於 Tencent 使用了「open-sourced」一詞。批評者認為該模型是「open weight」而非真正的開源,因為它僅提供用於本地執行的 binary blob,而沒有提供原始碼或訓練數據的完整透明度。
Data 視覺化疑慮
多位使用者批評了官方發佈內容中提供的 benchmark 圖表,指稱條形圖具有誤導性。具體投訴包括:
- 模型按排名進行的不一致的排序。
- 在表格中高亮顯示整行以標示「贏家」,而非針對特定指標。
- 圖表中的數值與條形圖的實際高度不一致。
Token 優化
關於模型的內部「thought」過程,已有觀察指出,該模型似乎使用了一種精簡、簡化的詞彙(被使用者描述為「caveman speak」)來節省 token 並優化處理效率。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch