Writer Palmyra-mini 系列發布
模型變體與專精
- palmyra-mini:一個非思考的基礎模型,設計為通用的生成任務全能型。
- palmyra-mini-thinking-a:一個專門變體,針對複雜推理與邏輯進行優化,使用思考鏈(Chain of Thought,CoT)方法訓練。
- palmyra-mini-thinking-b:一個專門變體,聚焦於數學方程式與高階問題解決,同樣採用思考鏈(Chain of Thought,CoT)方法。
效能基準
- palmyra-mini 在 Big Bench Hard (get-answer)(exact_match) 上取得 52.6% 的分數。
- palmyra-mini-thinking-a 在 GSM8K(嚴格匹配)上取得 82.87%,且相較於本次發布的其他模型,在所有基準測試中擁有最高的整體平均分數。
- palmyra-mini-thinking-b 在 AMC23 上取得 92.5%,且相較於本次發布的其他模型,在 AIME24、AIME25、GPQA、HMMT25、HLE、MMLU_PRO、MATH500 以及 LCB 等基準測試中擁有最高的平均分數。
技術實作與架構
Palmyra-mini 系列中的所有模型皆基於 Qwen 架構,確保與包括 vLLM、SGLang、TRTLLM 與 TGI 在內的主流推理框架相容。
Thinking-B 的基礎模型
對於 palmyra-mini-thinking-b 模型,所使用的基礎模型為 nvidia/OpenReasoning-Nemotron-1.5B。Writer 對此基礎模型進行了強化學習(RL)微調,提升了單次推理的準確度(pass@1),但也導致抽樣多樣性下降,因而在 majority@64 表現上較 SFT 基礎模型有所下降。
部署與可取得性
為了方便部署,模型提供多種格式:
- Standard weights:可於 Hugging Face 取得。
- Quantizations:為
palmyra-mini、palmyra-mini-thinking-a與palmyra-mini-thinking-b提供 GGUF 與 MLX-BF16 量化版本。