Writer Palmyra-mini 家族发布

Writer 发布了 Palmyra-mini 家族,包含三个开源模型,参数规模从 1.5B 到 1.7B。这些轻量级模型旨在在各种生成和推理任务中实现高性能和高效推理。

模型变体与专精

Palmyra-mini 家族包括三种不同的模型,针对不同的运行需求进行定制:

  • palmyra-mini:一种非思考的基础模型,设计为生成任务的通用全能型。
  • palmyra-mini-thinking-a:一种专门的变体,针对复杂推理和逻辑进行优化,使用链式思考(CoT)方法进行训练。
  • palmyra-mini-thinking-b:一种专门的变体,专注于数学方程和高级问题求解,同样采用链式思考(CoT)方法。

性能基准

家族中的每个模型在不同基准上展示了各自的优势:

  • palmyra-mini 在 Big Bench Hard (get-answer)(exact_match) 上取得了 52.6% 的得分。
  • palmyra-mini-thinking-a 在 GSM8K (strict match) 上取得了 82.87% 的得分,并且相较于本次发布的其他模型,在所有基准上的整体平均分最高。
  • palmyra-mini-thinking-b 在 AMC23 上得分 92.5%,并且相较于本次发布的其他模型,在 AIME24、AIME25、GPQA、HMMT25、HLE、MMLU_PRO、MATH500 和 LCB 等基准上拥有最高的平均分。

技术实现与架构

Palmyra-mini 家族的所有模型均基于 Qwen 架构,确保与包括 vLLM、SGLang、TRTLLM 和 TGI 在内的主流推理框架兼容。

Thinking-B 的基础模型

对于 palmyra-mini-thinking-b 模型,使用的基础模型是 nvidia/OpenReasoning-Nemotron-1.5B。Writer 对该基础模型进行了强化学习(RL)微调,提升了单次推理准确率(pass@1),但导致采样多样性下降,使得相较于 SFT 基础模型的 majority@64 性能出现下降。

部署与可用性

为了便于部署,这些模型提供多种格式:

  • Standard weights:可在 Hugging Face 获取。
  • Quantizations:为 palmyra-minipalmyr a-mini-thinking-apalmyra-mini-thinking-b 提供 GGUF 和 MLX-BF16 量化版本。

Sources