ThinkingCap:优化 Qwen 3.6-27B,实现高效本地编码
ThinkingCap 是对 Qwen 3.6-27B 模型的微调,旨在将推理 token 减少 46%,同时保持相当的智能水平和基准性能。
长链式思考推理的演进
现代大语言模型的进展,尤其是自从引入像 o1 这样的推理模型后,已经转向长链式思考推理。该过程让模型通过一系列子块“自我对话”以完善答案。这些块通常遵循以下结构化模式:
- 理解用户请求。
- 逐步拆解过程。
- 草拟答案的各个组成部分。
虽然延长这些链的长度通常能提升准确性,但也会在智能与 token 效率之间产生权衡。一些模型,例如 Gemini 3.5 Flash,提升了智能,却需要不成比例的大量 token。业界的目标已转向构建更高质量、 更短的思考链,以更少的步骤提供相同或更好的答案。
ThinkingCap 的目标与训练
BottleCap AI 开发了 ThinkingCap,作为 Qwen 3.6-27B 模型的直接替代品,该模型因其密集架构和 GPU 兼容性而在本地 AI 编码环境中被广泛使用。
核心目标
- 减少 Token 使用量: 在思考过程中降低推理 token 的使用量。
- 最小化推理循环: 减少模型在思考链中重复步骤的情况。
- 基于段落的效率: 在降低 token 数量的同时,保持最终输出质量和基准准确性。
训练方法
BottleCap AI 将训练目标聚焦于“更高效的推理”,而非单纯奖励正确性。虽然具体数据集未公开,但该过程包括使用不同随机种子进行多次运行,以在 12 项不同基准上降低噪声。
性能与基准结果
ThinkingCap 在多个基准测试中展示了与基础 Qwen 3.6-27B 模型几乎相同的准确率,同时使用的思考 token 显著更少。
- Token 减少: 模型平均产生约 46% 更少的推理 token。
- 一致性: 在测试中,模型保持相同的结构步骤(例如,理解请求、识别核心算法、制定算法),但会剪除对最终答案无贡献的多余步骤。
- 延迟: token 生成的减少直接转化为更低的延迟和推理成本。
实际应用与观察
在实际测试中,无论是编码、难度数学还是逻辑谜题,ThinkingCap 始终比标准 Qwen 3.6-27B 需要更少的 token。例如,一个算法问题在基础模型上需要 3,000 个思考 token,而在 ThinkingCap 上仅需 2,200 个。
然而,性能会因任务而异:
- 编码与逻辑: 高效且效果显著。
- 长篇作文: 结果可能“时好时坏”,需要对同一提示进行多次运行以验证一致性。
- 工具使用: 在某些多工具调用场景中,ThinkingCap 可能偶尔使用的 token 多于基础模型,这表明效率提升主要体现在推理密集型任务,而非简单的工具编排。
ThinkingCap 已在 Hugging Face 上以 GGUF 和 FP8 格式发布,为寻求更高效本地编码模型的用户提供了极具可及性的选择。