Qwen3.8-Max 发布说明 / 新功能
Qwen 宣布发布 Qwen3.8-Max,这是迄今为止 Qwen 系列中最强大的模型。模型规模达到 2.4 万亿参数(其中 95B 为活跃参数),旨在端到端处理复杂、开放式目标,特别针对自主编码、专业研究和长时程任务执行的改进。
自主编码与自我进化
Qwen3.8-Max 已从简单的函数生成转向自主项目管理。模型展示了通过反馈回路自我进化的能力,以下三个主要测试案例证明了这一点:
- Self-Evolving Harness(自我进化框架): 在超过 10 天的自主运行中,模型从零构建了
oh-my-cli项目。它实现了一个包含问题状态机、调度器和看门狗的循环,将社区反馈转化为可执行工作。16 天后,仓库累计了 265 次提交、127 个 PR 和 151 个 issue。 - Research Reproduction and Improvement(研究复现与改进): 模型从零复现了《Unified Data Selection for LLM Reasoning》论文(在 125 小时内编写了 7,600 行代码),随后进化出一种新方法,超越了原论文的方案,在 AIME24 基准上提升了 2.7 分。
- Competitive Programming(竞技编程): 在 WWW2025 多模态对话意图识别挑战赛中,Qwen3.8-Max 与 526 支人类团队竞争。它在 24 小时限制内自主完成任务,准确率达到 0.853,超过了 87% 的人类参赛者。
专业工作流集成
为了提升整体工作能力,Qwen 在多个框架(包括 QwenWork、Claude Code 和 Codex)中扩展了强化学习环境和计算资源。这通过统一的奖励系统实现,该系统将基于执行的检查与代理式审查相结合。
高价值职业表现
Qwen3.8-Max 在数百个职业中进行压力测试,以提供生产级别的结果:
- Legal(法律): 在不到一小时的时间内完成了数百份文件的企业合规审查,这通常需要一个律师助理团队整整一周的时间。
- UI/UX Design(用户界面/用户体验设计): 一次性生成了银行应用的高保真、8 屏交互原型,无需人工修订。
- Engineering(工程): 根据图纸重建了 30 层办公塔的抗震结构模型,实时检查基底剪力和层间位移。
- Medical(医学): 将二维纸质评估转换为三维交互式解剖演示,将交付时间从数周缩短至数分钟。
- Finance(金融): 开发了端到端的 ETF 轮动策略,自动剔除冗余因子以防止过拟合,并通过 330 个子代理实现大规模并行因子挖掘。
长时程任务执行
Qwen3.8-Max 使用行动-反馈-迭代循环来处理需要数千轮交互的任务。
自主芯片设计
模型完成了 GCD/RSA 加密硬件加速器的完整硅设计流程。没有参考设计的情况下,它使用“编辑‑仿真‑综合‑布局”循环,将门数从 8,298 减少到 678。最终的物理布局实现了 81% 的芯片面积缩减,并成功在 500 MHz 达到时序闭合。
电商模拟
在 E-Commerce Bench(365 天模拟)中,Qwen3.8-Max 管理多个店铺,处理供应链危机,并使用博弈论原则与供应商谈判。其总余额达到 ¥416,252(4.16 倍回报),比第二名模型(GLM 5.2)高出 38%。
多模态智能与混合代理
Qwen3.8-Max 将视觉智能融入整个任务生命周期,超越了单纯的图像理解,实现主动视觉反馈。
- Visual Feedback Loops(视觉反馈回路): 模型能够观察自身的中间结果(例如页面布局或动画质量),并自主修正计划以纠正偏差。
- Hybrid Agent Capability(混合代理能力): 通过将编码与 GUI 操作相结合,模型可以通过代码实现逻辑,同时在实时系统上验证结果。此能力在 RecreationBench 中得到测试,模型从黑箱观察重建了应用程序。
- Video Memory(视频记忆): 对于超过 100 小时的视频,模型构建视频记忆图,以在长时间跨度内追踪角色、事件和关系。
技术规格与可用性
- Parameters(参数): 2.4 万亿(95B 活跃)。
- Availability(可用性): 目前可通过 QwenCloud 获取。
- Open Weights(开放权重): 计划下周在 Hugging Face 和 ModelScope 上发布。
- API Features(API 功能): 支持
reasoning_effort(xhigh、medium、low)以平衡深度和成本,并支持preserve_thinking以实现推理过程的透明性。