Qwen3.8-Max 发布说明 / 新功能
Qwen 已发布 Qwen3.8-Max,这是一款拥有 2.4 万亿参数的模型,旨在实现自主编码、专业工作流和长时程任务,开放权重将在下周发布。
Qwen-Image-3.0 发布说明
Qwen-Image-3.0 是一款聚焦于真实感和实用性的第三代图像生成模型,支持 4.5k token 输入以实现复杂布局,能够渲染 10px 小字号文本,并原生支持 12 种语言。
Qwen-AgentWorld 发布:面向七个领域的语言世界模型及其对通用代理的影响
Qwen 发布了 Qwen‑AgentWorld,这是一款能够模拟七种代理环境的语言世界模型,并通过可控仿真和统一的下一状态预测提升通用代理。
Qwen 机器人套件:用于导航、操作和世界建模的统一基础模型
Qwen 推出了 Qwen‑Robot 套件——三个基础模型(RobotNav、RobotManip、RobotWorld),将语言转化为导航、操作和世界预测动作,实现跨数十种形态的统一代理机器人系统。
Qwen-RobotWorld: 面向具身代理的无限世界
Qwen-RobotWorld 是一个统一的世界模型,使用自然语言作为通用动作接口,以实现跨场景的物理泛化,覆盖 20 多种机器人形态。
Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化
Qwen-RobotManip 是一个视觉-语言-动作(VLA)基础模型,使用统一的对齐框架和人类到机器人数据合成管道,实现了在多种机器人形态和分布外任务上的最先进的泛化能力。
Qwen-RobotNav:面向代理系统的可扩展导航模型
Qwen-RobotNav 是一个基于 Qwen3-VL 的统一导航模型,通过将视觉上下文视为可控的推理时接口,实现了在五个导航领域的最先进性能。
Qwen3.7-Plus 发布说明 / 新功能
Qwen3.7-Plus 是一种多模态代理模型,将视觉和语言统一,使其能够在 GUI 和 CLI 环境中运行,以实现复杂的软件工程和生产力自动化。
Qwen-VLA:统一具身智能的视觉-语言-动作建模
Qwen-VLA 是一种通用的视觉-语言-动作模型,将机器人操作、视觉-语言导航以及跨具身控制统一为单一的通用策略模型。
Qwen3.7-Max 代理模型发布
Qwen 发布了 Qwen3.7-Max,这是一款面向代理的全新基础模型,擅长编码、办公自动化以及超长时程的自主任务,现已通过阿里云模型工作室提供。
Qwen3.5-LiveTranslate-Flash 发布说明
Qwen3.5-LiveTranslate-Flash 是基于 Qwen3.5-Omni 的同声传译模型,提供实时、多模态翻译,支持 60 种语言,具备超低延迟和语音克隆功能。
Qwen-Scope 可解释性工具包发布
Qwen 发布了 Qwen-Scope,这是一款使用稀疏自编码器(SAE)将 Qwen3 与 Qwen3.5 系列模型的隐藏表征分解为可解释特征,以便进行模型优化的可解释性工具包。
FlashQLA:面向 CP / 反向友好的融合线性注意力内核(用于 GDN)
Qwen 开源了 FlashQLA,这是一款基于 TileLang 的高性能线性注意力内核库,在 NVIDIA Hopper GPU 上实现了对门控增量网络(GDN)层的 2-3 倍前向加速和 2 倍反向加速。
Qwen3.6-27B 发布说明 / 新功能
Qwen 发布了 Qwen3.6-27B,这是一款密集的 270 亿参数多模态模型,在所有主要的代理式编码基准上均优于更大的 Qwen3.5-397B-A17B。
Qwen3.6-Max-Preview 发布说明 / 新功能
Qwen3.6-Max-Preview 是 Qwen 推出的专有预览模型,在代理式编码、世界知识和指令遵循方面相较于 Qwen3.6-Plus 有所提升。
Qwen3.6-35B-A3B 发布说明
Qwen 发布了 Qwen3.6-35B-A3B,这是一款开源的混合专家模型,拥有 350 亿总参数和 30 亿活跃参数,在代理式编码和多模态推理方面可与更大的密集模型竞争。
2024 年沙巴卡安中央市场标志垂直文字 – “2006”
2024 年沙巴卡安中央市场主标志右侧的垂直文字为 “2006”。
Qwen3.5-Omni 发布说明
Qwen 宣布了 Qwen3.5-Omni,这是一款能够处理文本、图像、音频和视频的新型全模态大语言模型,支持 256k 上下文、113 种语言的语音识别、36 种语言的语音合成,并新增了语义中断、网页搜索、语音控制和语音克隆等实时功能。
Qwen3.5-Max-Preview 在 LMSys Arena 上发布
Qwen 已将 Qwen3.5-Max-Preview 部署到 LMSys Arena,供社区在两周内的正式发布前进行评估。
Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能
Qwen 3.5‑397B‑A17B 是一个拥有 3970 亿参数的多模态模型,每个令牌仅激活 170 亿参数,在语言、编码、推理和视觉任务上实现最先进的性能,同时推理速度比前代提升最高可达 19 倍。
Qwen-Image-2.0 发布:专业信息图表与写实渲染
Qwen-Image-2.0 是一款统一的图像生成与编辑模型,支持 1k-token 指令用于专业信息图表,并具备原生 2K 分辨率实现高保真写实渲染。
Qwen3-Coder-Next 发布:高效能代理式编码模型
Qwen3-Coder-Next 是一款基于混合注意力和 MoE 架构的开源权重模型,在 SWE-Bench Verified 上取得超过 70% 的成功率,性能可与参数量大 10‑20 倍的模型相媲美。
Qwen3-ASR 和 Qwen3-ForcedAligner 发布
Qwen 已开源 Qwen3-ASR(1.7B 和 0.6B)以及 Qwen3-ForcedAligner-0.6B,提供业界领先的多语言语音识别和非自回归时间戳预测,遵循 Apache 2.0 许可证。
Qwen3-Max-Thinking 发布说明
Qwen 已发布 Qwen3‑Max‑Thinking,这款旗舰推理模型具备自适应工具使用和多轮测试时扩展策略,可与 GPT‑5.2‑Thinking 和 Claude‑Opus‑4.5 竞争。
Qwen3-TTS 发布说明:开源语音设计、克隆与生成
Qwen 已开源 Qwen3-TTS 系列,提供 0.6B 与 1.7B 参数规模的模型,实现高保真语音克隆、基于自然语言的语音设计以及跨 10 种语言的超低延迟流式语音生成。
Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 发布
Qwen 已发布 Qwen3-VL-Embedding 与 Qwen3-VL-Reranker,这是一系列针对文本、图像、截图和视频的高精度跨模态检索的多模态模型。
Qwen-Image-2512 发布说明 / 新功能
Qwen-Image-2512 是对 Qwen-Image 文本到图像模型的十二月更新,显著提升了人物真实感、自然细节渲染以及复杂文字布局的准确性。
Qwen-Image-Edit-2511 发布说明
Qwen-Image-Edit-2511 是一个更新的图像编辑模型,提升了角色一致性,集成了社区 LoRAs,并增强了几何推理和工业设计能力。
Qwen3-TTS-VD-Flash 与 Qwen3-TTS-VC-Flash 发布:可控语音设计与快速多语言语音克隆
Qwen 推出了用于自然语言语音设计的 Qwen3‑TTS‑VD‑Flash 和用于 3 秒多语言语音克隆的 Qwen3‑TTS‑VC‑Flash,两者在可控性和准确性方面均优于领先的 TTS 系统。
Qwen-Image-Layered:层次化分解实现内在可编辑性
Qwen-Image-Layered 是一种新模型,可将图像分解为多个 RGBA 层,实现对图像组件的独立操作而不影响其他内容。
Qwen3-Omni-Flash-2025-12-01 发布说明
Qwen3-Omni-Flash-2025-12-01 是一个升级的原生多模态模型,提升了实时音视频交互、系统提示控制以及跨文本、图像、音频和视频模态的多语言支持。
SAPO:一种稳定且高性能的强化学习方法,用于训练大语言模型
Qwen 推出了软自适应策略优化(SAPO),这是一种 RL 方法,通过用平滑、温度控制的门控函数取代硬裁剪,从而提升 LLM 训练的稳定性和样本效率。
Qwen3-TTS-Flash 更新:49 种音色、10 种语言和 9 种方言
Qwen3-TTS-Flash 是一款旗舰级文本转语音模型,支持 49 种高质量音色、10 种语言和 9 种中文方言,具备改进的韵律和自然的语速。
Qwen DeepResearch 2511 发布
Qwen 已发布 Qwen DeepResearch 2511,这是一款利用多代理协作机制的 AI 研究助理,旨在降低初始灵感与深度技术验证之间的摩擦。
Qwen3Guard 发布:面向 LLM 的实时安全防护栏
Qwen 推出 Qwen3Guard,这是一系列安全防护模型,提供 Gen 和 Stream 两种变体,可对提示和响应进行实时、多语言的安全分类。
Qwen-Image-Edit 发布说明
Qwen-Image-Edit 是一个拥有 20B 参数的图像编辑模型,利用 Qwen2.5-VL 和 VAE Encoder,实现精确的语义与外观编辑,包括双语文本修改。
Qwen-Image 发布:原生文本渲染与精确图像编辑
Qwen-Image 是一个 20B MMDiT 图像基础模型,提供业界领先的复杂文本渲染和精确图像编辑能力。
Qwen GSPO:可扩展的语言模型强化学习
Qwen 引入了 Group Sequence Policy Optimization(GSPO),这是一种序列级别的强化学习算法,相较于 GRPO 在训练稳定性和效率上都有显著提升,尤其适用于混合专家(MoE)模型。
Qwen-MT Turbo 发布说明
Qwen 发布了 Qwen-MT(qwen-mt-turbo),这是一款基于轻量级 MoE 的翻译模型,支持 92 种语言,具备高度可定制性且 API 成本低廉。
Qwen3-Coder 发布说明
Qwen 已发布 Qwen3-Coder,这是一款混合专家模型,在代理式编码、浏览器使用和工具使用方面实现了开源模型的最新水平,性能可与 Claude Sonnet 4 相媲美。
Qwen-TTS 更新:支持中文方言和双语合成
Qwen 已发布 Qwen-TTS (qwen-tts-latest) 的更新,新增对北京话、上海话和四川话方言的支持,并支持中英双语合成。
Qwen VLo:统一的多模态理解与生成
Qwen VLo 是一个统一的多模态模型,通过在单一系统中结合高质量图像生成、开放式编辑和精确的视觉理解,弥合感知与创作之间的鸿沟。
Qwen3 Embedding 与 Reranker 发布
Qwen 已发布 Qwen3 Embedding 系列,这是一套基于 Qwen3 基础模型的专有模型,旨在实现跨 100 多种语言的最先进文本嵌入、检索和重排序。
Qwen3 发布说明:混合思考与多语言 MoE 模型
Qwen 已发布 Qwen3,这是一系列开放权重模型,具备可扩展推理的混合思考模式,并支持 119 种语言。
QVQ-Max 视觉推理模型发布
Qwen 已发布 QVQ-Max,这是一款能够分析图像和视频,以解决数学、编程和创意任务中复杂问题的视觉推理模型。
Qwen2.5-VL-32B 发布说明
Qwen 已发布 Qwen2.5-VL-32B-Instruct,这是一款通过强化学习优化的视觉语言模型,具备卓越的数学推理能力、细粒度的图像理解以及符合人类偏好的响应。
QwQ-32B 发布说明 / 新功能
Qwen 发布了 QwQ-32B,这是一个 320亿参数的推理模型,利用扩展的强化学习来实现与更大的 DeepSeek-R1 相当的性能。
QwQ-Max-Preview 发布
Qwen 已推出 QwQ-Max-Preview,一个基于 Qwen2.5-Max 构建的预览推理模型,在数学、编码和 Agent 相关工作流程方面表现出色。
Qwen2.5-Max 发布说明
Qwen 发布了 Qwen2.5-Max,这是一个在超过 20 万亿个 token 上预训练的大规模 Mixture-of-Experts (MoE) 模型,可通过 API 和 Qwen Chat 使用。
Qwen2.5-1M 发布:开源 7B 和 14B 模型,支持 1M Token 上下文及基于 vLLM 的推理框架
Qwen 发布了开源的 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M 模型,支持高达 100 万 token 的上下文,并配有优化的基于 vLLM 的推理框架,可实现 3-7 倍的预填充加速,并保持与 GPT-4o-mini 相当的短任务性能。