51

Qwen2.5-VL 发布说明

Qwen 发布了 Qwen2.5-VL,这是一个旗舰视觉语言模型,提供 3B、7B 和 72B 三种规模,引入了先进的视觉代理能力、长视频理解和结构化文档解析。

52

Qwen 全局批次负载均衡用于 MoE LLM 训练

Qwen 引入了一种全局批次负载均衡损失,通过在整个全局批次而非单个微批次上计算平衡,提高了 MoE 模型性能并实现了专家专业化。

53

Qwen2.5-Math-PRM 和 ProcessBench 发布

Qwen 发布了 Qwen2.5-Math-PRM-7B 和 72B,这些是最先进的过程奖励模型,旨在识别数学问题求解中的中间推理错误,同时发布了 ProcessBench,一个新的逐步评估基准。

54

QVQ-72B-Preview 发布

Qwen 发布了 QVQ-72B-Preview,一个基于 Qwen2-VL-72B 的开放权重多模态推理模型,在 MMMU 基准测试中取得了 70.3 分。

55

QwQ-32B-Preview: 探索深度推理能力

Qwen 已经推出 QwQ-32B-Preview,这是一个专为通过内部思维链过程进行深度推理和复杂问题解决而设计的模型。

56

Qwen2.5-Turbo 1M Token 上下文长度发布

Qwen 发布了 Qwen2.5-Turbo,将模型的上下文窗口扩展到 100 万个 token,同时显著提升推理速度,并在短序列任务上保持竞争力的性能。

57

Qwen2.5-Coder 系列发布说明

Qwen 发布了 Qwen2.5-Coder 系列,包含从 0.5B 到 32B 的六种模型规模,其中 32B-Instruct 模型在编码任务上实现了与 GPT-4o 相当的开源 SOTA 性能。

58

Qwen2.5 发布说明:新基础模型、Coder 与 Math 模型

Qwen 发布了 Qwen2.5,这是一套完整的开源密集解码器模型,涵盖通用大语言模型、专用的 Coder 与 Math 变体,以及更新的 Qwen2-VL-72B。

59

Qwen2.5 LLM 系列发布

Qwen 宣布了 Qwen2.5 系列——开源的仅解码器 LLM,参数规模从 0.5B 到 72B,能力是 Qwen2 的两倍,并加入了更大的 18 万亿 token 数据集,在知识、编码、数学和对齐方面取得显著提升,且拥有 128K token 的上下文窗口。

60

Qwen2.5-Coder 发布说明

Qwen 发布了 Qwen2.5-Coder 系列开源编码模型,该系列模型在 5.5 万亿 token 的训练下,在代码生成、推理和数学方面超越了更大的模型。

61

Qwen2.5-Math 发布说明

Qwen 已发布 Qwen2.5-Math,这是一系列支持双语推理和工具集成推理(TIR)的开源数学 LLM,能够在复杂数学基准上超越领先的闭源模型。

62

Qwen2-VL 发布:开源 2B/7B 视觉语言模型和 72B API,具备最先进的图像、视频和多语言能力

Qwen 发布了 Qwen2-VL,这是一系列新的视觉语言模型(2B、7B 开源,72B API),在图像、文档、多语言和长视频理解方面实现了最先进的性能,同时支持视觉代理功能。

63

Qwen2-Audio 发布说明

Qwen2-Audio 是一种音频语言模型,能够进行语音聊天和音频分析,支持超过八种语言和方言,在多个基准测试中超越了之前的最先进性能。

64

Qwen2-Math 发布说明

Qwen 发布了 Qwen2-Math,一系列专门用于数学的 LLM(1.5B、7B 和 72B),在数学基准测试中超越了包括 GPT-4o 在内的多个闭源模型。

65

Qwen2 发布说明 / 新功能

Qwen 宣布推出 Qwen2 系列,共五个开源模型,参数规模从 0.5B 到 72B,增强了对 27 种额外语言的多语言支持,并支持最长达 128K token 的上下文长度。

66

Qwen-Agent:将大型语言模型从8k扩展到1M上下文

Qwen 开发了一个代理框架,使 8k 上下文模型能够处理 1M 令牌,在特定基准测试中超越了 RAG 和原生长上下文模型。

67

Qwen-Max-0428 发布说明

Qwen 已发布 Qwen-Max-0428,这是一款指令微调的聊天模型,在 MT-Bench 上优于 Qwen1.5-110B-Chat,并在 Chatbot Arena 排行榜中位列前十。

68

Qwen1.5-110B 发布说明 / 新功能

Qwen 已发布 Qwen1.5-110B,这是 Qwen1.5 系列中首个参数量超过 1000 亿的模型,提供了与 Llama-3-70B 竞争的性能,并相较 Qwen1.5-72B 有显著提升。

69

CodeQwen1.5 发布说明

Qwen 已发布 CodeQwen1.5-7B,这是一款支持 92 种编程语言和 64K token 上下文窗口的开源代码大模型,以提升开发者生产力。

70

Qwen1.5-32B 发布说明 / 新功能

Qwen 已发布 Qwen1.5-32B 和 Qwen1.5-32B-Chat,这些模型旨在在保持高性能的同时,相较于 72B 版本降低内存和推理成本。

71

Qwen1.5-MoE-A2.7B 发布说明

Qwen 引入了 Qwen1.5-MoE-A2.7B,这是一款 Mixture-of-Experts 模型,能够在仅使用 27 亿激活参数的情况下匹配 7B 密集模型的性能。

72

Qwen1.5 发布说明 / 新功能

Qwen 已发布 Qwen1.5,这是一系列参数从 0.5B 到 110B 的开源基础模型和聊天模型,具备改进的人类对齐、多语言能力以及原生的 Hugging Face transformers 集成。

73

Qwen-VL-Plus 和 Qwen-VL-Max 发布

Qwen 已发布 Qwen-VL-Plus 和 Qwen-VL-Max,这两款大型视觉语言模型在多模态任务上与 GPT-4V 和 Gemini Ultra 相当,并在中文文本理解方面超越它们。

74

介绍 Qwen:全面的 LLM 与 LMM 框架

Qwen 是一个面向 AGI 的项目,包含一系列多语言的大型语言模型(LLMs)和大型多模态模型(LMMs),其中包括参数规模从 1.8B 到 72B 的开源版本。

75

OFASys:多模态多任务学习框架

Qwen 推出 OFASys,这是一款通过单行 Instruction 接口让用户定义复杂任务和模态,从而简化多模态多任务学习的 AI 框架。

76

中文 CLIP:中文对比视觉语言预训练

Qwen 已发布中文 CLIP,这是一款旨在克服以英语为中心的 CLIP 模型在跨模态检索和图像分类中所面临的文化和语言限制的视觉语言模型。

77

OFA:迈向构建全能模型

OFA 是一个统一的多模态预训练模型,通过基于指令的多任务预训练,将跨模态的理解和生成任务统一到单一框架中。