51

Qwen2.5-1M 發布:開源 7B 與 14B 模型,支援 1M‑Token 上下文並基於 vLLM 的推理框架

Qwen 發布開源的 Qwen2.5‑7B‑Instruct‑1M 與 Qwen2.5‑14B‑Instruct‑1M 模型,支援多達 1 百萬 token 的上下文,並附帶一個經過優化的基於 vLLM 的推理框架,該框架可使預填充速度提升 3×–7×,同時保持與 GPT‑4o‑mini 相當的短任務表現。

52

Qwen2.5-VL 版本說明

Qwen 已發布 Qwen2.5-VL,這是一種旗艦視覺語言模型,提供 3B、7B 和 72B 三種規模,引入了先進的視覺代理能力、長視頻理解和結構化文檔解析。

53

Qwen 用於 MoE LLM 訓練的 Global-Batch 負載平衡

Qwen 引入了一種 global-batch 負載平衡損失,透過在整個 global batch 而非單個 micro-batches 上計算平衡,來提升 MoE 模型的性能並實現專家專業化。

54

Qwen2.5-Math-PRM 與 ProcessBench 發布

Qwen 發布了 Qwen2.5-Math-PRM-7B 和 72B,這些是最先進的 Process Reward Model,旨在識別數學問題解決過程中的中間推理錯誤,並附帶 ProcessBench,一個新的步驟級評估基準。

55

QVQ-72B-Preview 發布

Qwen 已發布 QVQ-72B-Preview,這是一個基於 Qwen2-VL-72B 的開放權重多模態推理模型,在 MMMU 基準測試中達到 70.3 分。

56

QwQ-32B-Preview: 探索深度推理能力

Qwen 已推出 QwQ-32B-Preview,一個透過內部鏈式思考過程進行深度推理和複雜問題解決的模型。

57

Qwen2.5-Turbo 1M Token Context Length Release

Qwen 發布了 Qwen2.5-Turbo,將模型的上下文視窗擴展至 100 萬個 token,同時顯著提升推理速度,並在短序列任務上保持競爭力的表現。

58

Qwen2.5-Coder 系列發布說明

Qwen 已發布 Qwen2.5-Coder 系列,包含從 0.5B 到 32B 的六種模型規模,其中 32B-Instruct 模型在編碼任務上達到與 GPT-4o 相當的開源 SOTA 性能。

59

Qwen2.5 版本說明:全新基礎模型、Coder 與 Math 模型

Qwen 已發布 Qwen2.5,這是一套完整的開放權重密集解碼器僅模型,涵蓋通用大型語言模型、專門的 Coder 與 Math 變體,以及更新的 Qwen2-VL-72B。

60

Qwen2.5 LLM 系列發布

Qwen 宣佈了 Qwen2.5 系列——開源的僅解碼器 LLM,參數從 0.5B 到 72B,能力是 Qwen2 的兩倍,並加入了更大的 18 兆 token 資料集,在知識、程式碼、數學與對齊方面取得重大提升,且支援 128K token 的上下文窗口。

61

Qwen2.5-Coder 版本說明

Qwen 已發布 Qwen2.5-Coder,一系列在 5.5 兆 token 上訓練的開源程式碼模型,在程式碼生成、推理與數學方面優於更大的模型。

62

Qwen2.5-Math 版本說明

Qwen 已發布 Qwen2.5-Math,一系列支援雙語推理與工具整合推理(TIR)的開源數學大型語言模型,於複雜數學基準測試上超越領先的封閉源模型。

63

Qwen2-VL 發布:開源 2B/7B 視覺語言模型與 72B API,具備最先進的圖像、影片與多語言能力

Qwen 發布了 Qwen2-VL,一個全新的視覺語言模型系列(2B、7B 開源、72B API),在圖像、文件、多語言以及長影片理解方面達到最先進的表現,同時支援視覺代理功能。

64

Qwen2-Audio 發布說明

Qwen2-Audio 是一款音頻語言模型,能夠進行語音聊天與音頻分析,支援超過八種語言與方言,並在多項基準測試上超越先前的最先進表現。

65

Qwen2-Math 發布說明

Qwen 已發布 Qwen2-Math,一系列專門的數學大型語言模型(1.5B、7B 與 72B),在數學基準測試中超越多個封閉源模型,包括 GPT-4o。

66

Qwen2 版本說明 / 新功能

Qwen 宣佈 Qwen2,這是一系列五個開源模型,參數規模從 0.5B 到 72B,增強了對額外 27 種語言的多語言支援,且上下文長度最高可達 128K 令牌。

67

Qwen-Agent:將 LLM 從 8k 通用化至 1M 上下文

Qwen 開發了一套代理框架,使 8k 上下文模型能處理 1M token,並在特定基準測試中超越 RAG 與原生長上下文模型。

68

Qwen-Max-0428 發布說明

Qwen 已發布 Qwen-Max-0428,一款指令微調的聊天模型,在 MT-Bench 上優於 Qwen1.5-110B-Chat,並在 Chatbot Arena 排行榜中位列前十。

69

Qwen1.5-110B 版本說明 / 新功能

Qwen 已發布 Qwen1.5-110B,這是 Qwen1.5 系列中首個突破 1000 億參數的模型,提供與 Llama-3-70B 競爭的性能,並較 Qwen1.5-72B 有顯著提升。

70

CodeQwen1.5 版本說明

Qwen 發布了 CodeQwen1.5-7B,一款支援 92 種程式語言與 64K 令牌上下文視窗的開源程式碼大型語言模型,以提升開發者生產力。

71

Qwen1.5-32B 發布說明 / 有什麼新功能

Qwen 已發布 Qwen1.5-32B 與 Qwen1.5-32B-Chat,這兩款模型旨在在相較於 72B 版本的情況下,兼顧高效能與較低的記憶體與推論成本。

72

Qwen1.5-MoE-A2.7B 版本說明

Qwen 推出 Qwen1.5-MoE-A2.7B,一款混合專家模型,其效能與 7B 密集模型相當,但僅使用 27 億個啟用參數。

73

Qwen1.5 發行說明 / 新功能

Qwen 已發布 Qwen1.5,這是一系列開源的基礎與聊天模型,參數規模從 0.5B 到 110B 不等,具備提升的人類對齊、多語言能力,以及原生的 Hugging Face transformers 整合。

74

Qwen-VL-Plus 與 Qwen-VL-Max 發布

Qwen 已發布 Qwen-VL-Plus 與 Qwen-VL-Max,這兩款大型視覺語言模型在多模態任務上與 GPT-4V 與 Gemini Ultra 表現相當,且在中文文本理解上超越它們。

75

介紹 Qwen:全面的 LLM 與 LMM 框架

Qwen 是一個朝向 AGI 的專案,由一系列多語言大型語言模型 (LLMs) 與大型多模態模型 (LMMs) 組成,包含從 1.8B 到 72B 參數的開源版本。

76

OFASys:多模態多任務學習框架

Qwen 推出 OFASys,一個 AI 框架,透過單行 Instruction 介面讓使用者定義複雜的任務與多模態,從而簡化多模態多任務學習。

77

Chinese CLIP:中文對比視覺語言預訓練

Qwen 已發布 Chinese CLIP,一個旨在克服以英語為中心的 CLIP 模型在跨模態檢索與圖像分類上文化與語言限制的視覺語言模型。

78

OFA:朝向構建一個全能模型

OFA 是一個統一的多模態預訓練模型,透過指令式多任務預訓練,將跨模態的理解與生成任務整合於單一框架中。