Qwen グローバルバッチ ロードバランス MoE LLM トレーニング
Qwenは、個々のマイクロバッチではなくグローバルバッチ全体でバランスを計算することにより、MoEモデルの性能を向上させ、エキスパートの専門化を可能にするグローバルバッチロードバランシング損失を導入します。
Qwen2.5-Math-PRMとProcessBenchのリリース
Qwenは、中間推論エラーを特定するように設計された最先端のProcess Reward ModelであるQwen2.5-Math-PRM-7Bと72Bをリリースし、さらに段階レベルの評価ベンチマークであるProcessBenchも公開しました。
QVQ-72B-Preview リリース
Qwenは、Qwen2-VL-72Bベースのオープンウェイトマルチモーダル推論モデルであるQVQ-72B-Previewをリリースしました。MMMUベンチマークでスコア70.3を達成しています。
QwQ-32B-Preview: 深層推論機能の探求
Qwenは、内部のチェーン・オブ・ソート思考プロセスを通じて深層推論と複雑な問題解決のために設計されたモデルであるQwQ-32B-Previewを発表しました。
Qwen2.5-Turbo 1Mトークン コンテキスト長 リリース
Qwenは、モデルのコンテキストウィンドウを100万トークンに拡張し、推論速度を大幅に向上させながら、短いシーケンスタスクにおいて競争力のあるパフォーマンスを維持するQwen2.5-Turboをリリースしました。
Qwen2.5-Coder シリーズ リリースノート
Qwenは、0.5Bから32Bまでの6つのモデルサイズを備えたQwen2.5-Coderシリーズをリリースしました。32B-Instructモデルは、コーディングタスクにおいてGPT-4oに匹敵するオープンソースSOTAパフォーマンスを達成しています。
Qwen2.5 リリースノート:新しい基盤、Coder、Math モデル
Qwen は、汎用 LLM、専門の Coder と Math バリアント、そして更新された Qwen2-VL-72B を含む、オープンウェイトの密集デコーダーオンリーモデルの包括的スイートである Qwen2.5 をリリースしました。
Qwen2.5 LLMシリーズリリース
QwenはQwen2.5シリーズを発表しました – 0.5Bから72Bパラメータまでのオープンソースデコーダー専用LLMで、Qwen2の能力を2倍にし、18兆トークン規模のデータセット拡大、知識・コーディング・数学・アラインメントの大幅な向上、そして128Kトークンのコンテキストウィンドウを追加しています。
Qwen2.5-Coder リリースノート
Qwenは、5.5兆トークンで学習されたオープンソースのコーディングモデルシリーズであるQwen2.5-Coderをリリースしました。このシリーズは、コード生成、推論、数学において大規模モデルを上回ります。
Qwen2.5-Math リリースノート
Qwen は Qwen2.5-Math をリリースしました。これはバイリンガル推論と Tool-Integrated Reasoning(TIR)をサポートするオープンソースの数学 LLM シリーズで、複雑な数学ベンチマークにおいて主要なクローズドソースモデルを上回ります。
Qwen2-VL リリース:オープンソース 2B/7B ビジョン・ランゲージモデルと 72B API、最先端の画像、動画、マルチリンガル機能を搭載
Qwen は Qwen2-VL をリリースしました。この新しいビジョン・ランゲージモデルシリーズ(2B、7B オープンソース、72B API)は、画像、文書、マルチリンガル、長時間動画の理解において最先端の性能を実現し、ビジュアルエージェント機能もサポートします。
Qwen2-Audio リリースノート
Qwen2-Audioは、音声チャットと音声分析が可能な音声言語モデルで、8以上の言語と方言に対応し、複数のベンチマークで従来の最先端性能を上回ります。
Qwen2-Math リリースノート
QwenはQwen2-Mathをリリースしました。これは1.5B、7B、72Bの専門的な数学LLMシリーズで、GPT-4oを含む複数のクローズドソースモデルを数学ベンチマークで上回ります。
Qwen2 リリースノート / 新機能
QwenはQwen2を発表しました。これは0.5Bから72Bパラメータまでの5つのオープンソースモデルで、27の追加言語への多言語サポートが強化され、コンテキスト長は最大128Kトークンです。
Qwen-Agent: 8kから1MコンテキストへのLLMの汎化
Qwenは、8kコンテキストモデルが1Mトークンを処理できるエージェントフレームワークを開発し、特定のベンチマークでRAGおよびネイティブの長コンテキストモデルの両方を上回っています。
Qwen-Max-0428 リリースノート
Qwenは、MT-Bench で Qwen1.5-110B-Chat を上回り、Chatbot Arena リーダーボードでトップ10にランクインした指示チューニング済みチャットモデル Qwen-Max-0428 をリリースしました。
Qwen1.5-110B リリースノート / 新機能
Qwen は Qwen1.5 シリーズで初めて 1000 億パラメータを超える Qwen1.5-110B をリリースし、Llama-3-70B に対抗できる性能と Qwen1.5-72B に比べて大幅な改善を実現しました。
CodeQwen1.5 リリースノート
Qwenは、92のプログラミング言語と64KトークンのコンテキストウィンドウをサポートするオープンソースのコードLLMであるCodeQwen1.5-7Bをリリースし、開発者の生産性向上を目指しています。
Qwen1.5-32B リリースノート / 新機能
Qwenは、72Bバージョンと比較して高性能と低メモリ・推論コストのバランスを取るよう設計された Qwen1.5-32B と Qwen1.5-32B-Chat をリリースしました。
Qwen1.5-MoE-A2.7B リリースノート
Qwenは、27億のアクティブ化パラメータのみで7B密結合モデルと同等の性能を発揮するMixture-of-Expertsモデル、Qwen1.5-MoE-A2.7Bを導入しました。
Qwen1.5 リリースノート / 新機能
Qwenは、0.5Bから110BパラメータまでのオープンソースのベースモデルとチャットモデルのシリーズであるQwen1.5をリリースしました。人間の好み合わせの改善、多言語対応、そしてHugging Face `transformers` へのネイティブ統合が特徴です。
Qwen-VL-Plus と Qwen-VL-Max のリリース
Qwen は、マルチモーダルタスクで GPT-4V と Gemini Ultra に匹敵し、中国語テキスト理解ではそれらを上回る大規模視覚言語モデルである Qwen-VL-Plus と Qwen-VL-Max をリリースしました。
Qwen の紹介:包括的な LLM と LMM フレームワーク
Qwen は、AGI を目指すプロジェクトであり、多言語対応の大規模言語モデル(LLM)と大規模マルチモーダルモデル(LMM)を一連に提供します。オープンソース版は 1.8B から 72B パラメータまでのモデルが含まれます。
OFASys: マルチモーダル・マルチタスク学習のためのフレームワーク
Qwenは、単一行のInstructionインターフェースで複雑なタスクやモダリティを定義できるようにすることで、マルチモーダル・マルチタスク学習を簡素化するAIフレームワーク、OFASysを紹介します。
Chinese CLIP: 中国語における対照的なビジョン・言語事前学習
Qwenは、クロスモーダル検索と画像分類において、英語中心のCLIPモデルの文化的・言語的制約を克服するよう設計されたビジョン・言語モデル、Chinese CLIPをリリースしました。
OFA: オールインワンモデルの構築に向けて
OFAは、指示ベースのマルチタスク事前学習を用いて、異なるモダリティ間の理解タスクと生成タスクを単一のフレームワークに統合した統合マルチモーダル事前学習モデルです。