zai-org/GLM-4
GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型
解決する課題
GLM-4-0414は、対話、推論、および複雑なタスク実行において高性能な能力を提供するために設計された一連のオープンソース大規模言語モデルです。エンジニアリングコード、関数呼び出し、研究スタイルの執筆などの分野において、オープンソースモデルとGPT-4oのようなプロプライエタリなシステムとの間のギャップを埋めることを目的としています。
仕組み
このシリーズは、異なるモデルサイズ(9Bおよび32B)と特化したトレーニングパスを利用しています:
- GLM-4-32B-0414: 15Tの高品質データで事前学習され、指示への追従性とエージェント能力を強化するために、人間の好みの調整、拒絶サンプリング、および強化学習を用いて洗練されています。
- GLM-Z1 (Reasoning): 数学、コード、および論理に焦点を当てたコールドスタートと拡張強化学習を通じて開発され、「深い思考」を可能にします。
- GLM-Z1-Rumination: エンドツーエンドの強化学習のスケーリングを通じてトレーニングされた特化型推論モデルであり、より長い思考プロセスと、オープンエンドで複雑な問題を解決するための検索ツールの使用が可能です。
- YaRN: ネイティブの32Kコンテキスト長を超える入力を処理するために使用されるコンテキスト拡張技術です。
対象者
- ローカルデプロイ用に高性能なオープンソースモデルを探している開発者。
- 強力な数学的および論理的推論能力を持つモデルを必要とするAI研究者。
- エンジニアリンググレードのコード生成や、エージェントタスクのための関数呼び出しが可能なモデルを必要とするソフトウェアエンジニア。
- 軽量な9Bモデルを利用できる、リソース制約のある環境のユーザー。
ハイライト
- 多様なモデル範囲: 9Bおよび32Bのパラメータサイズにわたって、Base、Chat、Reasoning、およびRuminationのバリアントを提供します。
- 強力なエージェント能力: 関数呼び出し、Artifact生成、および検索ベースのQ&Aにおいて高いパフォーマンスを発揮します。
- 深い推論: Z1シリーズは、複雑な数学的および論理的タスクに対して高度な能力を提供します。
- 幅広い統合: vLLM、transformers、およびllama.cppに公式に実装されています。
関連
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト
- Dispatch