zai-org/GLM-4

GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型

解决的问题

GLM-4-0414 是一系列开源大语言模型,旨在提供对话、推理和复杂任务执行方面的高性能能力。它旨在缩小开源模型与 GPT-4o 等专有系统之间的差距,特别是在工程代码、函数调用和研究型写作等领域。

工作原理

该系列采用了不同的模型规模(9B 和 32B)和专门的训练路径:

  • GLM-4-32B-0414:在 15T 高质量数据上进行预训练,并通过人类偏好对齐、拒绝采样和强化学习进行精调,以增强指令遵循和智能体能力。
  • GLM-Z1 (Reasoning):通过专注于数学、代码和逻辑的冷启动和扩展强化学习开发,实现“深度思考”。
  • GLM-Z1-Rumination:通过端到端强化学习扩展训练的专用推理模型,能够进行更长时间的思考过程,并使用搜索工具解决开放式复杂问题。
  • YaRN:一种用于处理超过原生 32K 上下文长度输入的上下文扩展技术。

适用对象

  • 正在寻找用于本地部署的高性能开源模型的开发者
  • 需要具备强大数学和逻辑推理能力的模型的 AI 研究人员
  • 需要能够生成工程级代码并执行智能体任务函数调用的软件工程师
  • 可以利用轻量级 9B 模型的资源受限环境下的用户

亮点

  • 多样化的模型范围:提供 9B 和 32B 参数规模的 Base、Chat、Reasoning 和 Rumination 变体。
  • 强大的智能体能力:在函数调用、Artifact 生成和基于搜索的问答方面表现出色。
  • 深度推理:Z1 系列为复杂的数学和逻辑任务提供高级能力。
  • 广泛的集成:已在 vLLM、transformers 和 llama.cpp 中正式实现。

相关

  • 项目
  • Dispatch
  • Dispatch
  • 项目
  • Dispatch