zai-org/GLM-4
GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型
解决的问题
GLM-4-0414 是一系列开源大语言模型,旨在提供对话、推理和复杂任务执行方面的高性能能力。它旨在缩小开源模型与 GPT-4o 等专有系统之间的差距,特别是在工程代码、函数调用和研究型写作等领域。
工作原理
该系列采用了不同的模型规模(9B 和 32B)和专门的训练路径:
- GLM-4-32B-0414:在 15T 高质量数据上进行预训练,并通过人类偏好对齐、拒绝采样和强化学习进行精调,以增强指令遵循和智能体能力。
- GLM-Z1 (Reasoning):通过专注于数学、代码和逻辑的冷启动和扩展强化学习开发,实现“深度思考”。
- GLM-Z1-Rumination:通过端到端强化学习扩展训练的专用推理模型,能够进行更长时间的思考过程,并使用搜索工具解决开放式复杂问题。
- YaRN:一种用于处理超过原生 32K 上下文长度输入的上下文扩展技术。
适用对象
- 正在寻找用于本地部署的高性能开源模型的开发者。
- 需要具备强大数学和逻辑推理能力的模型的 AI 研究人员。
- 需要能够生成工程级代码并执行智能体任务函数调用的软件工程师。
- 可以利用轻量级 9B 模型的资源受限环境下的用户。
亮点
- 多样化的模型范围:提供 9B 和 32B 参数规模的 Base、Chat、Reasoning 和 Rumination 变体。
- 强大的智能体能力:在函数调用、Artifact 生成和基于搜索的问答方面表现出色。
- 深度推理:Z1 系列为复杂的数学和逻辑任务提供高级能力。
- 广泛的集成:已在 vLLM、transformers 和 llama.cpp 中正式实现。
相关
- 项目
- Dispatch
- Dispatch
- 项目
- Dispatch