Mistral AI Devstral 发布
Mistral AI 和 All Hands AI 推出了 Devstral,这是一款专为软件工程任务设计的智能体大语言模型 (LLM)。Devstral 在 Apache 2.0 许可下发布,并通过与代码智能体脚手架集成,针对解决现实世界的 GitHub 问题进行了优化。
在 SWE-Bench Verified 上的高性能表现
Devstral 在 SWE-Bench Verified 基准测试中表现优于之前的开源最先进 (SoTA) 模型,该数据集由 500 个经过人工筛选的真实 GitHub 问题组成。
关键性能指标包括:
- 分数: Devstral 在 SWE-Bench Verified 上实现了 46.8% 的分数,比之前的开源 SoTA 模型高出 6 个百分点以上。
- 与大型模型的对比: 当使用 OpenHands 测试脚手架进行评估时,Devstral 的表现优于规模大得多的模型,包括 Deepseek-V3-0324 (671B) 和 Qwen3 232B-A22B。
- 与闭源模型的对比: Devstral 超过了几个闭源替代方案,包括 GPT-4.1-mini,增幅超过 20%。
软件工程领域的智能体能力
与擅长编写独立函数或代码补全等原子化编码任务的典型 LLM 不同,Devstral 旨在处理复杂的软件工程问题。这包括:
- 上下文理解: 在大型代码库的上下文中理解代码的能力。
- 关系映射: 识别系统不同组件之间的连接。
- 缺陷识别: 在复杂的函数中发现细微的缺陷。
为了实现这些能力,Devstral 经过训练以解决真实的 GitHub 问题,并通过 OpenHands 或 SWE-Agent 等智能体脚手架运行,这些脚手架负责管理模型与测试用例之间的接口。
部署的灵活性与硬件要求
Devstral 旨在实现高效率,使其能够部署在各种环境中:
- 本地部署: 该模型足够轻量,可以在单个 RTX 4090 GPU 或配备 32GB RAM 的 Mac 上运行,适用于设备端使用。
- 企业级使用: 由于其性能和本地部署能力,对于受严格安全和合规性要求的隐私敏感型代码库,它是进行智能体编码的切实可行方案。
- IDE 集成: Devstral 可以作为模型选择选项集成到智能体编码 IDE、插件或环境中。
可用性与定价
Devstral 通过多种渠道面向社区和企业用户提供:
- 开源: 该模型在 Apache 2.0 许可下免费发布,并可以从 HuggingFace、Ollama、Kaggle、Unsloth 和 LM Studio 下载。
- API 访问: 该模型可通过 Mistral AI 的 API 以
devstral-small-2505的名称提供。定价为每百万输入 token 0.1 美元,每百万输出 token 0.3 美元,与 Mistral Small 3.1 的定价一致。 - 企业定制: Mistral AI 通过其应用 AI 团队提供私有代码库的微调、持续预训练和蒸馏服务。
未来展望
Devstral 目前处于研究预览阶段。Mistral AI 已宣布,一个更大的智能体编码模型正在开发中,预计将在未来几周内推出。
Sources
- OriginalDevstral
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch