DeepSeek-V4-Flash-Vision-Exp 发布说明

DeepSeek 发布了 DeepSeek-V4-Flash-Vision-Exp,这是一个通过 DeepSeek API 提供的实验性多模态模型。该模型实现了视觉理解与基于文本的推理及工具使用的集成,显著提升了多模态智能体(agent)的性能,使其达到了接近 Opus-4.8 的水平。

多模态性能与能力

DeepSeek-V4-Flash-Vision-Exp 保持了与标准 DeepSeek-V4-Flash 模型相同的文本能力,包括其推理、世界知识和智能体能力。主要的进步在于其多模态能力,它在多模态智能体基准测试中表现出相对于 V4-Flash 的显著性能飞跃,使其性能接近 Opus-4.8。

智能体工作流与视觉理解

该模型旨在与智能体框架无缝协作。通过将视觉理解与多种工具相结合,DeepSeek-V4-Flash-Vision-Exp 允许进行更实用且复杂的任务流,这些任务流需要模型解释视觉数据以执行任务。

API 集成与实现

开发者可以使用标识符 model='deepseek-v4-flash-vision-exp' 来访问该模型。为了便于立即采用,DeepSeek Harness 0.1.1 与该模型同步发布,以提供开箱即用的支持。

输入与计费

  • 输入格式:该模型支持文本与图像混合输入。图像可以通过外部 URL、base64 编码或 Files API 提供。
  • 计费:图像会被转换为 token 进行计费,每张图像最多消耗 384 个 token。这些 token 的定价与 V4-Flash 定价保持一致。
  • 支持的端点:该模型支持 Chat Completions、Messages 和 Responses。

Files API 发布

随着模型的发布,DeepSeek 还推出了一个免费使用的 Files API。该 API 允许用户上传一次图像并在随后的请求中通过 file_id 进行引用。这种架构减少了请求带宽并消除了在多次 API 调用中重复上传同一图像的需求。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch