DeepSeek 推出视觉能力

DeepSeek 已在其聊天界面中引入了视觉能力,允许模型分析并描述图像内容。此次更新使平台超越了简单的光学字符识别 (OCR),向真正的图像理解迈进,使用户能够针对视觉数据进行提问并获得描述性响应。

图像理解 vs. 图像生成

DeepSeek 的新视觉功能旨在进行图像理解,而非图像创作。该模型可以识别物体、描述场景并解释视觉上下文,但它无法生成新图像或修改现有图像。

对于那些没有尝试的人来说,这使得 Deepseek 能够理解图片(而不仅仅是从中提取文本),它可以描述图片中的内容,但这并不是一个图像生成系统,因此你不能要求它修改图像。

用户体验与性能

早期用户反馈表明,该视觉系统运行快速且拥有广泛的知识库,可用于识别各种物体。一些用户指出,该功能在进行更广泛的推广之前,已在中国进行了一段时间的 A/B 测试。

  • 性能: 用户将该系统描述为“非常出色且快速”,并指出训练集似乎足够大,能够准确识别各种照片中“是什么以及在哪里”。
  • 可用性: 有报告称,该功能在正式宣布之前已在部分用户中存在了数月,这表明其采用了分阶段部署。

当前局限性与开发者需求

尽管增加了视觉功能,用户仍发现当前功能集中存在若干差距,并对 API 集成表达了强烈需求。

缺乏 API 支持

开发者之间的一个主要争议点是目前 DeepSeek API 中缺乏视觉支持。开发者指出,视觉功能支持的 API 对于与其它框架集成(例如 Claude Agents SDK)至关重要。相比于 Qwen 或 Gemini Flash Lite 等更昂贵的替代方案,用户更倾向于使用 DeepSeek 的视觉能力。

缺失多模态功能

虽然增加了视觉功能,但平台仍缺乏集成的音频能力。用户指出聊天应用中缺少原生的文本转语音 (TTS) 和语音转文本 (STT/ASR) 功能。

技术文档

值得注意的是,关于此次更新缺乏官方技术文档。用户表达了希望看到一份正式的帖子,详细说明模型的具体能力、准确性指标和质量参数。

社区观察

一些用户报告称,模型最近在提供中文响应或推理时有所增加,引发了关于模型底层行为进行静默更新的猜测。

Sources