DeepSeek 推出視覺能力

DeepSeek 已在其聊天介面中引入了視覺能力,讓模型能夠分析並描述圖片內容。這次更新讓平台超越了簡單的光學字元辨識 (OCR),邁向真正的圖像理解,使用戶能夠針對視覺數據進行提問並獲得描述性的回應。

圖像理解 vs. 圖像生成

DeepSeek 的新視覺功能旨在進行圖像理解,而非圖像創作。模型可以識別物體、描述場景並解釋視覺語境,但它無法生成新圖像或修改現有圖像。

對於尚未嘗試的人來說,這讓 Deepseek 能夠理解圖片(而不僅僅是從中提取文字),它可以描述圖片中的內容,但這不是一個圖像生成系統,因此你不能要求它修改圖片。

使用者體驗與效能

早期使用者回饋顯示,該視覺系統反應快速,且擁有廣泛的知識庫來識別各種物體。部分使用者指出,該功能在進行更廣泛的推廣之前,已在中國進行了一段時間的 A/B 測試。

  • 效能: 使用者將該系統描述為「非常出色且快速」,並指出訓練集似乎足夠大,能夠準確識別各種照片中「是什麼以及在哪裡」。
  • 可用性: 有報告指出,該功能在正式公告之前,已在部分使用者中出現了數月之久,顯示其為分階段部署。

目前的限制與開發者需求

儘管增加了視覺功能,使用者仍發現目前的功能集中存在若干缺口,並對 API 整合提出了強烈需求。

缺乏 API 支援

A 核心爭議點在於開發者目前無法在 DeepSeek API 中使用視覺支援。開發者指出,具備視覺能力的 API 對於與其他框架(例如 Claude Agents SDK)整合至關重要。相較於 Qwen 或 Gemini Flash Lite 等較昂貴的替代方案,使用者更傾向於使用 DeepSeek 的視覺能力。

缺失的多模態功能

雖然增加了視覺功能,但平台仍缺乏整合的音訊能力。使用者指出聊天應用程式中缺乏原生的文字轉語音 (TTS) 和語音轉文字 (STT/ASR) 功能。

技術文件

目前注意到缺乏關於此次更新的官方技術文件。使用者表示希望能有一份正式的貼文,詳細說明模型的具體能力、準確度指標以及品質參數。

社群觀察

部分使用者報告,模型近期提供中文回應或推理的頻率有所增加,這導致了對模型底層行為進行靜默更新的猜測。

Sources