DeepSeek-V4-Flash-Vision-Exp 發布說明
DeepSeek 已發布 DeepSeek-V4-Flash-Vision-Exp,這是一款透過 DeepSeek API 可用的實驗性多模態模型。此模型能將視覺理解與基於文字的推理及工具使用整合,顯著提升多模態代理的效能,接近 Opus-4.8 的水準。
多模態效能與功能
DeepSeek-V4-Flash-Vision-Exp 保持與標準 DeepSeek-V4-Flash 模型相同的文字能力,包括推理、世界知識與代理功能。主要進步在於其多模態能力,於多模態代理基準測試中表現顯著超越 V4-Flash,效能已接近 Opus-4.8。
代理工作流程與視覺理解
該模型設計用於與代理框架無縫整合。透過結合視覺理解與多樣化的工具,DeepSeek-V4-Flash-Vision-Exp 可支援更實際且複雜的工作流程,使模型能解讀視覺資料以執行任務。
API 整合與實作
開發者可使用 model='deepseek-v4-flash-vision-exp' 來存取此模型。為促進快速採用,DeepSeek Harness 0.1.1 同步發布,提供開箱即用的支援。
輸入與計費
- 輸入格式:模型支援混合文字與影像輸入。影像可透過外部 URL、base64 編碼或 Files API 提供。
- 計費:影像會被分詞計費,每張影像最多消耗 384 個 token。這些 token 的定價與 V4-Flash 一致。
- 支援的端點:模型支援 Chat Completions、Messages 與 Responses。
Files API 上線
隨著模型發布,DeepSeek 同時推出免費使用的 Files API。此 API 允許使用者上傳一次影像,並在後續請求中透過 file_id 參考該影像。此架構可降低請求頻寬,並消除在多個 API 呼叫中重複上傳相同影像的需求。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch