DeepSeek v4 Flash Vision Experimental Model – API Guide and Community Insights
TL;DR
DeepSeek は deepseek‑v4‑flash‑vision‑exp モデルをリリースしました。このモデルは OpenAI 互換エンドポイントを介して、JPEG、PNG、GIF、WebP 形式の画像とテキストを一度のリクエストで受け付け、3 種類のアップロード方法を提供し、トークンベースの課金方式と明確なサイズ/寸法制限を備えています。
モデルの機能
- 一度のリクエストで画像とテキストを受け付け、画像の説明、OCR、チャート解析などを可能にします。
- JPEG、PNG、GIF、WebP 形式をサポート。ファイル名や MIME タイプではなく、ファイルの内容に基づいて検出されます。
画像の送信方法
すべての方法で、content がブロックの配列となる OpenAI 互換の chat.completions.create ペイロードを使用します。
1. インライン Base64 データ URL
import base64, openai
client = openai.OpenAI(api_key="<key>", base_url="https://api.deepseek.com")
with open("image.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":f"data:image/jpeg;base64,{b64}"}}]}],
)
print(resp.choices[0].message.content)
リクエストボディの 48 MiB 制限にカウントされます。
2. 外部 URL
{"type":"image_url","image_url":{"url":"https://example.com/image.jpg"}}
- URL の長さ ≤ 8192 文字。
- 画像ファイル ≤ 32 MiB。
- 60 秒以内にダウンロードが完了する必要があります。
3. Files API リファレンス
Files API で一度アップロードし、返された file_id を使用します:
{"type":"file","file_id":"file-api-xxxxxxxx"}
- 画像サイズは最大 64 MiB まで可能。
- インラインの 48 MiB 制限を回避でき、複数リクエストで再利用するのに最適です。
インラインファイルデータの代替方法
{"type":"file","file_data":"data:image/jpeg;base64,<BASE64>","filename":"image.jpg"}
(file_data と file_id は互いに排他的です。)
画像の詳細度の制御
image_url ブロックでは detail フィールドを設定できます:
| 値 | 効果 |
|---|---|
low |
推論前に 512×512 に縮小(安価で高速)。 |
high / original |
元の解像度を維持。 |
auto |
現在は original と同等。 |
例:
{"type":"image_url","image_url":{"url":"https://example.com/img.jpg","detail":"low"}}
Files API を使うべきタイミング
- リクエストボディが 48 MiB を超える場合。
- 画像サイズが 32 MiB を超える場合(Files API でのみ可能)。
- 同じ画像を複数回使用する場合。
トークン使用量と課金
- 画像は自動リサイズ後にピクセル数に基づいてトークンに変換されます。
- 384×384 ピクセル未満の画像は拡大され、それ以上の画像は約 800×800 ピクセル(≒ 640 kpx)に縮小されます。
- 画像 1 枚あたり最大 384 トークン(元の解像度にかかわらず)。
- トークンコストは DeepSeek のオンライン画像トークン計算機で推定できます。
制限の要約
| 制限 | 値 |
|---|---|
| 対応形式 | JPEG、PNG、GIF、WebP |
| 外部 URL の長さ | 8192 文字 |
| リクエストボディサイズ | 48 MiB |
| 最大画像サイズ(インライン/URL) | 32 MiB |
| 最大画像サイズ(Files API) | 64 MiB |
| 1リクエストあたりの最大画像数 | 600 |
1リクエストあたりの最大画像合計サイズ(file_id なし) |
64 MiB |
1リクエストあたりの最大画像合計サイズ(file_id あり) |
200 MiB |
| 1辺あたりの最大寸法 | 8192 ピクセル(15 枚以上ある場合 4096 ピクセルに低下) |
制限事項
- 画像は
userメッセージでのみ許可されます。systemやassistantメッセージに画像ブロックがあると 400 エラーが返されます。 - 画像を受け付けるのは vision モデル(
deepseek‑v4‑flash‑vision‑exp)のみ。他のモデルは 400 エラーと「このモデルは画像をサポートしていません」として拒否します。 - 予約済みの画像プレースホルダートークンを含むテキストも拒否されます。
Anthropic 互換エンドポイントの使用
DeepSeek は Anthropic 風の /messages エンドポイント(https://api.deepseek.com/anthropic)も提供しています。画像ブロックの構造は異なります:
{"type":"image","source":{"type":"base64","media_type":"image/jpeg","data":"<BASE64>"}}
source.type |
OpenAI 互換 |
|---|---|
base64 |
インライン Base64 データ URL |
url |
外部画像 URL |
file |
Files API の file_id(ヘッダー anthropic-beta: files-api-2025-04-14 を必須) |
Responses API の使用
同じ3つの入力方法が Responses API でも利用可能ですが、画像は input_image 部分に配置されます:
{"type":"input_image","image_url":"https://example.com/img.jpg","detail":"low"}
file_id 入力では detail は無視され、image_url と file_id を併用することはできません。
コミュニティの反応(Hacker News 投稿より)
- コスト効率:ユーザーは 384 トークンの上限が約 1 ドルあたり 2,500 枚 の画像に対応することを指摘し、大規模なビジョンタスクに非常に安価であると評価しています。(ciberado)
- 解像度の懸念:一部のコメントでは、デフォルトの 800×800 有効解像度が OCR や詳細なドキュメントスキャンには不十分であると指摘しています。(zmmmmm)
- ベンチマーク性能:初期のベンチマークでは、以前の DeepSeek バージョンを上回り、他のマルチモーダルモデルと競合する結果を示していますが、特定の画像認識タスクでは精度がまちまちであると報告するユーザーもいます。(ttul, jerksate)
- 機能の同等性:ビジョン対応モデルがテキスト専用の flash モデルを置き換えるのか、それとも遅延/コストの理由で別々に維持されるのか、ユーザーの間で議論されています。(cjg007)
- ツールの不足:現在、画像出力がツールコールの結果として提供されていないため、スクリーンショットや視覚的検証が必要なエージェントワークフローでは使い勝手が制限されています。(RobertLong)
- 肯定的な評価:長年の待望のビジョン機能追加に、多くのコミュニティメンバーが歓迎の声を上げています。(BrucecarlL, prtmnth)
クイックスタートチェックリスト
- API キーを取得:DeepSeek から取得します。
- アップロード方法を選択(インライン Base64、外部 URL、または Files API)。
- 低解像度処理が必要な場合は
detailを設定。 - 画像は
userメッセージにのみ配置することを確認。 - トークン使用量を監視 – 1 枚の画像あたり最大 384 トークンが発生。
- OpenAI 互換エンドポイントまたは好ましい場合は Anthropic エンドポイントでテスト。
まとめ
DeepSeek の deepseek‑v4‑flash‑vision‑exp は、シンプルな OpenAI 互換 API、柔軟な画像送信オプション、およびトークン化された画像サイズに基づく明確な課金モデルを備えて、フラッシュシリーズに画像理解機能をもたらしました。有効解像度が約 800×800 ピクセルに制限されているものの、1枚あたりの低コストと広い制限範囲により、多くのビジョン拡張アプリケーションにとって魅力的な選択肢となっています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch