DeepSeek-V4-Flash アップデート

DeepSeek-V4-Flash パブリックベータリリース

DeepSeekは、公式のDeepSeek-V4-Flash APIのパブリックベータをローンチしました。このアップデートは、エージェント機能を大幅に向上させることに焦点を当てており、ベンチマーク結果は以前のV4-Pro-Previewを上回っています。更新されたモデルを使用するには、開発者はAPI呼び出しでモデル名をdeepseek-v4-flashに設定するだけです。

パフォーマンスとベンチマーク結果

DeepSeek-V4-Flashは、エージェントおよびコーディングタスクにおいて大幅な改善を示しています。以下のベンチマークダ。以下のベンチマークスコアが報告されました:

  • Terminal Bench 2.1: 82.7
  • NL2Repo: 54.2
  • Cybergym: 76.7
  • DeepSWE: 54.4
  • Toolathlon verified: 70.3
  • Agent Last Exam: 25.2
  • Automation Bench (Public): 25.1
  • DSBench-FullStack (Internal): 68.7
  • DSBench-Hard (Internal): 59.6

Code Agentタスクでは、モデルはDeepSeek Harness minimal modeを最大努力レベルで使用し、topp=0.95およびtemperature=1.0でテストされました。

技術仕様と統合

DeepSeek-V4-Flash-0731は、DeepSeek-V4-Flash-Previewと同じモデルアーキテクチャとサイズを維持しており、性能向上は再ポストトレーニングによるものです。

主な統合の詳細は以下の通りです:

  • Responses API: Responses API形式のネイティブサポート。
  • Codex Adaptation: Codex統合のために特別に適応されました。
  • Scope: このアップデートはdeepseek-v4-flash APIにのみ適用されます。DeepSeek-V4-Pro APIおよびAPP/WEBモデルは変更されず、近いうちに公式のV4-Proリリースが予定されています。

コミュニティの洞察と実際の応用

ユーザーの議論では、モデルの高いインテリジェンス対コスト比が強調されており、多くの開発者がこれをコーディングおよびエージェントワークフローの主要な「ワークホース」として活用しています。

コスト効率とパフォーマンス

開発者は、大量タスクにおいて極めて低い運用コストを報告しています。あるユーザーは、30日間で3,467件のAPIリクエストにわたって3億2300万トークン以上を使用し、わずか4.55米ドルしか費やしていないと述べました。別のユーザーは、MCPサーバーとコンテキストリデューサーツールを介して複雑なタスクを実装し、約0.50米ドル/時間で済んだと報告しています。

ユースケースの専門化

コミュニティからのフィードバックでは、DeepSeek-V4-Flashは実装と「グランドワーク」に使用され、より高価なモデルは高レベルの計画とレビューに予約される階層的なモデル戦略が示唆されています:

"私は90%のタスクでフラッシュモデルを使用しています...変更を1000行未満に抑え、自分でアーキテクチャの決定を行い、フロンティアモデルとほとんど違いを感じません。"

ローカルデプロイとハードウェア

そのサイズと効率性により、フラッシュモデルはより大規模なフロンティアモデルと比較してローカルホスティングにおいてよりアクセスしやすいと見なされています。ユーザーは、デュアルRTX Pro 6000 GPUなどのプロシューマーハードウェア上で動作できることを指摘しており、クラウドベースのAPIに対する高速かつプライベートな代替手段を提供しています。

DeepSeek API エボリューションタイムライン

DeepSeekは2024年と2025年にかけて、モデル提供を急速に反復してきました:

  • July 2026: エージェント機能が強化されたDeepSeek-V4-Flashのパブリックベータリリース。
  • April 2026: V4-ProとV4-Flashが導入され、レガシーなdeepseek-chatdeepseek-reasonerの名前が置き換えられました。
  • December 2025: DeepSeek-V3.2へのアップグレードで、明確な思考モードと非思考モードが導入されました。
  • August 2025: ハイブリッド推論アーキテクチャとツール使用の改善を特徴とするDeepSeek-V3.1リリース(SWE-bench Verified: 66.0)。
  • January 2025: deepseek-reasoner(DeepSeek-R1)のローンチ。
  • December 2024: deepseek-chatのDeepSeek-V3へのアップグレード。
  • August 2024: API価格を削減するためのディスク上のコンテキストキャッシング技術の実装。

Sources