DeepSeekがビジョン機能を導入
DeepSeekは、チャットインターフェースにビジョン機能を導入し、モデルが画像の内容を分析して説明することを可能にしました。このアップデートにより、プラットフォームは単純な光学文字認識(OCR)を超え、真の画像理解へと進化し、ユーザーが視覚データについて質問し、説明的な回答を受け取れるようになります。
画像理解 vs. 画像生成
DeepSeekの新しいビジョン機能は、画像の作成ではなく、画像の理解のために設計されています。モデルは物体を識別し、シーンを説明し、視覚的な文脈を解釈できますが、新しい画像を生成したり、既存の画像を修正したりすることはできません。
画像を試していない方のために言えば、これによりDeepseekは(単にテキストを抽出するだけでなく)写真を理解することができ、写真の中に何があるかを説明できます。しかし、これは画像生成システムではないため、画像の修正を依頼することはできません。
ユーザーエクスペリエンスとパフォーマンス
初期のユーザーフィードバックによると、ビジョンシステムは高速であり、多様な物体を識別するための幅広い知識ベースを備えています。一部のユーザーは、この機能が広範な展開の前に、特に中国で一定期間A/Bテストとして利用可能であったことを指摘しています。
- パフォーマンス: ユーザーはシステムを「非常に良く、かつ高速」と表現しており、さまざまな写真の中で「何がどこにあるか」を正確に識別するために、トレーニングセットが十分に大きいと思われると述べています。
- 可用性: 一般的な発表の前に、数ヶ月間一部のユーザーに対して機能が存在していたという報告があり、段階的な展開が行われたことを示唆しています。
現在の制限事項と開発者の需要
ビジョン機能の追加にもかかわらず、ユーザーは現在の機能セットにおけるいくつかのギャップを特定し、API統合への強い需要を表明しています。
APIサポートの欠如
開発者の間で主な論争点となっているのは、DeepSeek APIにおける現在のビジョンサポートの欠如です。開発者は、Claude Agents SDKなどの他のフレームワークとの統合において、ビジョン対応のAPIが不可欠であると指摘しています。QwenやGemini Flash Liteのような、より高価な代替案よりもDeepSeekのビジョン機能が好まれるという意向が示されています。
不足しているマルチモーダル機能
ビジョン機能が追加されましたが、プラットフォームにはまだ統合された音声機能が欠けてています。ユーザーは、チャットアプリケーション内でのネイティブなテキスト読み上げ(TTS)および音声文字起こし(STT/ASR)機能の欠如を指摘しています。
技術文書の不足
このアップデートに関する公式の技術文書が不足していることが指摘されています。ユーザーは、モデルの具体的な能力、精度指標、および品質パラメータを詳細に説明する正式な投稿を求めています。
コミュニティの観察
一部のユーザーは、モデルが中国語で回答や推論を行うケースが最近増加していると報告しており、モデルの基盤となる動作へのサイレントアップデートが行われたのではないかという推測を呼んでいます。