中国の AI ラボ DeepSeek は、テキストと一緒に画像を受け入れることができる V4-Flash モデルの実験版である deepseek-v4-flash-vision-exp を密かに出荷し、主力モデル ファミリの最も明らかなギャップの 1 つを埋めました。同社の公式 API ページに記載されているこのリリースは、V4-Flash-0731 と V4-Pro-0813 が更新されてからわずか数週間後に到着し、開発者が長年要望していたスクリーンショット、グラフ、写真を業界で最も安価なフロンティア層モデルの 1 つに直接フィードする方法を提供します。 最新の AI 開発 を追跡しているチームにとって、これは、DeepSeek が価格面で積極的に欧米のライバルを下回りつつ、機能ごとに匹敵するつもりであることを示すもう 1 つのシグナルです。

新しいモデルの機能

DeepSeek の API ドキュメントによると、「deepseek-v4-flash-vision-exp」を使用すると、ユーザーは「モデルに画像の説明、スクリーンショットからのテキストの読み取り、グラフの分析などを依頼する」ことができます。このモデルは、ファイル名や宣言された MIME タイプではなく、実際のファイルの内容から検出されるフォーマットを使用して、JPEG、PNG、GIF、および WebP ファイルを受け入れます。これは、拡張子の不一致のバグを防ぐための小さな、しかし思慮深い詳細です。

開発者は 3 つの方法で画像を渡すことができます。base64 でエンコードされたインライン データ URL (リクエスト本文の 48 MiB 制限の対象)、公的にアクセス可能な外部 URL (最大 8,192 文字、画像あたり 32 MiB、ダウンロード時間は 60 秒)、または Files API 経由です。すべてが標準の OpenAI 互換 Chat Completions 形式を使用しており、モデルには DeepSeek の Anthropic 互換エンドポイント経由でもアクセスできます。つまり、既存の Claude SDK コードは最小限の変更でバックエンドを切り替えることができます。

価格設定: コモディティーレートでのフロンティアビジョン

実験モデルは、V4-Flash の積極的な価格シートを継承しています。入力トークンのコストは、オフピーク時では 100 万回あたり 0.22 ドル、キャッシュ ミスの場合はピーク時で 0.44 ドルですが、オフピーク時のキャッシュ ヒットでは 100 万回あたり 0.007 ドルまで下がります。出力トークンの価格はオフピーク時で 100 万あたり 0.66 ドル、ピーク時で 1.32 ドルです。画像はその寸法に基づいてトークンに変換され、テキスト トークンと一緒に請求されます。

この価格設定が重要なのは、米国の大手プロバイダーが提供する同等のマルチモーダルサービスを大幅に下回り、DeepSeek が年間を通じて繰り広げてきた価格戦争が続いているためである。このモデルには、ファミリーの主要な仕様も引き継がれています。つまり、100 万トークンのコンテキスト ウィンドウ、最大 384,000 トークンの最大出力、思考モードと非思考モードのサポート、JSON 出力、ツール呼び出し、同時実行制限 2,500 です。この仕様は、研究用のおもちゃではなく、大量生産ワークロードの真の主力製品として位置付けられています。

開発者がこれに必死だった理由

この発表は Hacker News に掲載され、すぐに 450 ポイント以上を集めました。その熱狂には特定の起源がありました。 DeepSeek のテキストのみの V4-Flash-0731 は、それが見えると 信じている という評判を築いていました。複数の開発者の報告によると、このモデルは視覚機能があると想定し、それができないことが判明すると、テキストベースの画像分析ツールを発明したり、接続されたデバイスからスクリーンショットを表示する方法がないと気づく前に取得したりするなど、その場しのぎの精緻な回避策を講じていたという。

「DeepSeek v4 Flash 0731は視覚機能があると頻繁に思い込み、実際には見えないと判明するとテキストベースの画像解析ツールを発明することに頼っていると聞いた」と、あるコメント投稿者は他の数人の報告と同じように書いた。コーディングまたは自動化パイプラインのエージェントとしてモデルを使用している人にとって、新しいビジョンのバリアントは混乱による失敗のカテゴリー全体を排除するはずです。

800x800 のキャッチ

このリリースには制限がないわけではなく、Hacker News での最も鋭い批判は、画像解像度という 1 つの数字に的を絞っていました。ドキュメントには、推論の前に、アスペクト比を維持しながら、総ピクセル数が 800x800 の画像とほぼ一​​致するように、すべての画像のサイズが自動的に変更されると記載されています。

「これは便利ですが、OCR や他の多くのアプリケーションではもう少し高くする必要があります (例: A4 またはレター サイズのページ全体を入れるなど)」とある開発者は主張し、別の開発者は 800x800 の上限が「多くのユースケースを無効にする」と率直に答えました。高密度のドキュメント、全ページ スキャン、またはきめ細かい UI デバッグの場合、解像度の上限により、開発者はより高解像度の、より高価な代替手段を選択する可能性があります。スレッドで提案されている一般的な回避策の 1 つは、大きなページをタイルに分割し、個別にフィードすることです。

もう 1 つの未解決の質問は、オープン性です。 DeepSeek はオープンウェイトのリリースで評判を築きましたが、同社はビジョンのバリエーションがこれに続くかどうかについては明らかにしていません。コメント投稿者は、これは同社の最近の「Thinking with Visual Primitives」研究に由来するのではないかと推測しており、その重み付けが約束されていると伝えられているが、何も確認されていない。特に、このモデルは実験的としてリストされており、「-exp」接尾辞が付いており、DeepSeek が反復を期待していることを示しています。

静かだが戦略的なリリース

杭州に本拠を置く研究所では、視力の低下により多忙な期間が続いており、同研究所は 8 月をかけて、V4-Flash-0731、エージェント指向の DeepSeek Harness フレームワーク、V4-Pro-0813 のリフレッシュ、そして今回のマルチモーダル入力などの着実なアップデートを出荷してきました。 DeepSeek は、単一の大ヒット製品をリリースするのではなく、モデルを開発者ツールチェーン内に保持する迅速な段階的なリリースを実行しています。これは、西側の研究機関がコーディング エージェントで追求しているのと同じ土地獲得戦略です。

AI 業界全体にとって、このメッセージはよく知られたものですが、既存企業にとっては依然として不快なものです。かつてはプレミアム価格設定が正当化されていた機能 (100 万トークンのコンテキストでの画像理解) が、現在では 100 万トークンあたり数セントの水準に達しつつあります。実験的なラベルは DeepSeek にモデルを改良する余地を与えていますが、開発者はすでにそれをスクリーンショット主導のワークフローに組み込み始めています。もはや問題は、DeepSeek が競合他社のマルチモーダル機能セットに匹敵できるかどうかではなく、市場の残りの企業がその価格にどれだけ早く適応できるかということです。

AI の一歩先を行く

最新の AI モデルのリリース、ベンチマーク バトル、業界分析については、AI Buzz Wire をブックマークしてください。

AI ニュースをもっと読む→