Das chinesische KI-Labor DeepSeek hat stillschweigend deepseek-v4-flash-vision-exp ausgeliefert, eine experimentelle Version seines V4-Flash-Modells, die Bilder neben Text akzeptieren kann und damit eine der eklatantesten Lücken in seiner Flaggschiff-Modellfamilie schließt. Die auf den offiziellen API-Seiten des Unternehmens dokumentierte Veröffentlichung erscheint nur wenige Wochen nach der Aktualisierung von V4-Flash-0731 und V4-Pro-0813 und bietet Entwicklern eine seit langem gewünschte Möglichkeit, Screenshots, Diagramme und Fotos direkt in eines der günstigsten Frontier-Tier-Modelle der Branche einzuspeisen. Für Teams, die [die neuesten KI-Entwicklungen] verfolgen (https://aibuzzwire.news), ist dies ein weiteres Signal dafür, dass DeepSeek beabsichtigt, die westlichen Konkurrenten Feature für Feature zu erreichen und sie gleichzeitig preislich aggressiv zu unterbieten.
What the new model does
Laut der API-Dokumentation von DeepSeek können Benutzer mit „deepseek-v4-flash-vision-exp“ „das Modell bitten, Bilder zu beschreiben, Text aus Screenshots zu lesen, Diagramme zu analysieren und mehr“. Das Modell akzeptiert JPEG-, PNG-, GIF- und WebP-Dateien, wobei das Format anhand des tatsächlichen Dateiinhalts und nicht anhand des Dateinamens oder des deklarierten MIME-Typs erkannt wird – ein kleines, aber durchdachtes Detail, das Fehler durch nicht übereinstimmende Erweiterungen verhindert.
Entwickler können Bilder auf drei Arten weitergeben: Base64-codierte Inline-Daten-URLs (vorbehaltlich einer Beschränkung auf 48 MiB für den Anforderungstext), öffentlich zugängliche externe URLs (bis zu 8.192 Zeichen, 32 MiB pro Bild, mit einem Download-Fenster von 60 Sekunden) oder über die Datei-API. Alles verwendet das standardmäßige OpenAI-kompatible Chat Completions-Format, und das Modell ist auch über den Anthropic-kompatiblen Endpunkt von DeepSeek erreichbar – was bedeutet, dass vorhandener Claude SDK-Code mit minimalen Änderungen Backends wechseln kann.
Pricing: frontier vision at commodity rates
Das experimentelle Modell erbt das aggressive Preisblatt von V4-Flash. Eingabe-Tokens kosten außerhalb der Spitzenzeiten 0,22 US-Dollar pro Million und in der Spitzenzeit 0,44 US-Dollar für Cache-Fehler und sinken bei Cache-Treffern außerhalb der Spitzenzeiten auf nur 0,007 US-Dollar pro Million. Der Preis für Output-Token liegt außerhalb der Spitzenzeiten bei 0,66 US-Dollar pro Million und in Spitzenzeiten bei 1,32 US-Dollar. Bilder werden anhand ihrer Abmessungen in Token umgewandelt und zusammen mit Text-Tokens abgerechnet.
Diese Preisgestaltung ist wichtig, weil sie vergleichbare multimodale Angebote großer US-Anbieter dramatisch unterbietet und damit den Preiskampf fortsetzt, den DeepSeek das ganze Jahr über geführt hat. Das Modell übernimmt auch die Hauptspezifikationen der Familie: ein 1-Millionen-Token-Kontextfenster, bis zu 384.000 Tokens maximaler Ausgabe, Unterstützung für Denk- und Nicht-Denkmodi, JSON-Ausgabe, Tool-Aufrufe und ein Parallelitätslimit von 2.500 – Spezifikationen, die es als echtes Arbeitstier für Arbeitslasten in der Massenproduktion und nicht als Forschungsspielzeug positionieren.
Why developers were desperate for this
Der Start landete bei Hacker News, wo er schnell mehr als 450 Punkte sammelte – und die Begeisterung hat eine bestimmte Ursprungsgeschichte. Das Nur-Text-Programm V4-Flash-0731 von DeepSeek hatte sich den Ruf erworben, zu glauben, es könne sehen. Mehrere Entwickler berichteten, dass das Modell davon ausgegangen sei, dass es über Sehfähigkeiten verfüge, und dann, wenn sich herausstellte, dass dies nicht möglich sei, ausgefeilte Problemumgehungen improvisierten – einschließlich der Erfindung textbasierter Bildanalysetools und der Erstellung von Screenshots von angeschlossenen Geräten, bevor ihnen klar wurde, dass es keine Möglichkeit hatte, diese anzuzeigen.
„Ich habe gehört, dass DeepSeek v4 Flash 0731 häufig davon ausgeht, dass es über Sehfähigkeiten verfügt, und dann auf die Erfindung textbasierter Bildanalysetools zurückgreift, wenn es feststellt, dass es tatsächlich nichts sehen kann“, schrieb ein Kommentator und wiederholte damit Berichte mehrerer anderer. Für jeden, der das Modell als Agent in Codierungs- oder Automatisierungspipelines verwendet, sollte die neue Vision-Variante eine ganze Kategorie verwirrungsbedingter Fehler beseitigen.
Der 800x800-Fang
Die Veröffentlichung ist nicht ohne Einschränkungen und die schärfste Kritik auf Hacker News richtete sich gegen eine Zahl: die Bildauflösung. In der Dokumentation heißt es, dass jedes Bild vor der Schlussfolgerung automatisch in der Größe angepasst wird, sodass seine Gesamtpixelzahl in etwa einem 800x800-Bild entspricht, wobei das Seitenverhältnis erhalten bleibt.
„Es ist nützlich, aber für OCR und viele andere Anwendungen muss es etwas höher sein (z. B. das Einfügen einer vollständigen Seite im A4-/Letter-Format)“, argumentierte ein Entwickler, während ein anderer unverblümt antwortete, dass die 800x800-Grenze „viele Anwendungsfälle zunichte macht.“ Bei dichten Dokumenten, ganzseitigen Scans oder feinkörnigerem UI-Debugging könnte die Auflösungsobergrenze Entwickler zu höher auflösenden – und teureren – Alternativen bewegen. Eine beliebte Problemumgehung, die im Thread vorgeschlagen wurde: Teilen Sie große Seiten in Kacheln auf und füttern Sie sie separat.
The other open question is openness. DeepSeek baute seinen Ruf auf der Veröffentlichung offener Gewichte auf, das Unternehmen hat jedoch nicht gesagt, ob die Vision-Variante folgen wird. Kommentatoren spekulierten, dass dies möglicherweise auf die jüngste „Thinking with Visual Primitives“-Forschung des Unternehmens zurückzuführen sei, für die Berichten zufolge Gewichte versprochen wurden, aber nichts bestätigt wurde. Bemerkenswert ist, dass das Modell als experimentell aufgeführt ist – das Suffix „-exp“ – was signalisiert, dass DeepSeek mit einer Iteration rechnet.
A quiet but strategic release
Der Vision-Rückgang ist für das in Hangzhou ansässige Labor weiterhin eine arbeitsreiche Phase, die den August damit verbracht hat, regelmäßige Updates auszuliefern: V4-Flash-0731, das agentenorientierte DeepSeek Harness-Framework, die V4-Pro-0813-Aktualisierung und jetzt multimodale Eingaben. Anstelle einer einzelnen Blockbuster-Veröffentlichung führt DeepSeek eine Reihe schneller, inkrementeller Veröffentlichungen durch, die seine Modelle innerhalb der Entwickler-Toolchains halten – die gleiche Landraubstrategie, die westliche Labore mit Codierungsagenten verfolgen.
Für die KI-Branche im Allgemeinen ist die Botschaft bekannt, aber für etablierte Unternehmen immer noch unangenehm: Funktionen, die einst Premium-Preise rechtfertigten – Bildverständnis im Millionen-Token-Kontext – erreichen jetzt ein paar Cent pro Million Token. Die experimentelle Bezeichnung gibt DeepSeek Raum, das Modell zu verfeinern, aber Entwickler haben bereits damit begonnen, es in Screenshot-gesteuerte Arbeitsabläufe zu integrieren. Die Frage ist nicht mehr, ob DeepSeek mit dem multimodalen Funktionsumfang seiner Konkurrenten mithalten kann, sondern wie schnell sich der Rest des Marktes an seine Preise anpasst.
Bleiben Sie der KI immer einen Schritt voraus
Für die neuesten KI-Modellveröffentlichungen, Benchmark-Kämpfe und Branchenanalysen setzen Sie ein Lesezeichen auf AI Buzz Wire.
Weitere KI-Neuigkeiten lesen →