Chińskie laboratorium AI DeepSeek po cichu wypuściło deepseek-v4-flash-vision-exp, eksperymentalną wersję swojego modelu V4-Flash, która może akceptować obrazy obok tekstu, wypełniając jedną z najbardziej rażących luk w swojej flagowej rodzinie modeli. Wydanie, udokumentowane na oficjalnych stronach API firmy, pojawia się zaledwie kilka tygodni po odświeżeniu wersji V4-Flash-0731 i V4-Pro-0813 i zapewnia programistom długo oczekiwaną możliwość przesyłania zrzutów ekranu, wykresów i zdjęć bezpośrednio do jednego z najtańszych modeli z pierwszej półki w branży. Dla zespołów śledzących najnowsze osiągnięcia AI jest to kolejny sygnał, że DeepSeek zamierza dorównać zachodnim rywalom pod względem funkcji, jednocześnie agresywnie podcinając ich cenę.

Co robi nowy model

Według dokumentacji API DeepSeek, `deepseek-v4-flash-vision-exp` pozwala użytkownikom „poprosić model o opisanie obrazów, odczytanie tekstu ze zrzutów ekranu, analizę wykresów i nie tylko”. Model akceptuje pliki JPEG, PNG, GIF i WebP, których format jest wykrywany na podstawie rzeczywistej zawartości pliku, a nie nazwy pliku lub zadeklarowanego typu MIME — mały, ale przemyślany szczegół, który zapobiega błędom związanym z niedopasowanym rozszerzeniem.

Programiści mogą przekazywać obrazy na trzy sposoby: adresy URL danych wbudowanych w formacie Base64 (z zastrzeżeniem limitu treści żądania wynoszącego 48 MiB), publicznie dostępne zewnętrzne adresy URL (do 8192 znaków, 32 MiB na obraz, z 60-sekundowym oknem pobierania) lub za pośrednictwem interfejsu API Files. Wszystko wykorzystuje standardowy format Chat Completions zgodny z OpenAI, a model jest również dostępny za pośrednictwem punktu końcowego DeepSeek kompatybilnego z Anthropic, co oznacza, że ​​istniejący kod Claude SDK może przełączać backendy przy minimalnych zmianach.

Ceny: wizja graniczna przy stawkach towarowych

Model eksperymentalny dziedziczy agresywną cenę V4-Flash. Tokeny wejściowe kosztują 0,22 dolara za milion poza szczytem i 0,44 dolara w szczycie w przypadku chybień w pamięci podręcznej, spadając do zaledwie 0,007 dolara za milion w przypadku trafień w pamięć podręczną poza godzinami szczytu. Tokeny wyjściowe kosztują 0,66 dolara za milion poza szczytem i 1,32 dolara w szczycie. Obrazy są konwertowane na tokeny na podstawie ich wymiarów i rozliczane razem z tokenami tekstowymi.

Ceny te mają znaczenie, ponieważ dramatycznie podcinają porównywalne oferty multimodalne głównych amerykańskich dostawców, kontynuując wojnę cenową, którą DeepSeek toczy przez cały rok. Model zachowuje również główne specyfikacje rodziny: okno kontekstowe na 1 milion tokenów, maksymalnie 384 tys. tokenów maksymalnej wydajności, obsługę trybów myślenia i niemyślenia, dane wyjściowe w formacie JSON, wywołania narzędzi i limit współbieżności wynoszący 2500 — specyfikacje, które pozycjonują go jako prawdziwego konia pociągowego do obciążeń produkcyjnych na dużą skalę, a nie jako zabawkę badawczą.

Dlaczego programiści desperacko tego pragnęli

Premiera wylądowała w Hacker News, gdzie szybko zebrała ponad 450 punktów – a entuzjazm ma specyficzną historię. Urządzenie DeepSeek V4-Flash-0731 obsługujące wyłącznie tekst i zyskało reputację osoby wierzącej, że widzi. Wielu programistów zgłosiło, że model zakładał, że ma możliwości widzenia, a następnie improwizował skomplikowane obejścia, gdy odkrył, że tak nie jest – w tym wymyślał tekstowe narzędzia do analizy obrazu i pobierał zrzuty ekranu z podłączonych urządzeń, zanim zdał sobie sprawę, że nie ma możliwości ich wyświetlenia.

„Słyszałem, że DeepSeek v4 Flash 0731 często zakładał, że ma możliwości widzenia, a następnie uciekał się do wymyślania tekstowych narzędzi do analizy obrazu, gdy okazało się, że w rzeczywistości nie widzi” – napisał jeden z komentatorów, powtarzając raporty kilku innych. Dla każdego, kto używa modelu jako agenta w procesach kodowania lub automatyzacji, nowy wariant wizji powinien wyeliminować całą kategorię błędów wynikających z zamieszania.

Zaczep 800x800

Wydanie nie jest pozbawione ograniczeń, a najostrzejsza krytyka w serwisie Hacker News dotyczyła jednego numeru: rozdzielczości obrazu. Dokumentacja stwierdza, że ​​przed wnioskowaniem rozmiar każdego obrazu jest automatycznie zmieniany, tak aby jego całkowita liczba pikseli mniej więcej odpowiadała obrazowi o wymiarach 800x800, zachowując proporcje.

„Jest to przydatne, ale w przypadku OCR i wielu innych aplikacji musi być nieco wyższe (np. umieszczenie pełnej strony formatu A4/Letter)” – argumentował jeden z programistów, a inny odpowiedział bez ogródek, że ograniczenie do 800 x 800 „eliminuje wiele przypadków użycia”. W przypadku gęstych dokumentów, skanów całostronicowych lub szczegółowego debugowania interfejsu użytkownika maksymalna rozdzielczość może skłonić programistów do korzystania z alternatyw o wyższej rozdzielczości i droższych. Jedno popularne obejście sugerowane w wątku: podziel duże strony na kafelki i podawaj je osobno.

Drugą otwartą kwestią jest otwartość. DeepSeek zbudował swoją reputację na wypuszczaniu otwartych ciężarów, ale firma nie podała, czy pojawi się wariant wizyjny. Komentatorzy spekulują, że może to wynikać z niedawnego badania firmy „Thinking with Visual Primitives”, dla którego podobno obiecano wagi, ale nic nie zostało potwierdzone. Warto zauważyć, że model jest oznaczony jako eksperymentalny – z przyrostkiem „-exp” – co oznacza, że ​​DeepSeek spodziewa się iteracji.

Cicha, ale strategiczna wersja

Spadek wizji to kolejny trudny okres dla laboratorium w Hangzhou, które w sierpniu dostarczało ciągłe aktualizacje: V4-Flash-0731, zorientowany na agenta framework DeepSeek Harness, odświeżenie V4-Pro-0813, a teraz wejście multimodalne. Zamiast pojedynczego hitowego wprowadzenia na rynek, DeepSeek realizuje serię szybkich, przyrostowych wydań, które utrzymują modele w łańcuchach narzędzi dla programistów — to ta sama strategia zawłaszczania ziemi, którą zachodnie laboratoria realizują za pomocą agentów kodujących.

Dla całej branży sztucznej inteligencji przesłanie jest znane, ale nadal niewygodne dla operatorów zasiedziałych na rynku: możliwości, które kiedyś uzasadniały wyższe ceny – zrozumienie obrazu w kontekście miliona tokenów – obecnie osiągają kilka centów za milion tokenów. Etykieta eksperymentalna daje DeepSeekowi miejsce na udoskonalenie modelu, ale programiści zaczęli już podłączać go do przepływów pracy opartych na zrzutach ekranu. Pytanie nie brzmi już, czy DeepSeek może dorównać multimodalnym zestawom funkcji swoich rywali, ale jak szybko reszta rynku dostosowuje się do jego cen.

Wyprzedź sztuczną inteligencję

Najnowsze wydania modeli sztucznej inteligencji, bitwy porównawcze i analizy branżowe znajdziesz w zakładce AI Buzz Wire.

Przeczytaj więcej aktualności o sztucznej inteligencji →