Laboratorul chinezesc de inteligență artificială DeepSeek a livrat în liniște deepseek-v4-flash-vision-exp, o versiune experimentală a modelului său V4-Flash care poate accepta imagini alături de text, închizând una dintre cele mai evidente lacune din familia sa de modele emblematică. Lansarea, documentată pe paginile oficiale API ale companiei, vine la doar câteva săptămâni după reîmprospătările V4-Flash-0731 și V4-Pro-0813 și oferă dezvoltatorilor o modalitate mult solicitată de a alimenta capturi de ecran, diagrame și fotografii direct într-unul dintre cele mai ieftine modele de frontieră din industrie. Pentru echipele care urmăresc cele mai recente evoluții AI, este un alt semnal că DeepSeek intenționează să se potrivească cu rivalii occidentali caracteristică pentru caracteristică, subcotându-i în același timp agresiv la preț.
Ce face noul model
Conform documentației API-ului DeepSeek, „deepseek-v4-flash-vision-exp” permite utilizatorilor „să solicite modelului să descrie imagini, să citească text din capturi de ecran, să analizeze diagrame și multe altele”. Modelul acceptă fișiere JPEG, PNG, GIF și WebP, cu formatul detectat din conținutul fișierului real, mai degrabă decât numele fișierului sau tipul MIME declarat - un detaliu mic, dar atent care previne erorile de extensie nepotrivită.
Dezvoltatorii pot transmite imagini în trei moduri: adrese URL de date inline codificate în baza 64 (supus unei limite de 48 MiB de corp de solicitare), URL-uri externe accesibile public (până la 8.192 de caractere, 32 MiB per imagine, cu o fereastră de descărcare de 60 de secunde) sau prin API-ul Files. Totul folosește formatul standard de finalizare a chatului compatibil cu OpenAI, iar modelul este accesibil și prin punctul final compatibil cu Antropic al DeepSeek, ceea ce înseamnă că codul Claude SDK existent poate schimba backend-urile cu modificări minime.
Prețuri: viziune de frontieră la ratele mărfurilor
Modelul experimental moștenește fișa de preț agresivă a V4-Flash. Jetoanele de intrare costă 0,22 USD per milion în afara orelor de vârf și 0,44 USD la vârf pentru pierderile de cache, scăzând la doar 0,007 USD per milion la accesările din cache în timpul orelor de vârf. Jetoanele de ieșire au un preț de 0,66 USD per milion în afara perioadei de vârf și 1,32 USD la vârf. Imaginile sunt convertite în jetoane pe baza dimensiunilor lor și facturate împreună cu jetoane text.
Acest preț contează, deoarece subcotează dramatic ofertele multimodale comparabile de la furnizorii importanți din SUA, continuând războiul prețurilor pe care DeepSeek l-a purtat tot anul. Modelul include, de asemenea, specificațiile principale ale familiei: o fereastră de context de 1 milion de tokenuri, până la 384.000 de jetoane de producție maximă, suport pentru moduri de gândire și non-gândire, ieșire JSON, apeluri de instrumente și o limită de concurență de 2.500 - specificații care îl poziționează ca un adevărat cal de muncă pentru sarcini de producție de mare volum, mai degrabă decât un volum mare de muncă de cercetare.
De ce dezvoltatorii erau disperați pentru asta
Lansarea a aterizat pe Hacker News, unde a adunat rapid peste 450 de puncte – iar entuziasmul are o poveste de origine specifică. V4-Flash-0731 de la DeepSeek doar text și-a dezvoltat o reputație pentru că credea că poate vedea. Mai mulți dezvoltatori au raportat că modelul ar presupune că are capacități de viziune, apoi ar improviza soluții elaborate atunci când a descoperit că nu poate - inclusiv inventarea de instrumente de analiză a imaginilor bazate pe text și extragerea de capturi de ecran de pe dispozitivele conectate înainte de a realiza că nu are cum să le vizualizeze.
„Am auzit că DeepSeek v4 Flash 0731 a presupus frecvent că are capacități de viziune și apoi recurge la inventarea instrumentelor de analiză a imaginilor bazate pe text atunci când constată că de fapt nu poate vedea”, a scris un comentator, făcând ecou rapoartele altora. Pentru oricine folosește modelul ca agent în conducte de codare sau automatizare, noua variantă de viziune ar trebui să elimine o întreagă categorie de defecțiuni cauzate de confuzie.
Captura de 800x800
Lansarea nu este lipsită de limitări, iar cele mai aspre critici de la Hacker News au vizat un număr: rezoluția imaginii. Documentația afirmă că, înainte de deducere, fiecare imagine este redimensionată automat, astfel încât numărul total de pixeli să se potrivească aproximativ cu o imagine de 800x800, păstrând raportul de aspect.
„Este util, dar pentru OCR și o mulțime de alte aplicații trebuie să fie puțin mai mare (de exemplu: introducerea unei pagini întregi de dimensiunea A4/Letter)”, a argumentat un dezvoltator, iar altul răspunzând direct că limita de 800x800 „omoara o mulțime de cazuri de utilizare”. Pentru documente dense, scanări pe o pagină completă sau depanare cu granulație fină a interfeței de utilizare, plafonul de rezoluție ar putea împinge dezvoltatorii către alternative de rezoluție mai mare – și mai scumpe. O soluție populară sugerată în fir: împărțiți paginile mari în plăci și alimentați-le separat.
Cealaltă întrebare deschisă este deschiderea. DeepSeek și-a construit reputația pe lansarea de greutăți deschise, dar compania nu a spus dacă va urma varianta de viziune. Comentatorii au speculat că ar putea deriva din cercetarea recentă a companiei „Thinking with Visual Primitives”, pentru care s-au promis ponderi, dar nimic nu a fost confirmat. În special, modelul este listat ca experimental - sufixul „-exp” – semnalând că DeepSeek se așteaptă să repete.
O lansare liniștită, dar strategică
Scăderea viziunii continuă o perioadă aglomerată pentru laboratorul din Hangzhou, care a petrecut în august livrând actualizări constante: V4-Flash-0731, cadrul DeepSeek Harness orientat către agent, reîmprospătarea V4-Pro-0813 și acum intrare multimodală. Mai degrabă decât o singură lansare de succes, DeepSeek execută o cadență de lansări rapide, incrementale, care își mențin modelele în interiorul lanțurilor de instrumente pentru dezvoltatori - aceeași strategie de acaparare a terenurilor pe care o urmăresc laboratoarele occidentale cu agenții de codare.
Pentru industria de inteligență artificială în general, mesajul este familiar, dar încă inconfortabil pentru operatorii tradiționali: capabilitățile care justificau cândva prețurile premium - înțelegerea imaginii într-un context de milioane de jetoane - ajung acum la câțiva cenți per milion de jetoane. Eticheta experimentală oferă DeepSeek spațiu pentru a perfecționa modelul, dar dezvoltatorii au început deja să-l conecteze în fluxuri de lucru bazate pe capturi de ecran. Întrebarea nu mai este dacă DeepSeek poate să se potrivească cu setul de caracteristici multimodale ale rivalilor săi, ci cât de repede se adaptează restul pieței la prețurile sale.
Rămâi înaintea AI
Pentru cele mai recente lansări de modele AI, bătălii de referință și analize din industrie, marcați AI Buzz Wire.
Citește mai multe știri AI →