Lab AI Cina DeepSeek wis kanthi tenang ngirim deepseek-v4-flash-vision-exp, versi eksperimen saka model V4-Flash sing bisa nampa gambar ing sandhinge teks, nutup salah sawijining jurang sing paling mencolok ing kulawarga model unggulan. Rilis kasebut, sing didokumentasikan ing kaca API resmi perusahaan, teka mung sawetara minggu sawise V4-Flash-0731 lan V4-Pro-0813 refresh lan menehi pangembang cara sing wis suwe dijaluk kanggo menehi gambar, grafik, lan foto langsung menyang salah sawijining model tingkat perbatasan paling murah ing industri. Kanggo tim sing nelusuri perkembangan AI paling anyar, iki minangka sinyal liyane yen DeepSeek duwe tujuan kanggo cocog karo fitur-fitur saingan Barat nalika nyuda rega kanthi agresif.

Apa model anyar

Miturut dokumentasi API DeepSeek, `deepseek-v4-flash-vision-exp` ngidini pangguna "takon model kanggo njlèntrèhaké gambar, maca teks saka gambar, nganalisa grafik, lan liya-liyane." Model kasebut nampa file JPEG, PNG, GIF, lan WebP, kanthi format sing dideteksi saka isi file nyata tinimbang jeneng berkas utawa jinis MIME sing diumumake - rincian cilik nanging wicaksana sing nyegah bug ekstensi sing ora cocog.

Pangembang bisa ngirim gambar kanthi telung cara: URL data inline sing dienkode base64 (tundhuk watesan awak panjaluk 48 MiB), URL eksternal sing bisa diakses umum (nganti 8,192 karakter, 32 MiB saben gambar, kanthi jendhela download 60 detik), utawa liwat API File. Kabeh nggunakake format Completions Obrolan sing kompatibel karo OpenAI standar, lan model kasebut uga bisa digayuh liwat titik pungkasan sing cocog karo Anthropic DeepSeek - tegese kode Claude SDK sing ana bisa ngoper backend kanthi owah-owahan minimal.

Rega: sesanti wates ing tarif komoditas

Model eksperimen marisi lembar rega agresif V4-Flash. Token input regane $0,22 saben yuta off-peak lan $0,44 ing puncak kanggo cache luput, mudhun nganti $0,007 saben yuta ing cache hits sak jam off-puncak. Token output diregani ing $ 0,66 saben yuta off-puncak lan $ 1,32 ing puncak. Gambar diowahi dadi token adhedhasar dimensi lan ditagih bebarengan karo token teks.

Rega kasebut penting amarga nyuda tawaran multimodal sing padha saka panyedhiya utama AS, terus perang rega sing ditindakake DeepSeek kabeh taun. Model kasebut uga ngemot spesifikasi judhul kulawarga: jendela konteks token 1 yuta, nganti 384K token output maksimal, dhukungan kanggo mode mikir lan ora mikir, output JSON, panggilan alat, lan watesan konkurensi 2,500 - spek sing posisine minangka tenaga kerja asli kanggo beban kerja produksi volume dhuwur tinimbang minangka beban kerja riset.

Apa pangembang padha nekat kanggo iki

Peluncuran kasebut ndharat ing Hacker News, kanthi cepet nglumpukake luwih saka 450 poin - lan semangat kasebut duwe crita asal-usul tartamtu. DeepSeek mung teks V4-Flash-0731 wis ngembangake reputasi kanggo pracaya bisa ndeleng. Akeh pangembang nglaporake manawa model kasebut bakal nganggep duwe kabisan visi, banjur nggawe solusi sing rumit nalika ditemokake ora bisa - kalebu nyipta alat analisis gambar adhedhasar teks lan narik gambar saka piranti sing disambungake sadurunge ngerti yen ora ana cara kanggo ndeleng.

"Aku wis krungu yen DeepSeek v4 Flash 0731 wis kerep nganggep manawa nduweni kemampuan sesanti lan banjur nggunakake alat analisis gambar adhedhasar teks nalika nemokake manawa ora bisa ndeleng," tulis salah sawijining komentator, nyuarakke laporan saka sawetara liyane. Kanggo sapa wae sing nggunakake model kasebut minangka agen ing coding utawa pipeline otomatisasi, varian visi anyar kudu ngilangi kabeh kategori kegagalan sing didorong kebingungan.

800x800 nyekel

Rilis kasebut ora ana watesan, lan kritik sing paling cetha babagan Hacker News ngarahake siji nomer: resolusi gambar. Dokumentasi kasebut nyatakake yen sadurunge inferensi, saben gambar diowahi ukurane kanthi otomatis supaya jumlah piksel total kira-kira cocog karo gambar 800x800, njaga rasio aspek.

"Migunani nanging kanggo OCR lan akeh aplikasi liyane kudu rada luwih dhuwur (contone: nglebokake kaca ukuran A4 / Letter lengkap)," siji pangembang mbantah, lan liyane mangsuli kanthi terang yen tutup 800x800 "mateni akeh kasus panggunaan." Kanggo dokumen sing padhet, pindai kaca lengkap, utawa debugging UI sing apik, langit-langit resolusi bisa nyurung pangembang menyang alternatif sing luwih dhuwur - lan luwih larang. Salah sawijining solusi populer sing disaranake ing utas: pamisah kaca gedhe dadi kothak lan feed kanthi kapisah.

Pitakonan terbuka liyane yaiku keterbukaan. DeepSeek mbangun reputasi kanggo ngeculake bobot mbukak, nanging perusahaan durung ujar manawa varian visi bakal ditindakake. Komentator spekulasi bisa uga asale saka riset "Thinking with Visual Primitives" anyar perusahaan, sing bobote dijanjekake, nanging ora ana sing dikonfirmasi. Utamane, model kasebut kadhaptar minangka eksperimen - seselan "-exp" - menehi tandha manawa DeepSeek ngarepake bakal diulang.

Rilis sing sepi nanging strategis

Penurunan sesanti terus sibuk kanggo lab berbasis Hangzhou, sing wis ngenteni Agustus ngirim nganyari tetep: V4-Flash-0731, kerangka kerja DeepSeek Harness sing berorientasi agen, refresh V4-Pro-0813, lan saiki input multimodal. Tinimbang ngluncurake blockbuster siji, DeepSeek nglakokake rilis tambahan kanthi cepet sing njaga modele ing rantai alat pangembang - strategi sing padha ditindakake dening laboratorium Barat karo agen kodhe.

Kanggo industri AI umume, pesen kasebut akrab nanging isih ora nyenengake kanggo para pemangku jabatan: kemampuan sing nate mbenerake rega premium - pangerten gambar ing konteks yuta token - saiki wis tekan sawetara sen saben yuta token. Label eksperimen menehi ruangan DeepSeek kanggo nyaring model kasebut, nanging pangembang wis miwiti nyambungake menyang alur kerja sing didhukung gambar. Pitakonan ora ana maneh apa DeepSeek bisa cocog karo set fitur multimodal saka saingan, nanging sepira cepet pasar liyane nyetel rega.

Tetep Ahead saka AI

Kanggo rilis model AI paling anyar, perang pathokan, lan analisis industri, tetenger AI Buzz Wire.

Waca liyane AI warta →