Makmal AI Cina DeepSeek telah menghantar deepseek-v4-flash-vision-exp secara senyap-senyap, versi percubaan model V4-Flashnya yang boleh menerima imej bersama teks, menutup salah satu jurang yang paling ketara dalam keluarga model perdananya. Keluaran itu, yang didokumenkan pada halaman API rasmi syarikat, tiba hanya beberapa minggu selepas V4-Flash-0731 dan V4-Pro-0813 disegarkan dan memberikan pembangun cara yang telah lama diminta untuk menyuap tangkapan skrin, carta dan foto terus ke salah satu model peringkat sempadan termurah dalam industri. Untuk pasukan yang menjejaki perkembangan AI terkini, ini merupakan satu lagi isyarat bahawa DeepSeek berhasrat untuk memadankan ciri-ciri saingan Barat sambil mengurangkan harga mereka secara agresif.

Perkara yang dilakukan oleh model baharu

Menurut dokumentasi API DeepSeek, `deepseek-v4-flash-vision-exp` membolehkan pengguna "meminta model untuk menerangkan gambar, membaca teks daripada tangkapan skrin, menganalisis carta dan banyak lagi." Model ini menerima fail JPEG, PNG, GIF dan WebP, dengan format dikesan daripada kandungan fail sebenar dan bukannya nama fail atau jenis MIME yang diisytiharkan — butiran kecil tetapi bernas yang menghalang pepijat sambungan tidak sepadan.

Pembangun boleh menghantar imej dalam tiga cara: URL data sebaris berkod base64 (tertakluk kepada had badan permintaan 48 MiB), URL luaran yang boleh diakses secara umum (sehingga 8,192 aksara, 32 MiB setiap imej, dengan tetingkap muat turun 60 saat), atau melalui API Fail. Semuanya menggunakan format Pelengkapan Sembang serasi OpenAI standard, dan model ini juga boleh dicapai melalui titik akhir serasi Anthropic DeepSeek — bermakna kod SDK Claude sedia ada boleh menukar hujung belakang dengan perubahan yang minimum.

Harga: wawasan sempadan pada kadar komoditi

Model eksperimen mewarisi lembaran harga agresif V4-Flash. Token input berharga $0.22 setiap juta di luar puncak dan $0.44 pada puncak untuk kesilapan cache, menurun kepada serendah $0.007 setiap juta pada capan cache semasa waktu luar puncak. Token output berharga $0.66 setiap juta di luar puncak dan $1.32 pada puncak. Imej ditukar kepada token berdasarkan dimensinya dan dibilkan bersama dengan token teks.

Penetapan harga itu penting kerana ia secara mendadak mengurangkan tawaran multimodal yang setanding daripada pembekal utama AS, meneruskan perang harga yang DeepSeek lakukan sepanjang tahun. Model ini juga membawa spesifikasi tajuk keluarga: tetingkap konteks token 1 juta, sehingga 384K token keluaran maksimum, sokongan untuk mod berfikir dan tidak berfikir, output JSON, panggilan alat dan had serentak 2,500 — spesifikasi yang meletakkannya sebagai kuda kerja tulen untuk beban kerja pengeluaran volum tinggi dan bukannya sebagai alat permainan penyelidikan.

Mengapa pembangun terdesak untuk ini

Pelancaran itu mendarat di Berita Hacker, di mana ia cepat mengumpulkan lebih daripada 450 mata — dan keghairahan itu mempunyai cerita asal yang khusus. Teks sahaja V4-Flash-0731 DeepSeek telah membangunkan reputasi untuk percaya ia boleh melihat. Berbilang pembangun melaporkan bahawa model itu akan menganggap ia mempunyai keupayaan penglihatan, kemudian menambah baik penyelesaian yang rumit apabila ia mendapati ia tidak boleh — termasuk mencipta alat analisis imej berasaskan teks dan mengeluarkan tangkapan skrin dari peranti yang bersambung sebelum menyedari ia tidak mempunyai cara untuk melihatnya.

"Saya pernah mendengar bahawa DeepSeek v4 Flash 0731 sering mengandaikan bahawa ia mempunyai keupayaan penglihatan dan kemudian menggunakan alat analisis imej berasaskan teks apabila ia mendapati ia sebenarnya tidak dapat melihat," tulis seorang pengulas, mengulangi laporan daripada beberapa orang lain. Bagi sesiapa yang menggunakan model sebagai ejen dalam saluran paip pengekodan atau automasi, varian penglihatan baharu harus menghapuskan keseluruhan kategori kegagalan yang didorong oleh kekeliruan.

Tangkapan 800x800

Keluaran ini bukan tanpa batasan, dan kritikan paling tajam terhadap Berita Hacker menyasarkan satu nombor: resolusi imej. Dokumentasi menyatakan bahawa sebelum inferens, setiap imej diubah saiz secara automatik supaya jumlah kiraan pikselnya kira-kira sepadan dengan imej 800x800, mengekalkan nisbah bidang.

"Ia berguna tetapi untuk OCR dan banyak aplikasi lain ia perlu sedikit lebih tinggi (cth: meletakkan halaman bersaiz A4 / Letter penuh)," seorang pembangun berhujah, dengan seorang lagi menjawab terus terang bahawa topi 800x800 "membunuh banyak kes penggunaan." Untuk dokumen padat, imbasan halaman penuh atau penyahpepijatan UI yang halus, siling resolusi boleh mendorong pembangun ke arah alternatif resolusi lebih tinggi — dan lebih mahal. Satu penyelesaian popular yang dicadangkan dalam urutan: bahagikan halaman besar kepada jubin dan suapkannya secara berasingan.

Soalan terbuka yang lain ialah keterbukaan. DeepSeek membina reputasinya dengan mengeluarkan wajaran terbuka, tetapi syarikat itu tidak menyatakan sama ada varian penglihatan akan mengikuti. Pengulas membuat spekulasi bahawa ia mungkin berasal dari penyelidikan "Berfikir dengan Visual Primitif" baru-baru ini, yang mana beratnya dilaporkan dijanjikan, tetapi tiada apa yang telah disahkan. Terutamanya, model itu disenaraikan sebagai eksperimen — akhiran "-exp" — menandakan bahawa DeepSeek menjangkakan akan berulang.

Keluaran yang tenang tetapi strategik

Penurunan penglihatan meneruskan regangan yang sibuk untuk makmal yang berpangkalan di Hangzhou, yang telah menghabiskan bulan Ogos untuk menghantar kemas kini tetap: V4-Flash-0731, rangka kerja DeepSeek Harness yang berorientasikan ejen, penyegaran V4-Pro-0813, dan kini input multimodal. Daripada satu pelancaran blokbuster tunggal, DeepSeek melaksanakan irama keluaran yang pantas dan berperingkat yang mengekalkan modelnya dalam rantai alat pembangun — strategi rampasan tanah yang sama yang dijalankan oleh makmal Barat dengan ejen pengekodan.

Bagi industri AI secara amnya, mesej itu biasa tetapi masih tidak selesa untuk penyandang: keupayaan yang pernah mewajarkan harga premium — pemahaman imej pada konteks sejuta token — kini tiba pada beberapa sen bagi setiap juta token. Label percubaan memberi DeepSeek ruang untuk memperhalusi model, tetapi pembangun telah mula mendawainya ke dalam aliran kerja dipacu tangkapan skrin. Persoalannya bukan lagi sama ada DeepSeek boleh memadankan set ciri multimodal pesaingnya, tetapi seberapa cepat pasaran lain menyesuaikan diri dengan harganya.

Kekal Mendahului AI

Untuk keluaran model AI terbaharu, pertempuran penanda aras dan analisis industri, tandai halaman AI Buzz Wire.

Baca lebih banyak berita AI →