Laboratorium AI Tiongkok, DeepSeek, diam-diam telah meluncurkan deepseek-v4-flash-vision-exp, versi eksperimental dari model V4-Flash yang dapat menerima gambar dan teks, menutup salah satu celah paling mencolok dalam rangkaian model andalannya. Rilis ini, yang didokumentasikan di halaman API resmi perusahaan, hadir hanya beberapa minggu setelah penyegaran V4-Flash-0731 dan V4-Pro-0813 dan memberi pengembang cara yang telah lama diminta untuk memasukkan tangkapan layar, bagan, dan foto langsung ke salah satu model tingkat perbatasan termurah di industri. Bagi tim yang memantau perkembangan AI terkini, ini merupakan sinyal lain bahwa DeepSeek berniat menandingi fitur demi fitur pesaingnya di Barat sambil menurunkan harga mereka secara agresif.
Apa yang dilakukan model baru
Menurut dokumentasi API DeepSeek, `deepseek-v4-flash-vision-exp` memungkinkan pengguna "meminta model untuk mendeskripsikan gambar, membaca teks dari tangkapan layar, menganalisis grafik, dan banyak lagi." Model ini menerima file JPEG, PNG, GIF, dan WebP, dengan format yang terdeteksi dari konten file sebenarnya, bukan nama file atau tipe MIME yang dinyatakan — detail kecil namun bijaksana yang mencegah bug ekstensi yang tidak cocok.
Pengembang dapat meneruskan gambar dengan tiga cara: URL data inline yang dikodekan base64 (sesuai dengan batas isi permintaan 48 MiB), URL eksternal yang dapat diakses publik (hingga 8.192 karakter, 32 MiB per gambar, dengan jendela download 60 detik), atau melalui Files API. Semuanya menggunakan format Penyelesaian Obrolan standar yang kompatibel dengan OpenAI, dan model ini juga dapat dijangkau melalui titik akhir yang kompatibel dengan Anthropic DeepSeek — artinya kode Claude SDK yang ada dapat beralih backend dengan sedikit perubahan.
Penetapan harga: visi terdepan pada harga komoditas
Model eksperimental mewarisi lembar harga agresif V4-Flash. Token input berharga $0,22 per juta di luar jam sibuk dan $0,44 di jam puncak untuk cache yang hilang, turun menjadi $0,007 per juta saat cache ditemukan di luar jam sibuk. Token keluaran dihargai $0,66 per juta di luar jam sibuk dan $1,32 di jam sibuk. Gambar diubah menjadi token berdasarkan dimensinya dan ditagih bersama dengan token teks.
Penetapan harga ini penting karena secara signifikan mengurangi penawaran multimodal serupa dari penyedia utama AS, sehingga melanjutkan perang harga yang dilakukan DeepSeek sepanjang tahun. Model ini juga membawa spesifikasi utama keluarga ini: jendela konteks 1 juta token, output maksimum hingga 384 ribu token, dukungan untuk mode berpikir dan non-berpikir, output JSON, panggilan alat, dan batas konkurensi 2.500 — spesifikasi yang memposisikannya sebagai pekerja keras sejati untuk beban kerja produksi bervolume tinggi, bukan sebagai mainan penelitian.
Mengapa pengembang sangat menginginkan hal ini
Peluncuran ini mendarat di Hacker News, yang dengan cepat mengumpulkan lebih dari 450 poin — dan antusiasmenya memiliki cerita asal yang spesifik. V4-Flash-0731 DeepSeek yang hanya berisi teks telah mengembangkan reputasi percaya bahwa ia dapat melihat. Beberapa pengembang melaporkan bahwa model tersebut akan berasumsi bahwa model tersebut memiliki kemampuan penglihatan, kemudian melakukan improvisasi solusi yang rumit ketika ternyata model tersebut tidak dapat melakukannya — termasuk menciptakan alat analisis gambar berbasis teks dan mengambil tangkapan layar dari perangkat yang terhubung sebelum menyadari bahwa model tersebut tidak dapat melihatnya.
“Saya pernah mendengar bahwa DeepSeek v4 Flash 0731 sering berasumsi bahwa ia memiliki kemampuan penglihatan dan kemudian menggunakan alat analisis gambar berbasis teks ketika ternyata ia tidak dapat melihat,” tulis seorang komentator, menggemakan laporan dari beberapa orang lainnya. Bagi siapa pun yang menggunakan model ini sebagai agen dalam pengkodean atau jalur otomatisasi, varian visi baru akan menghilangkan seluruh kategori kegagalan yang disebabkan oleh kebingungan.
Tangkapan 800x800
Rilis ini bukannya tanpa batasan, dan kritik paling tajam terhadap Hacker News ditujukan pada satu hal: resolusi gambar. Dokumentasi menyatakan bahwa sebelum inferensi, setiap gambar secara otomatis diubah ukurannya sehingga jumlah piksel totalnya kira-kira sama dengan gambar 800x800, dengan mempertahankan rasio aspek.
"Ini berguna tetapi untuk OCR dan banyak aplikasi lainnya, ini perlu sedikit lebih tinggi (misalnya: memasukkan halaman penuh berukuran A4/Letter)," bantah salah satu pengembang, sementara yang lain menjawab terus terang bahwa batas 800x800 "membunuh banyak kasus penggunaan." Untuk dokumen padat, pemindaian satu halaman penuh, atau proses debug UI yang mendetail, batasan resolusi dapat mendorong pengembang ke alternatif resolusi yang lebih tinggi — dan lebih mahal. Salah satu solusi populer yang disarankan di utas: pisahkan halaman besar menjadi ubin dan masukkan secara terpisah.
Pertanyaan terbuka lainnya adalah keterbukaan. DeepSeek membangun reputasinya dengan merilis bobot terbuka, namun perusahaan belum mengatakan apakah varian vision akan menyusul. Para komentator berspekulasi bahwa hal ini mungkin berasal dari penelitian terbaru perusahaan "Berpikir dengan Visual Primitives", yang menurut laporan bobotnya dijanjikan, tetapi belum ada yang dikonfirmasi. Khususnya, model tersebut terdaftar sebagai eksperimental — akhiran "-exp" — menandakan bahwa DeepSeek mengharapkan untuk melakukan iterasi.
Rilis yang tenang namun strategis
Penurunan visi ini melanjutkan masa sibuk laboratorium yang berbasis di Hangzhou, yang telah menghabiskan bulan Agustus dengan terus mengirimkan pembaruan: V4-Flash-0731, kerangka kerja DeepSeek Harness yang berorientasi agen, penyegaran V4-Pro-0813, dan sekarang input multimodal. Dibandingkan dengan peluncuran blockbuster tunggal, DeepSeek menjalankan serangkaian rilis cepat dan bertahap yang menjaga modelnya tetap berada di dalam rantai alat pengembang — strategi perampasan lahan yang sama dilakukan oleh laboratorium Barat dengan agen pengkodean.
Bagi industri AI pada umumnya, pesan ini sudah tidak asing lagi bagi para petahana: kemampuan yang dulunya membenarkan harga premium – pemahaman gambar dalam konteks jutaan token – kini mencapai beberapa sen per juta token. Label eksperimental memberi DeepSeek ruang untuk menyempurnakan modelnya, namun pengembang sudah mulai memasukkannya ke dalam alur kerja berbasis tangkapan layar. Pertanyaannya bukan lagi apakah DeepSeek dapat menandingi serangkaian fitur multimoda para pesaingnya, namun seberapa cepat pasar lainnya menyesuaikan diri dengan harganya.
Tetap Terdepan dalam AI
Untuk rilis model AI terbaru, pertarungan benchmark, dan analisis industri, tandai AI Buzz Wire.
Baca berita AI selengkapnya →