Ada satu keluhan yang cukup sering muncul dari pengguna DeepSeek selama ini. Model AI ini dikenal pintar diajak diskusi, cepat, dan murah, tetapi tidak memiliki kemampuan untuk melihat gambar.
Jika dikirimkan satu screenshot error, foto tabel dari laporan, atau tangkapan layar desain, DeepSeek tidak bisa berbuat banyak. Sementara kompetitor seperti GPT dan Claude sudah lama memiliki kemampuan visual, lini model Flash milik DeepSeek yang menjadi andalan karena murah dan gesit selama ini harus puas hanya memproses teks.
Saya sendiri cukup sering merasakan keterbatasan ini. Ada kalanya saya ingin meminta model membaca isi tabel dari gambar atau menjelaskan makna sebuah chart, namun harus menyalin manual atau beralih ke model lain yang harganya jauh lebih mahal. Karena itu, absennya fitur vision di Flash terasa seperti ada potongan penting yang hilang dari pengalaman pemakaian sehari-hari.
Keluhan tersebut akhirnya terjawab. Pada 21 Agustus 2026, DeepSeek merilis deepseek-v4-flash-vision-exp, sebuah versi eksperimental dari V4 Flash yang untuk pertama kalinya bisa memahami gambar dan teks sekaligus. Momen ini disambut hangat oleh komunitas AI karena si paus DeepSeek akhirnya resmi dapat melihat.
Secara pribadi, saya menilai ini sebagai salah satu update yang paling ditunggu di ekosistem DeepSeek tahun ini. Bukan karena fiturnya terlihat wah secara teknis, melainkan karena ia menyelesaikan masalah praktis yang sudah lama dikeluhkan banyak pengguna.
Apa yang Berubah
Model deepseek-v4-flash-vision-exp kini sudah live di DeepSeek API Platform. Ini adalah model pemahaman visual multimodal baru yang bisa diakses dengan mengatur parameter model ke deepseek-v4-flash-vision-exp. Dari sisi penggunaan, prosesnya tetap sama seperti memanggil V4 Flash biasa sehingga migrasi terasa sangat mulus bagi pengguna lama.
Yang menjadi perhatian banyak pihak, DeepSeek tidak mengorbankan kemampuan teks demi menambahkan fitur vision. Hal ini menjadi kekhawatiran yang wajar mengingat penambahan modalitas biasanya membawa risiko penurunan performa pada fungsi lain.
Model multimodal eksperimental ini tetap setara dengan DeepSeek-V4-Flash biasa dalam hal kemampuan teks, termasuk fungsi agent, reasoning, dan pengetahuan umum. Jadi pengguna tidak perlu khawatir akan kehilangan keunggulan yang sudah ada hanya karena ada tambahan kemampuan baru.
Menurut saya pribadi, keputusan untuk menjaga paritas kemampuan teks ini adalah langkah yang paling masuk akal. Banyak model multimodal di luar sana yang justru melemah di sisi teks setelah ditambah vision, sehingga pengguna harus memilih antara pintar membaca atau pintar melihat. DeepSeek tampaknya belajar dari pola tersebut dan memilih untuk tidak mengorbankan fondasi yang sudah kuat.
Untuk urusan pemrosesan visual, hasilnya bahkan melampaui ekspektasi. Pada benchmark agent yang membutuhkan pemahaman visual, model ini memberikan lompatan performa yang signifikan dibanding versi standar. Lompatan ini membawa kemampuan agent multimodalnya mendekati Opus 4.8.
Secara pribadi, saya melihat capaian mendekati Opus 4.8 ini sebagai sinyal yang cukup penting. Opus dikenal sebagai model dengan kemampuan agent yang sangat matang, sehingga jika V4 Flash Vision bisa mendekati level tersebut dengan harga yang jauh lebih murah, maka proposisi nilainya menjadi sangat menarik untuk kebutuhan agent sehari-hari.
Tanda-Tanda yang Sudah Terlihat Lebih Dulu
Kabar soal hadirnya fitur vision ini sebenarnya sudah tercium beberapa waktu sebelum rilis resmi diumumkan. Seorang pengguna X sempat mengidentifikasi nama deepseek-v4-flash-vision-exp dalam kode DeepSeek Harness, di mana versi terbaru mulai mendukung permintaan gambar secara native.
Bocoran seperti ini memang sudah menjadi pola yang cukup umum di dunia AI. Namun yang menarik, antusiasme terhadap bocoran tersebut terasa jauh lebih besar dari biasanya. Hal ini menurut saya menunjukkan betapa banyak pengguna yang memang sudah menanti fitur vision di lini Flash.
Ketiadaan kemampuan vision di lini Flash rupanya juga sangat dirasakan oleh komunitas open-source. Bahkan sebelum rilis resmi ini meluncur, ada pengembang independen yang mencoba menambal kekurangan tersebut secara mandiri.
Mereka menghubungkan model reasoning dan agentic DeepSeek dengan vision encoder MoonViT dari Kimi-K2.6 melalui projector buatan sendiri. Upaya semacam ini menunjukkan betapa besarnya permintaan pasar terhadap kemampuan visual pada model yang murah dan efisien, jauh sebelum DeepSeek sendiri turun tangan.
Jujur, saya cukup kagum dengan kreativitas komunitas tersebut. Alih-alih menunggu rilis resmi, mereka merakit solusi sendiri demi menutup celah yang ada. Dari sudut pandang saya, fenomena ini justru menjadi validasi yang sangat kuat bahwa DeepSeek memang perlu segera menghadirkan vision secara native. Ketika pengguna sampai membuat projector sendiri, artinya kebutuhan tersebut sudah tidak bisa ditunda lagi.
Spesifikasi Teknis
Beberapa poin penting mengenai spesifikasi teknis model ini antara lain sebagai berikut.
- Model ID menggunakan
deepseek-v4-flash-vision-exp - Arsitektur sparse mixture-of-experts dengan 13B parameter aktif dari total 284B parameter
- Context window mencapai 1.048.576 token dengan output maksimum 384.000 token
- Format gambar yang didukung meliputi JPEG, PNG, GIF, dan WebP
- DeepSeek Harness 0.1.1 dirilis dengan dukungan langsung untuk model baru ini, sehingga model dapat bekerja mulus di berbagai framework agent dengan menggabungkan pemahaman visual dan berbagai tools.
Berdasarkan dokumentasi resminya, model ini menerima input gambar bersamaan dengan teks. Pengguna bisa memintanya mendeskripsikan gambar, membaca teks dari screenshot, hingga menganalisis chart. Pembaruan ini menjadi solusi yang sangat dinanti bagi siapa saja yang selama ini terpaksa menyalin isi tabel secara manual dari tangkapan layar.
Secara pribadi, saya menilai kombinasi 13B aktif dari total 284B ini cukup cerdas untuk menjaga efisiensi. Model tetap terasa ringan saat dijalankan, namun kapasitas totalnya tetap besar sehingga pengetahuan dan kemampuan reasoning tidak banyak terkorbankan. Pendekatan sparse seperti ini menurut saya adalah alasan utama mengapa Flash bisa tetap murah namun tetap kompeten.
Context window hingga 1.048.576 token dengan output maksimum 384.000 token juga bukan angka kecil. Dalam praktiknya, ini berarti pengguna bisa mengirim dokumen panjang, beberapa gambar, dan instruksi agent yang kompleks dalam satu sesi tanpa harus memotong konteks. Bagi saya, ini sangat membantu untuk kasus seperti menganalisis laporan PDF yang penuh tabel dan chart sekaligus.
Dukungan format JPEG, PNG, GIF, dan WebP juga sudah mencakup hampir semua kebutuhan praktis. Hampir semua screenshot, foto, atau aset desain yang biasa saya temui sehari-hari sudah termasuk di dalamnya, sehingga tidak perlu konversi tambahan sebelum dikirim ke model.
Kehadiran DeepSeek Harness 0.1.1 dengan dukungan native juga menurut saya penting untuk diperhatikan. Tanpa dukungan harness yang baik, kemampuan vision yang bagus pun bisa terasa canggung saat dipakai di framework agent populer. Dengan dukungan langsung ini, transisi dari V4 Flash biasa ke versi vision jadi jauh lebih mulus.
Soal Harga yang Masih Konsisten Murah
Salah satu ciri khas DeepSeek adalah penawaran harga yang sangat terjangkau, dan keunggulan ini tetap dipertahankan. Model baru ini menerima input gambar bersamaan dengan teks melalui endpoint API yang sama dengan V4 Flash tanpa ada biaya premium tambahan.
Menurut saya, ini adalah bagian yang paling menarik dari rilis kali ini. Biasanya, ketika sebuah model mendapat kemampuan multimodal, harganya akan naik cukup terasa. DeepSeek justru memilih untuk mempertahankan struktur harga yang sama, sehingga pengguna lama bisa mencoba fitur vision tanpa harus menghitung ulang anggaran.
Efisiensi tokenisasi gambarnya pun cukup mencolok. DeepSeek mampu mengubah gambar berukuran 800x800 piksel menjadi sekitar 90 token saja. Jika dibandingkan dengan kompetitor, Claude membutuhkan sekitar 870 token dan Gemini membutuhkan sekitar 1.100 token untuk memproses gambar dengan ukuran serupa.
Jika dihitung secara kasar, selisihnya bisa mencapai hampir sepuluh kali lipat. Dalam penggunaan nyata yang melibatkan banyak gambar, misalnya saat agent harus membaca puluhan screenshot dashboard atau halaman laporan, penghematan token seperti ini akan sangat terasa di tagihan akhir. Saya sendiri menilai efisiensi ini sebagai keunggulan yang sering luput dibahas, padahal dampaknya langsung ke biaya operasional.
Bahkan media Tiongkok melaporkan bahwa biaya pemrosesan 1.000 gambar bisa serendah 1 yuan. Angka ini tentu perlu dilihat sebagai gambaran kasar, namun tetap memberi ilustrasi betapa murahnya pemrosesan visual di model ini. Bagi saya, ini membuka peluang untuk kasus penggunaan yang sebelumnya terasa terlalu mahal untuk dijalankan dengan model vision lain.
Sementara itu di platform OpenRouter, model ini dibanderol sekitar 0,66 per juta token output, dengan tarif cache read terpisah sekitar $0,007 per juta token. Dengan harga seperti ini, saya merasa DeepSeek tetap menjadi salah satu opsi paling ramah di kantong, bahkan ketika sudah membawa kemampuan vision.
Kenapa Ini Penting
Selama ini, ketiadaan fitur vision di lini Flash menjadi alasan paling sering disebut ketika DeepSeek dibandingkan dengan GPT atau Claude. DeepSeek dikenal sebagai model yang murah dan cepat, namun tidak memiliki kemampuan menganalisis materi visual.
Kondisi ini membuat banyak pengguna harus melakukan strategi dua model. Mereka memakai DeepSeek untuk tugas teks yang berat dan murah, lalu beralih ke model lain yang lebih mahal hanya untuk membaca gambar. Alurnya menjadi tidak efisien dan menambah kompleksitas di sisi pengembangan.
Hadirnya kemampuan baru ini secara bertahap menutup celah tersebut. DeepSeek kini makin lengkap sebagai pilihan ideal untuk kebutuhan agent yang harus membaca screenshot, memahami dashboard, atau menganalisis chart tanpa perlu membayar mahal.
Dari sudut pandang saya, ini mengubah posisi DeepSeek secara cukup fundamental. Jika sebelumnya DeepSeek sering dianggap sebagai opsi hemat untuk tugas teks saja, kini ia mulai bisa dipertimbangkan sebagai model utama untuk workflow yang lebih lengkap. Terutama untuk agent yang bekerja di lingkungan nyata, kemampuan melihat adalah kebutuhan yang hampir tidak bisa dihindari.
Contoh paling nyata yang saya rasakan adalah saat agent harus memeriksa hasil eksekusi di browser, membaca tabel dari PDF hasil scan, atau menjelaskan isi grafik penjualan. Tugas semacam ini sebelumnya hampir tidak mungkin dikerjakan oleh Flash, sehingga harus dialihkan ke model lain. Dengan adanya vision, alur kerja tersebut kini bisa ditangani dalam satu model yang sama.
Saya sendiri sudah membayangkan betapa bergunanya fitur ini untuk workflow sehari-hari. Misalnya, cukup mengirim screenshot error lengkap dengan tumpukan log, lalu meminta model untuk menunjukkan baris yang bermasalah dan menyarankan perbaikan. Atau mengunggah foto whiteboard hasil diskusi, lalu meminta model merapikannya menjadi ringkasan yang terstruktur. Hal-hal yang sebelumnya terasa merepotkan kini menjadi jauh lebih praktis.
Sangat wajar jika komunitas menyambutnya dengan candaan bahwa akhirnya si paus punya mata. Setelah sekian lama andal dalam mengolah teks tetapi tidak bisa melihat, kini DeepSeek V4 Flash resmi dapat memahami dunia visual. Candaan tersebut menurut saya juga mencerminkan kelegaan, karena akhirnya ada jawaban konkret atas keluhan yang sudah lama disuarakan.
Sebagai catatan tambahan, deepseek-v4-flash-vision-exp masih berstatus eksperimental. Oleh karena itu, kemungkinan besar model ini akan terus mendapatkan perbaikan dan pembaruan sebelum rilis stabil secara resmi.
Dari pengalaman saya mengikuti rilis eksperimental DeepSeek sebelumnya, status ini biasanya berarti performa masih bisa naik turun di beberapa kasus tepi. Jadi saran saya, manfaatkan versi ini untuk eksplorasi, prototyping, dan workflow yang masih bisa ditoleransi jika ada sedikit inkonsistensi. Untuk sistem produksi yang sangat kritis, ada baiknya menunggu versi stabil sambil terus memantau pembaruan yang akan datang.
Terlepas dari status eksperimental tersebut, menurut saya rilis ini adalah langkah yang sangat tepat dan datang di waktu yang pas. DeepSeek tidak hanya menambah fitur, tetapi melakukannya tanpa mengorbankan harga murah dan kemampuan teks yang menjadi identitasnya. Jika tren ini berlanjut, saya cukup optimistis bahwa V4 Flash Vision akan menjadi salah satu model yang paling sering saya rekomendasikan untuk kebutuhan agent multimodal yang efisien.





