DeepSeek telah melancarkan V4-Flash-Vision-Exp, sebuah model multimodal eksperimental yang dikatakan berprestasi pada penanda aras ejen dalaman hampir setanding dengan Opus 4.8 milik Anthropic, sambil mengekalkan kos token bagi setiap imej yang dihadkan kepada 384. Pelancaran ini memberikan pembangun alternatif pantas-flash untuk tugasan AI visual yang menjanjikan kelajuan barisan V4-Flash DeepSeek dengan keupayaan untuk menaakul melalui gambar.
Mengapa pengumuman ini penting
Ejen multimodal—sistem yang boleh melihat, membaca dan bertindak—kini berada di pusat pembangunan alatan autonomi. Pasukan menggunakan ejen ini untuk bot sokongan pelanggan yang membaca tangkapan skrin dan pembantu penyelidikan yang menganalisis rajah. Opus 4.8 milik Anthropic telah menetapkan piawaian yang tinggi, tetapi harga dan kependamannya (latency) telah menghalang ramai daripada menggunakannya. Dakwaan DeepSeek tentang prestasi yang hampir setara pada sebahagian kecil kos token boleh mengubah pengiraan kos-faedah bagi sesiapa yang mempertimbangkan fungsi penglihatan (vision) dalam aliran kerja mereka.
Bagaimana DeepSeek membina model ini
Model baharu ini memperluas seni bina V4-Flash sedia ada DeepSeek, yang telah ditala untuk penaakulan teks yang pantas dan penggunaan token yang rendah. Dengan menyambungkan bahagian hadapan (front-end) pemprosesan imej ke dalam teras tersebut, DeepSeek mengekalkan kekuatan pengetahuan dunia dan penaakulan model asas sambil menambah pemahaman visual.
Pilihan teknikal utama termasuk:
- Pengesanan format automatik – model ini membaca kandungan binari imej untuk menentukan sama ada ia JPEG, PNG, GIF atau WebP, sekali gus mengelakkan ralat daripada nama fail yang salah label.
- Penyelarasan saiz adaptif – gambar yang masuk dinormalkan kepada kira-kira 800 × 800 piksel. Pembangun boleh meminta mod perincian rendah yang memaksa saiz 512 × 512, sekali gus mengurangkan lagi penggunaan token.
- Siling token – tanpa mengira resolusi asal, model ini tidak akan mengenakan kos lebih daripada 384 token bagi setiap imej, menjadikan belanjawan lebih mudah diramal.
DeepSeek juga telah mengeluarkan versi 0.1.1 bagi rangka kerja Harness miliknya, yang menggabungkan model baharu tersebut dan menawarkan penyesuai (adapters) sedia ada untuk OpenAI Chat Completions dan Responses APIs serta endpoint Messages milik Anthropic. Pasukan boleh memasukkan model ini ke dalam pangkalan kod sedia ada dengan hanya beberapa perubahan konfigurasi.
Apa yang diperolehi oleh pembangun
- Sokongan imej yang luas – JPEG, PNG, GIF dan WebP diterima, dan model ini boleh menyerap data melalui rentetan Base64, URL awam (sehingga 32 MiB), atau Files API percuma DeepSeek. Files API menyimpan satu muat naik sehingga 64 MiB dan membolehkan anda merujuknya melalui ID merentasi pelbagai pusingan perbualan, mengurangkan muat naik berulang dalam perbualan yang panjang.
- Konteks volum tinggi – satu permintaan boleh membawa sehingga 600 imej. Panjang sisi maksimum bagi setiap imej ialah 8,192 piksel, dan menurun kepada 4,096 piksel apabila sesuatu permintaan mengandungi 15 imej atau lebih, yang membantu memastikan masa pemprosesan terkawal.
- Tugasan sedia-ejen – model ini ditala untuk beban kerja "agentic": menghuraikan babak yang kompleks, mengekstrak teks daripada tangkapan skrin, dan menganalisis rajah yang rumit. Oleh kerana ia mengekalkan kelajuan penaakulan V4-Flash, ia boleh menyatukan petunjuk visual ke dalam rantaian pemikiran yang lebih luas tanpa menjadi penghalang (bottleneck).
Ciri-ciri ini menangani titik kesukaran (pain points) biasa pembangun: mengendalikan banyak imej dalam satu sesi, mengelakkan lonjakan penggunaan token yang melampau, dan menyepadukan fungsi penglihatan tanpa perlu menulis semula panggilan API.
Had potensi
Dakwaan prestasi DeepSeek bersandarkan pada penanda aras ejen multimodal dalaman. Ujian tersebut mungkin terlepas daripada kepelbagaian dunia nyata—seperti foto yang bising (noisy), keadaan cahaya rendah, atau format fail yang pelik. Label "eksperimental" juga membayangkan bahawa model ini mungkin masih dalam proses menyelesaikan isu kestabilan dan penskalaan.
Reka bentuk yang mengutamakan kelajuan seperti V4-Flash biasanya mengorbankan kedalaman representasi yang dicapai oleh model yang lebih besar dan lebih perlahan. Siling token mengekalkan kos yang rendah tetapi mengehadkan perincian visual, yang boleh menjejaskan tugasan yang memerlukan analisis terperinci (contohnya, membaca fon yang sangat kecil atau mengesan perbezaan tekstur yang halus).
Akhir sekali, penguncian ekosistem (ecosystem lock-in) kekal sebagai satu pertimbangan. Walaupun DeepSeek meniru bentuk API OpenAI dan Anthropic, pembangun masih perlu menguruskan penyedia yang berasingan, pengesahannya, dan kemungkinan perubahan harga pada masa hadapan. Pasukan yang telah melabur secara besar-besaran dalam satu vendor mungkin perlu menimbang usaha integrasi berbanding penjimatan yang diunjurkan.
Apa yang perlu diperhatikan
- Penilaian bebas – penanda aras pihak ketiga akan menjadi ujian sebenar pertama bagi dakwaan “hampir-Opus 4.8”. Perhatikan keputusan pada set data awam seperti VQAv2 atau CLEVR yang menekankan kedua-dua penaakulan dan kesetiaan visual.
- Kemas kini harga – DeepSeek menekankan kecekapan token, tetapi kos sebenar bagi setiap imej 384-token akan menentukan sama ada model ini benar-benar menawarkan harga yang lebih rendah daripada pesaing.
- Pelancaran ciri – keluaran Harness pada masa hadapan mungkin menambah pemprosesan berkelompok, output penstriman, atau integrasi yang lebih erat dengan alatan orkestrasi ejen yang popular, sekali gus memperluas kegunaan model tersebut.
- Penerimaan komuniti – kepantasan pembangun menerbitkan plugin, pembungkus (wrappers), atau kajian kes akan menunjukkan sama ada keserasian API model tersebut diterjemahkan kepada penggunaan praktikal.
Rumusan
V4-Flash-Vision-Exp daripada DeepSeek membawakan ejen multimodal yang pantas dan jimat token ke pasaran, yang mendakwa prestasi hampir setanding dengan Opus 4.8 daripada Anthropic. Jika penanda aras dalaman terbukti kukuh, ia boleh menjadi pilihan utama bagi pembangun yang memerlukan keupayaan penglihatan tanpa kos model berskala perintis, sambil tetap mengimbangi pertukaran biasa bagi AI eksperimental yang memfokuskan kepada kelajuan.
