← Все статьи

DeepSeek V4.1 Flash: versi baru melihat gambar dan mengalahkan V4 Pro

DeepSeek V4.1 Flash: versi baru melihat gambar dan mengalahkan V4 Pro

DeepSeek telah merilis V4.1 Flash — model yang menggantikan dua model sebelumnya sekaligus: V4 Flash biasa dan versi eksperimental dengan pengenalan gambar. Sekarang ini adalah model tunggal yang menulis kode dan membaca gambar: model ini mengalahkan V4 Pro pada benchmark agen, memiliki konteks satu juta token, dan menggunakan cache KV sekitar empat kali lebih sedikit. Di NeuralSpace, V4.1 Flash sudah tersedia di chat, di bagian "Code", dan melalui API — inilah yang berubah dibandingkan dengan V4 Flash.

Apa model ini

Sebenarnya, ini bukan revisi dari Flash sebelumnya tetapi model pertama dari keluarga arsitektur baru. V4.1 Flash punya552 miliar parameterdibandingkan 284 miliar di V4 Flash, jadi modelnya terasa lebih besar. Namun ini mengaktifkan lebih sedikit parameter per langkah: about8 miliar sambil membaca masukandan 16 miliar sambil menghasilkan jawabannya.

Skema baru ini disebut Causal Encoder-Decoder: 40 lapisan transformator dibagi menjadi 20 lapisan encoder dan 20 lapisan decoder, dan cache nilai kunci bersama dibuat satu kali — dari status tersembunyi pembuat enkode — alih-alih dihitung ulang di setiap lapisan. Itu sebabnya pemrosesan input murah. Asimetri ini disengaja: agen banyak membaca — file, riwayat percakapan, instruksi — dan menulis relatif sedikit — pengeditan, perintah, keputusan. Setengah bagian yang mahal dibuat ringan, sehingga beban kerja agen juga menjadi lebih murah.

Konteksnya adalah satu juta token. Upaya penalaran terus disesuaikan dari 1 hingga 100: pertanyaan sederhana dapat dijalankan dengan murah, sementara rantai keras dapat dijalankan secara maksimal tanpa berpindah model.

Ia melihat gambar sekarang

Inilah perbedaan yang paling terlihat dari versi sebelumnya. V4 Flash memiliki input hanya teks: tidak dapat melihat gambar, dan DeepSeek mengirimkan model visi eksperimental terpisah untuk itu. Di V4.1 Flash, visi dibangun ke dalam model itu sendiri — visi tersebut secara asli menerima teks dan gambar serta membalas dengan teks.

Dalam praktiknya, Anda dapat memberikan tangkapan layar UI, bagan, foto, atau halaman dokumen kepada model apa adanya. Ini akan mendeskripsikan gambar, mengekstrak teks dari tangkapan layar, atau membaca diagram. Hal ini sangat berguna bagi agen: satu model membaca kode dan tangkapan layar UI, tanpa perlu beralih di antara dua layanan.

DeepSeek menghentikan nama model lama: permintaan ke v4-flash dan v4-flash-vision-exp kini dialihkan ke V4.1 Flash, sehingga integrasi yang ada tidak akan menghasilkan apa-apa.

A lens with text lines and image frames flowing in and a single stream of light coming out

Ini mengalahkan V4 Pro

Bagian paling keras dari rilis ini: V4.1 Flash mengungguli V4 Pro yang lebih besar dalam tugas-tugas agen. Berikut angka-angka dari evaluasi resmi DeepSeek:

  • Terminal-Bangku 2.1(bekerja di terminal) — 90,6 versus 87,9 untuk V4 Pro dan 82,7 untuk V4 Flash sebelumnya;
  • CyberGym(keamanan siber) — 88,1 berbanding 83,3 untuk V4 Pro;
  • DeepSWE v1.1— 74,2 berbanding 54,4 untuk V4 Flash;
  • Terminal-Bangku 4.0— 31,2 berbanding 7,0 untuk V4 Flash.

Selain itu: 90,9 di GPQA Diamond, rating Codeforces 3471, dan 65,6 di MathArena Apex. Angka-angka tersebut tidak independen — DeepSeek melaporkannya sendiri, jadi perlakukan angka tersebut sebagai klaim dan bukan putusan. Namun skala lompatan dari Flash sebelumnya terlihat tanpa proses pihak ketiga.

DeepSeek juga mengumumkan penghentian V4 Pro secara bertahap: mulai 14 September, API-nya merutekan permintaan V4 Pro ke V4.1 Flash dan menagihnya dengan harga Flash. Kesimpulan praktisnya sederhana: Flash bukan lagi model "junior". Sekarang ia membawa beban utama, dan versi reguler dan vision tidak lagi ada secara terpisah.

Cache lebih kecil, tugas agen lebih murah

Untuk skenario agen, penghematan utama bukan pada harga token tetapi pada cache. Agen membaca ulang riwayat percakapan, instruksi, dan file proyek berulang kali, dan masukan dalam cachelah yang memakan sebagian besar tagihan. Cache KV global V4.1 Flash membutuhkan waktu sekitar890 byte per token— kira-kira empat kali lebih kecil dibandingkan V4 Flash — dan cache persistennya dikompresi sekitar delapan kali lipat.

Harga model juga turun dibandingkan Flash sebelumnya: input yang di-cache 60% lebih murah, input yang tidak di-cache sekitar sepertiga lebih murah, dan output 11% lebih murah. Peningkatan ini paling terlihat pada beban kerja yang berulang kali memproses konteks besar; jika jangka waktu produksi baru lebih penting, maka penghematannya akan lebih kecil.

A data stream compressing into a narrow bright band as it passes through a crystal lattice

V4 Flash versus V4.1 Flash: apa yang berubah

ParameterV4 Lampu KilatV4.1 Lampu Kilat
Parameter284B552B
Diaktifkan per langkah13BMasukan 8B / keluaran 16B
ArsitekturDekoder MoEEncoder-Decoder Kausal
Memahami gambarTidak, model visi terpisahYa, secara asli
Konteks1 juta token1 juta token
Terminal-Bangku 2.182.790.6
DeepSWE v1.154.474.2
Cache KV per token~4× lebih besar890 byte

Harga di NeuralSpace dan cara mencobanya

Di NeuralSpace, model berjalan dengan kecepatan yang sama dengan V4 Flash sebelumnya:$0,14 per juta token masukanDan$0,28 per juta token keluaran. Anda dapat memulai dengan sedikitnya 3 token di saldo Anda; penggunaan dibebankan dari saldo bersama, tanpa langganan terpisah dan tanpa kartu asing. Untuk mencobanya, satu langkah saja sudah cukup:

Pertanyaan yang sering diajukan

Apakah Flash V4.1 merupakan model baru atau pembaruan?Ini adalah model dari keluarga arsitektur baru dan bukan revisi dari Flash sebelumnya: arsitektur berubah, tulang punggung bertambah, dan visi ditambahkan.

Apakah ia melihat gambar?Ya, secara asli: kirim foto, tangkapan layar, bagan, atau dokumen. Flash V4 sebelumnya hanya berupa teks.

Apa yang terjadi dengan V4 Pro?DeepSeek menghapusnya secara bertahap dan merutekan permintaan ke V4.1 Flash, yang mengalahkan V4 Pro pada tolok ukur agen.

Berapa biaya untuk mencobanya?$0,14/$0,28 per juta token, mulai dari 3 token di saldo Anda — dihalaman model obrolan.

Apakah permintaan v4-flash lama akan rusak?Tidak: panggilan ke v4-flash dan v4-flash-vision-exp dialihkan ke V4.1 Flash dan ditagih sesuai tarifnya.