
Dalam artikel ini (4)
Analisis DeepSeek V4 Flash 0731: skor 50, 60% lebih murah
Poin utama
- Bandingkan model berdasarkan total biaya tugas, bukan hanya skor benchmark, terutama untuk beban kerja konteks panjang yang berulang.
- Uji tingkat cache hit pada prompt Anda sendiri karena keunggulan harga DeepSeek sangat bergantung pada ekonomi cache.
- Perhatikan ketersediaan bobot penuh dan data latensi independen sebelum menjalankan beban kerja produksi.
Artificial Analysis mengatakan DeepSeek memperoleh 10 poin Intelligence Index sambil menekan biaya tugas yang sebanding dengan Luna melalui penetapan harga cache yang agresif.
Artificial Analysis mengatakan DeepSeek memperoleh 10 poin Intelligence Index sambil menekan biaya tugas Luna yang sebanding melalui penetapan harga cache yang agresif.
Hal paling lucu tentang benchmark AI adalah bahwa angka yang sering di-screenshot semua orang sering kali bukan angka yang muncul di tagihan cloud Anda. DeepSeek V4 Flash 0731 baru saja memberi kita kedua angka itu, yang tidak ramah bagi para pedagang hype tetapi berguna bagi orang-orang yang memang sengaja men-deploy sesuatu. Artificial Analysis melaporkan bahwa model ini mencetak skor 50 pada Intelligence Index mereka, lonjakan 10 poin dibanding DeepSeek V4 Flash April 2026, sementara API Cost per Task pihak pertama DeepSeek sekitar 60% lebih rendah daripada GPT-5.6 Luna. Di suatu tempat, sebuah spreadsheet baru saja berdeham.
Artificial Analysis menempatkan Flash 0731 dekat dengan Luna
Artificial Analysis mengatakan DeepSeek V4 Flash 0731 mencetak skor 50 pada Intelligence Index mereka, naik dari 40 untuk DeepSeek V4 Flash sebelumnya yang dirilis pada April 2026. Itu juga menempatkannya 6 poin di atas DeepSeek V4 Pro, menurut laporan Artificial Analysis yang sama. Bagian menariknya bukan hanya lonjakannya, karena benchmark itu seperti konfeti kalau tidak dikaitkan dengan realitas deployment. Menariknya, Artificial Analysis menempatkan model ini hanya satu poin Intelligence Index di belakang GPT-5.6 Luna yang berada di 51, cukup dekat sampai tim procurement mungkin mulai bertingkah seperti rakun di tempat sampah diskon harga. Artificial Analysis juga membingkai model ini terhadap pesaing terdekat: GLM-5.2 di 51, Gemini 3.6 Flash di 50, Muse Spark 1.1 di 51, dan Kimi K3 di 57 sebagai garis depan open weights. Konteks itu penting karena skor 50 tidak berarti memenangkan seluruh pertandingan angkat besi, tetapi tiba-tiba ia berdiri di platform yang sama dengan model-model yang akan dipertimbangkan banyak builder untuk beban kerja agen, coding, dan penalaran yang serius. Laporan tersebut mengatakan DeepSeek V4 Flash 0731 mempertahankan context window 1M token, dan ukurannya tetap tidak berubah dari DeepSeek V4 Flash. Dalam bahasa sederhana: ini lebih terlihat seperti makhluk yang sama setelah akhir pekan yang sangat produktif dengan post-training, bukan seperti makhluk raksasa baru.
Cerita harga sebenarnya adalah
cerita cache Artificial Analysis mengatakan DeepSeek V4 Flash 0731 memiliki arsitektur dan harga yang identik dengan DeepSeek V4 Flash sebelumnya, sambil masuk ke Pareto frontier mereka untuk Intelligence versus Cost per Task. Laporan yang sama mengatakan bahwa bahkan setelah pemotongan harga 80% OpenAI untuk GPT-5.6 Luna, Cost per Task DeepSeek V4 Flash 0731 pada API pihak pertama DeepSeek sekitar 60% lebih rendah daripada GPT-5.6 Luna. Itu jenis kalimat yang membuat grafik benchmark terasa lebih sedikit seperti obrolan olahraga dan lebih seperti faktur yang punya pendapat. Jika dua model kurang lebih sebanding pada suatu rangkaian tugas, model yang lebih murah tidak perlu memenangkan setiap diagram batang untuk memenangkan slot deployment. Bahan rahasianya, menurut Artificial Analysis, adalah diskon cache hit sekitar 98% dari DeepSeek pada API pihak pertamanya, dibandingkan dengan diskon cache hit 90% yang ditawarkan sebagian besar industri. Di sinilah harga AI berhenti menjadi matematika menu sederhana dan berubah menjadi menumpuk kupon di toko kelontong yang dikelola oleh aljabar linear. Input yang di-cache bisa sangat berpengaruh untuk aplikasi dengan prompt berulang, instruksi sistem, scaffolding retrieval, penggunaan ulang konteks panjang, atau loop agen yang terus menyeret ransel token yang sama ke mana-mana. Data penyedia Artificial Analysis mencantumkan DeepSeek sebagai penyedia yang tersedia untuk DeepSeek V4 Flash 0731 dan menunjukkan harga gabungan $0,06 per 1M token, sambil mencatat bahwa benchmark penyedia seperti kecepatan output dan waktu respons end-to-end tidak tersedia untuk halaman tersebut.
DeepSeek mengatakan jalur
API tetap membosankan, dan itu bagus Change log API DeepSeek mengatakan API resmi DeepSeek-V4-Flash masuk public beta pada 2026-07-31, dan metode pemanggilannya tetap tidak berubah: atur nama model ke deepseek-v4-flash untuk menggunakan versi terbaru. Kompatibilitas yang membosankan sering diremehkan. Semua orang menginginkan sihir sampai lapisan orkestrasi mereka mulai berteriak karena vendor mengganti nama buku mantranya. Change log DeepSeek yang sama melaporkan hasil benchmark agen untuk rilis resmi, termasuk Terminal Bench 2.1 di 82,7, NL2Repo di 54,2, Cybergym di 76,7, DeepSWE di 54,4, Toolathlon verified di 70,3, Agent Last Exam di 25,2, Automation Bench Public di 25,1, DSBench-FullStack di 68,7, dan DSBench-Hard di 59,6. DeepSeek mengatakan V4-Flash resmi mendukung format Responses API secara native dan secara khusus diadaptasi untuk Codex. Mereka juga mengatakan DeepSeek-V4-Flash-0731 mempertahankan arsitektur dan ukuran model yang sama dengan DeepSeek-V4-Flash-Preview, dan hanya melalui re-post-training. Klausa terakhir itu adalah permen sungguhan untuk para nerd: tidak setiap peningkatan model yang bermakna mengharuskan membuat benda itu lebih besar, lebih panas, dan lebih mahal, seperti rak GPU yang cosplay menjadi oven pizza.
Apa yang harus diuji builder berikutnya Artificial Analysis mengatakan DeepSeek
diperkirakan akan merilis full weights model ini dalam beberapa minggu mendatang, sehingga evaluasi lokal dan self-hosted mungkin menjadi lebih relevan jika itu terjadi. Sampai saat itu, langkah praktisnya adalah menguji workload Anda sendiri terhadap kualitas dan perilaku cache. Model yang terlihat murah di kalkulator generik bisa menjadi mahal jika semua prompt Anda adalah kepingan salju sekali pakai, dan model yang lebih mahal bisa menjadi masuk akal jika kualitasnya mencegah percobaan ulang. Token caching bukan sekadar hiasan di sini, melainkan sausnya, piringnya, dan mungkin juga pelayannya. Bagi para builder, DeepSeek V4 Flash 0731 adalah pengingat bahwa persaingan model frontier semakin banyak berbicara tentang total biaya tugas, bukan hanya siapa yang bisa bench-press benchmark tertinggi. Perhatikan data latensi, performa coding dan agen nyata, tingkat cache hit, dan apakah rilis weights yang diharapkan mengubah opsi deployment. Papan skor menjadi lebih ketat, tetapi fakturlah tempat alurnya belajar coding.