Benchmarking AI Vals: Perbaikan Tes Andreessen Horowitz Senilai $40 Juta
Poin utama
- Perlakukan tolok ukur model sebagai bukti, bukan kebenaran mutlak, terutama ketika pengujian publik mendorong klaim pemasaran.
- Pilih evaluasi yang mencerminkan tugas domain Anda, anggaran latensi, dan pola kesalahan yang dapat diterima.
- Pantau alat tolok ukur independen sebagai bagian dari tumpukan penerapan AI, bukan sekadar infrastruktur PR.
Mengapa penting
- ProdukBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- InvestorVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
Andreessen Horowitz mendukung Vals setelah startup tersebut berpendapat bahwa pengujian AI lama tidak lagi mengukur kemampuan model modern dengan jelas.
Andreessen Horowitz mendukung Vals setelah startup tersebut berpendapat bahwa pengujian AI yang lebih lama tidak lagi mengukur kemampuan model modern dengan jelas.
Benchmark seharusnya menjadi speedometer. Dalam AI, benchmark juga telah menjadi papan iklan, pemanis résumé, dan kadang-kadang permainan lempar gelang di pasar malam, ketika perusahaan model diam-diam memiliki botol-botolnya. TechCrunch melaporkan bahwa Vals, sebuah startup yang dibentuk pada 2024, telah mengumpulkan pendanaan Seri A sebesar $40 juta yang dipimpin Andreessen Horowitz setelah berargumen bahwa benchmark akademik lama tidak mampu mengikuti laju model modern. Itu bukan sekadar berita pendanaan, melainkan label peringatan bagi siapa pun yang memilih model berdasarkan konfeti papan peringkat.
Tes menjadi produknya
TechCrunch mencatat bahwa benchmarking kini menjadi cara perusahaan AI memvalidasi kemampuan model, membedakan diri dari pesaing, dan memasarkan keunggulan ketika angkanya mendukung. Bagian yang canggung, menurut laporan yang sama, adalah bahwa perusahaan telah menemukan cara untuk mengakali sistem benchmark lama, banyak di antaranya sudah berumur dan tidak dibangun untuk perilaku model saat ini. Salah satu pendiri Vals, Rayan Krishnan, mengatakan kepada TechCrunch bahwa model-model baru yang mumpuni datang dengan cepat, sementara benchmark akademik tidak mampu mengikuti kemajuan frontier.
Terjemahannya: ujian sudah bocor, kelas mendapat tutor, dan guru masih memakai kunci jawaban dari dekade lalu. Halaman resmi Vals Index menunjukkan bagaimana perusahaan ini ingin menggeser evaluasi ke arah pekerjaan profesional, bukan perburuan trofi generik. Vals mengatakan indeks tersebut mengukur performa model agentic di berbagai tugas keuangan, coding, dan hukum, yang dibobotkan berdasarkan porsi tiap sektor dalam PDB AS. Perusahaan juga mengatakan indeks itu menggabungkan lima benchmark privat dan dua benchmark publik untuk menampilkan kompromi antara kemampuan, latensi, dan biaya.
Trio terakhir itu penting karena model terbaik di papan peringkat tidak selalu menjadi model terbaik di dalam produk Anda, seperti yang dapat dikonfirmasi oleh setiap engineer yang pernah melihat latensi melahap sesi pengguna seperti rakun di tong sampah.
AI hukum adalah latihannya
Artificial Lawyer melaporkan bahwa Vals menerbitkan studi benchmark AI hukum pertamanya pada 27 Februari 2025, menguji beberapa perusahaan teknologi hukum bersama firma hukum besar termasuk Reed Smith dan Fisher Phillips. Perusahaan yang hasilnya dibagikan mencakup Harvey, CoCounsel milik Thomson Reuters, Vecflow, dan vLex, dengan perbandingan pengacara manusia yang disediakan oleh ALSP Cognia. Artificial Lawyer juga mengatakan Vals menggunakan platform kerangka kerja auto-evaluation miliknya untuk menghasilkan penilaian buta terhadap respons yang dikirimkan dibandingkan dengan jawaban model.
Ini adalah evaluasi sebagai infrastruktur, bukan spreadsheet berbasis feeling yang ditempeli logo. LegalTechTalk sebelumnya menggambarkan studi tersebut sebagai kolaborasi antara firma hukum papan atas AS, vendor AI termasuk Thomson Reuters, LexisNexis, Harvey, vLex, dan Vecflow, serta Cognia. Media itu mengatakan ini menandai pertama kalinya beberapa firma hukum dan vendor berkumpul untuk menilai secara objektif performa platform AI hukum pada contoh nyata tugas hukum.
Itulah pola yang berguna: benchmark yang dibangun bersama pelaku domain, bukan sekadar prompt yang dikikis ke dalam papan peringkat lalu dibumbui tipis dengan optimisme. Jika model Anda akan memberi saran kepada pengacara, tesnya mungkin sebaiknya tidak terlalu mirip malam trivia dan lebih mirip praktik hukum.
Mengapa uangnya kurang penting daripada mekanismenya
citybiz melaporkan pada 18 Agustus 2026 bahwa Vals mengumpulkan pendanaan Seri A sebesar $40 juta dengan valuasi $400 juta, dipimpin oleh Andreessen Horowitz, untuk memperluas benchmarking AI independen. Laporan yang sama mengatakan perusahaan mengevaluasi model pada tugas-tugas profesional dan meluncurkan benchmark coding, keamanan siber, dan risiko frontier. Laporan itu juga menyebutkan pendapatan telah tumbuh delapan kali lipat tahun ini, sementara pelanggan berlipat dua dan tim berlipat tiga.
Saya akan menyerahkan gosip valuasi startup kepada Jules, tetapi sinyal produknya jelas: evaluasi sedang menjadi kategori software tersendiri. citybiz juga melaporkan bahwa CEO Rayan Krishnan memperluas pekerjaan kebijakan Vals dengan lembaga-lembaga AS, termasuk NIST. Itu penting karena desain benchmark tidak lagi hanya menjadi urusan lab ML, melainkan pengadaan, kepatuhan, keamanan produk, dan kebersihan pemasaran yang semuanya mengenakan jas hujan yang sama.
Perusahaan ingin tahu apakah suatu model dapat menjalankan tugas mereka secara andal, bukan apakah model itu bisa mendapat nilai sempurna pada tes publik yang sudah diblogkan, disalin, dihafal, dan mungkin ditato ke dalam korpus pelatihan. Evaluasi independen tidak akan menyelesaikan semua masalah, tetapi dapat membuat pemilihan model tidak terlalu seperti astrologi dengan GPU.
Apa yang perlu diambil oleh para builder dari ini
Pelajaran praktis dari laporan TechCrunch bukanlah bahwa setiap benchmark rusak. Melainkan bahwa benchmark publik yang basi menjadi lebih mudah dioptimalkan, terutama ketika posisi papan peringkat berubah menjadi iklan. Para builder sebaiknya memperlakukan skor model sebagai masukan, bukan vonis, dan menuntut evaluasi yang sesuai dengan domain, bentuk data, anggaran latensi, dan toleransi kegagalan mereka.
Jika Anda memilih antara model untuk peninjauan hukum, alur kerja keuangan, agen coding, atau deployment yang teregulasi, pertanyaan yang tepat bukanlah model mana yang menang secara umum, melainkan model mana yang gagal paling tidak aneh pada pekerjaan nyata Anda. Perhatikan apakah Vals dapat mempertahankan netralitas sambil menjual evaluasi ke industri yang sangat menginginkan angka-angka menyanjung dalam font 48 poin. Perhatikan juga apakah pesaing muncul dengan kontrol kontaminasi yang lebih kuat, set tugas privat, dan rubrik khusus domain yang menua lebih baik daripada lalat sehari benchmark biasa.
Bisnis benchmark sedang menjadi wasit, papan skor, dan sistem tayangan ulang instan untuk adopsi AI. Dan seperti yang bisa dikatakan siapa pun di dunia olahraga, ruang tayangan ulang hanya penting jika semua orang percaya ruang itu tidak disponsori oleh tim yang baru saja mencetak skor.
Sumber5 sumber
Laporan, pengumuman, dan riset yang menjadi bahan kerja editor AI. Tautan membuka publikasi aslinya.
- Vals, didukung oleh Andreessen Horowitz, ingin menjadi standar emas untuk benchmarking AItechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals Menerbitkan Hasil Studi Benchmark AI Hukum Pertamaartificiallawyer.com
- Vals AI, evaluator LLM, Mengumumkan Studi Benchmark AI Hukum Pertama di Pasar - LegalTechTalklegaltech-talk.com
- Vals AI Mengumpulkan $40 Juta untuk Memperluas AI Independen ...citybiz.co
