Vals AI बेंचमार्किंग: Andreessen Horowitz का $40M टेस्ट फिक्स
मुख्य बातें
- मॉडल बेंचमार्क को प्रमाण मानें, अंतिम सत्य नहीं, खासकर जब सार्वजनिक परीक्षण मार्केटिंग दावों को बढ़ावा देते हों।
- ऐसे मूल्यांकन चुनें जो आपके डोमेन के कार्यों, विलंबता बजट और स्वीकार्य त्रुटि पैटर्न को प्रतिबिंबित करते हों।
- स्वतंत्र बेंचमार्किंग टूल्स को AI डिप्लॉयमेंट स्टैक का हिस्सा मानकर देखें, केवल PR इंफ्रास्ट्रक्चर नहीं।
यह क्यों मायने रखता है
- प्रोडक्टBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- निवेशकVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
Andreessen Horowitz, Vals का समर्थन कर रहा है, क्योंकि स्टार्टअप ने तर्क दिया कि पुराने AI परीक्षण अब आधुनिक मॉडल की क्षमता को स्पष्ट रूप से नहीं मापते।
Andreessen Horowitz वॉल्स का समर्थन कर रहा है, क्योंकि स्टार्टअप ने तर्क दिया कि पुराने AI परीक्षण अब आधुनिक मॉडल की क्षमता को साफ़ तौर पर नहीं मापते।
बेंचमार्क का काम स्पीडोमीटर जैसा होना चाहिए। AI में, वे बिलबोर्ड, रिज़्यूमे में जोड़ने वाली उपलब्धि, और कभी-कभी मेले वाला रिंग टॉस भी बन गए हैं, जहाँ मॉडल कंपनी चुपके से बोतलों की मालिक होती है। TechCrunch की रिपोर्ट के अनुसार, 2024 में बने स्टार्टअप Vals ने Andreessen Horowitz के नेतृत्व में $40 मिलियन की Series A फंडिंग जुटाई है, यह तर्क देते हुए कि पुराने अकादमिक बेंचमार्क आधुनिक मॉडलों की रफ्तार के साथ नहीं चल पा रहे। यह सिर्फ फंडिंग की खबर नहीं है; यह उन सभी के लिए चेतावनी-लेबल है जो लीडरबोर्ड की चमक-दमक देखकर मॉडल चुनते हैं।
टेस्ट ही प्रोडक्ट बन गया
TechCrunch नोट करता है कि बेंचमार्किंग अब वह तरीका है जिससे AI कंपनियाँ मॉडल की क्षमता को प्रमाणित करती हैं, प्रतिस्पर्धियों से खुद को अलग दिखाती हैं, और जब आंकड़े साथ दें तो श्रेष्ठता की मार्केटिंग करती हैं। उसी रिपोर्ट के अनुसार, असहज बात यह है कि कंपनियों ने पुराने बेंचमार्क सिस्टमों को मात देना सीख लिया है, जिनमें से कई पुराने हैं और मौजूदा मॉडल व्यवहार के लिए बनाए ही नहीं गए थे। Vals के सह-संस्थापक Rayan Krishnan ने TechCrunch से कहा कि नए सक्षम मॉडल तेज़ी से आ रहे थे, जबकि अकादमिक बेंचमार्क फ्रंटियर प्रगति के साथ कदम नहीं मिला पा रहे थे। अनुवाद: परीक्षा लीक हो गई, क्लास को ट्यूटर मिल गए, और शिक्षक अब भी पिछले दशक की आंसर की इस्तेमाल कर रहा है।
आधिकारिक Vals Index पेज दिखाता है कि कंपनी मूल्यांकन को सामान्य ट्रॉफी-शिकार से हटाकर पेशेवर काम की ओर ले जाना चाहती है। Vals कहता है कि यह इंडेक्स finance, coding, और legal tasks में agentic model performance को मापता है, जिसे U.S. GDP में हर सेक्टर की हिस्सेदारी के हिसाब से वेट किया जाता है। यह भी कहता है कि इंडेक्स पाँच private और दो public benchmarks को मिलाकर capability, latency, और cost के बीच tradeoffs सामने लाता है। यह आखिरी तिकड़ी मायने रखती है, क्योंकि लीडरबोर्ड पर सबसे अच्छा मॉडल हमेशा आपके प्रोडक्ट के अंदर सबसे अच्छा मॉडल नहीं होता—यह बात हर इंजीनियर पुष्टि कर सकता है जिसने latency को किसी यूज़र सेशन को कूड़ेदान में घुसे रैकून की तरह खाते देखा है।
लीगल AI रिहर्सल था
Artificial Lawyer ने रिपोर्ट किया कि Vals ने 27 फरवरी 2025 को अपनी पहली legal AI benchmark study प्रकाशित की, जिसमें Reed Smith और Fisher Phillips सहित बड़ी law firms के साथ कई legal tech कंपनियों का परीक्षण किया गया। जिन कंपनियों के परिणाम साझा किए गए उनमें Harvey, Thomson Reuters का CoCounsel, Vecflow, और vLex शामिल थे, और मानव वकीलों से तुलना ALSP Cognia ने उपलब्ध कराई। Artificial Lawyer ने यह भी कहा कि Vals ने submitted responses का model answers के खिलाफ blind assessment तैयार करने के लिए अपना proprietary auto-evaluation framework platform इस्तेमाल किया। यह evaluation as infrastructure है, लोगो वाली vibes spreadsheet नहीं।
LegalTechTalk ने पहले इस अध्ययन को शीर्ष U.S. law firms, Thomson Reuters, LexisNexis, Harvey, vLex, और Vecflow जैसे AI vendors, साथ ही Cognia के बीच सहयोग के रूप में बताया था। आउटलेट ने कहा कि यह पहली बार था जब कई law firms और vendors ने कानूनी कार्यों के real world examples पर legal AI platform performance का वस्तुनिष्ठ आकलन करने के लिए साथ काम किया। यही उपयोगी पैटर्न है: domain operators के साथ बनाए गए benchmarks, न कि सिर्फ leaderboard में scrape किए गए prompts जिन पर हल्का-सा आशावाद छिड़क दिया गया हो। अगर आपका मॉडल वकीलों को सलाह देने वाला है, तो टेस्ट शायद trivia night जैसा कम और वास्तविक lawyering जैसा ज़्यादा दिखना चाहिए।
पैसा कम, तरीका ज़्यादा मायने रखता है
citybiz ने 18 अगस्त 2026 को रिपोर्ट किया कि Vals ने Andreessen Horowitz के नेतृत्व में $400 मिलियन valuation पर Series A funding में $40 मिलियन जुटाए, ताकि independent AI benchmarking का विस्तार किया जा सके। उसी रिपोर्ट ने कहा कि कंपनी professional tasks पर models का मूल्यांकन करती है और coding, cybersecurity, और frontier-risk benchmarks लॉन्च कर रही है। इसमें यह भी बताया गया कि इस साल revenue आठ गुना बढ़ा है, जबकि customers दोगुने हुए और team तिगुनी हो गई।
स्टार्टअप valuation वाली चाय मैं Jules पर छोड़ता हूँ, लेकिन product signal साफ है: evaluation अपनी अलग software category बन रहा है। citybiz ने यह भी रिपोर्ट किया कि CEO Rayan Krishnan U.S. agencies, जिनमें NIST भी शामिल है, के साथ Vals का policy work बढ़ा रहे हैं। यह मायने रखता है क्योंकि benchmark design अब सिर्फ ML lab की चिंता नहीं रह गया; यह procurement, compliance, product safety, और marketing hygiene है—सब एक ही trench coat पहने हुए। Enterprises यह जानना चाहते हैं कि कोई मॉडल उनके काम भरोसेमंद ढंग से कर सकता है या नहीं, न कि यह कि वह कोई public test टॉप कर सकता है जिसे blog किया गया, copy किया गया, याद किया गया, और संभवतः training corpus पर tattoo भी कर दिया गया हो। Independent evaluations हर समस्या हल नहीं करेंगे, लेकिन वे model selection को GPUs वाली astrology जैसा कम बना सकते हैं।
बिल्डर्स को इससे क्या सीखना चाहिए
TechCrunch की रिपोर्टिंग से व्यावहारिक सबक यह नहीं है कि हर benchmark टूटा हुआ है। बात यह है कि stale public benchmarks के इर्द-गिर्द optimize करना आसान होता जाता है, खासकर जब leaderboard placement advertising में बदल जाए। Builders को model scores को inputs की तरह लेना चाहिए, verdicts की तरह नहीं, और ऐसे evaluations की मांग करनी चाहिए जो उनके domain, data shape, latency budget, और failure tolerance से मेल खाते हों।
अगर आप legal review, finance workflows, coding agents, या regulated deployments के लिए models के बीच चुनाव कर रहे हैं, तो सही सवाल यह नहीं है कि सामान्य रूप से कौन-सा मॉडल जीतता है; सवाल यह है कि आपके वास्तविक काम पर कौन-सा मॉडल सबसे कम अजीब तरह से fail होता है। देखें कि क्या Vals ऐसी industry को evaluation बेचते हुए neutrality बनाए रख सकता है जो 48 point font में flattering numbers पाने के लिए बेताब है। यह भी देखें कि क्या ऐसे competitors आते हैं जिनके पास मजबूत contamination controls, private task sets, और domain specific rubrics हों जो सामान्य benchmark mayfly से बेहतर उम्र पाते हों। Benchmark business AI adoption के लिए referee, scoreboard, और instant replay system बन रहा है। और जैसा खेलों में कोई भी बता सकता है, replay booth तभी मायने रखता है जब सभी मानें कि उसे अभी-अभी score करने वाली team sponsor नहीं कर रही।
स्रोत5 स्रोत
वे रिपोर्टें, घोषणाएँ और शोध जिनके आधार पर AI संपादक ने काम किया। लिंक मूल प्रकाशक का पेज खोलते हैं।
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingtechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals Publishes Results of First Legal AI Benchmark Studyartificiallawyer.com
- Vals AI, the LLM evaluator, Announces a Market-First Legal AI Benchmarking Study - LegalTechTalklegaltech-talk.com
- Vals AI Raises $40M to Expand Independent AI ...citybiz.co
