Vals KI-Benchmarking: Andreessen Horowitz’ 40-Millionen-Dollar-Testfix
Kernaussagen
- Behandeln Sie Modell-Benchmarks als Hinweise, nicht als unumstößliche Wahrheit, insbesondere wenn öffentliche Tests Marketingaussagen antreiben.
- Wählen Sie Evaluationen, die Ihre domänenspezifischen Aufgaben, Ihr Latenzbudget und akzeptable Fehlermuster widerspiegeln.
- Beobachten Sie unabhängige Benchmarking-Tools als Teil des KI-Deployment-Stacks, nicht nur als PR-Infrastruktur.
Warum das zählt
- ProduktBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- InvestorenVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
Andreessen Horowitz unterstützt Vals, nachdem das Startup argumentiert hatte, dass ältere KI-Tests die Fähigkeiten moderner Modelle nicht mehr zuverlässig messen.
Andreessen Horowitz unterstützt Vals, nachdem das Startup argumentiert hatte, dass ältere KI-Tests die Fähigkeiten moderner Modelle nicht mehr klar messen.
Benchmarks sollen Tachometer sein. In der KI sind sie auch zu Werbetafeln, Lebenslauf-Polstern und gelegentlich zu einem Jahrmarkt-Ringwurf geworden, bei dem das Modellunternehmen heimlich die Flaschen besitzt. TechCrunch berichtet, dass Vals, ein 2024 gegründetes Startup, eine Series-A-Finanzierung über 40 Millionen US-Dollar unter Führung von Andreessen Horowitz eingeworben hat, nachdem es argumentiert hatte, dass ältere akademische Benchmarks nicht mit modernen Modellen Schritt halten. Das ist nicht nur eine Finanzierungsnachricht, sondern ein Warnhinweis für alle, die Modelle nach Bestenlisten-Konfetti auswählen.
Der Test wurde zum Produkt
TechCrunch merkt an, dass Benchmarking inzwischen die Methode ist, mit der KI-Unternehmen Modellfähigkeiten validieren, sich von Wettbewerbern abheben und Überlegenheit vermarkten, wenn die Zahlen mitspielen. Der unangenehme Teil ist laut demselben Bericht, dass Unternehmen herausgefunden haben, wie sie ältere Benchmark-Systeme austricksen können, von denen viele älter und nicht für das heutige Modellverhalten gebaut sind. Vals-Mitgründer Rayan Krishnan sagte TechCrunch, dass neue leistungsfähige Modelle schnell auf den Markt kämen, während akademische Benchmarks nicht mit den Fortschritten an der Spitze mithielten. Übersetzung: Die Prüfung wurde geleakt, die Klasse hat Nachhilfelehrer bekommen, und die Lehrkraft benutzt immer noch den Lösungsschlüssel des letzten Jahrzehnts.
Die offizielle Vals-Index-Seite zeigt, wie das Unternehmen die Bewertung in Richtung beruflicher Arbeit statt generischer Trophäenjagd verschieben will. Vals sagt, der Index messe die Leistung agentischer Modelle in Finanz-, Coding- und Rechtsaufgaben, gewichtet nach dem Anteil jedes Sektors am US-BIP. Außerdem heißt es, der Index fasse fünf private und zwei öffentliche Benchmarks zusammen, um Zielkonflikte zwischen Fähigkeit, Latenz und Kosten sichtbar zu machen. Dieses letzte Trio ist wichtig, denn das beste Modell auf einer Bestenliste ist nicht immer das beste Modell in deinem Produkt, wie jede Ingenieurin und jeder Ingenieur bestätigen kann, der schon einmal gesehen hat, wie Latenz eine Nutzersitzung verschlingt wie ein Waschbär eine Mülltonne.
Rechts-KI war die Generalprobe
Artificial Lawyer berichtete, dass Vals am 27. Februar 2025 seine erste Benchmark-Studie zu Rechts-KI veröffentlichte und mehrere Legal-Tech-Unternehmen mit großen Kanzleien testete, darunter Reed Smith und Fisher Phillips. Zu den Unternehmen, deren Ergebnisse geteilt wurden, gehörten Harvey, CoCounsel von Thomson Reuters, Vecflow und vLex; menschliche Anwaltsvergleiche wurden von ALSP Cognia bereitgestellt. Artificial Lawyer sagte außerdem, Vals habe seine proprietäre Auto-Evaluierungs-Framework-Plattform genutzt, um eine blinde Bewertung der eingereichten Antworten im Vergleich zu Musterantworten zu erstellen. Das ist Evaluation als Infrastruktur, kein Stimmungs-Spreadsheet mit Logo.
LegalTechTalk beschrieb die Studie zuvor als Zusammenarbeit zwischen führenden US-Kanzleien, KI-Anbietern wie Thomson Reuters, LexisNexis, Harvey, vLex und Vecflow sowie Cognia. Das Medium sagte, dies sei das erste Mal gewesen, dass mehrere Kanzleien und Anbieter zusammenkamen, um die Leistung von Legal-AI-Plattformen anhand realer Beispiele juristischer Aufgaben objektiv zu bewerten. Das ist das nützliche Muster: Benchmarks, die mit Fachleuten aus der Praxis gebaut werden, nicht nur Prompts, die in eine Bestenliste geschabt und leicht mit Optimismus gewürzt werden. Wenn dein Modell Anwälte beraten soll, sollte der Test wahrscheinlich weniger wie ein Quizabend aussehen und mehr wie echte juristische Arbeit.
Warum das Geld weniger wichtig ist als der Mechanismus
citybiz berichtete am 18. August 2026, dass Vals 40 Millionen US-Dollar in einer Series-A-Finanzierung bei einer Bewertung von 400 Millionen US-Dollar eingeworben hat, angeführt von Andreessen Horowitz, um unabhängiges KI-Benchmarking auszubauen. Derselbe Bericht sagte, das Unternehmen bewerte Modelle anhand beruflicher Aufgaben und starte Benchmarks für Coding, Cybersicherheit und Frontier-Risiken. Außerdem wurde berichtet, dass der Umsatz in diesem Jahr um das Achtfache gewachsen sei, während sich die Kundenzahl verdoppelt und das Team verdreifacht habe. Den Startup-Bewertungs-Tee überlasse ich Jules, aber das Produktsignal ist klar: Evaluation wird zu einer eigenen Softwarekategorie.
citybiz berichtete auch, dass CEO Rayan Krishnan die Policy-Arbeit von Vals mit US-Behörden ausbaut, darunter NIST. Das ist wichtig, weil Benchmark-Design nicht mehr nur ein Thema für ML-Labore ist; es ist Beschaffung, Compliance, Produktsicherheit und Marketing-Hygiene, alles im selben Trenchcoat. Unternehmen wollen wissen, ob ein Modell ihre Aufgaben zuverlässig ausführen kann, nicht ob es einen öffentlichen Test mit Bravour besteht, der verbloggt, kopiert, auswendig gelernt und möglicherweise in den Trainingskorpus tätowiert wurde. Unabhängige Evaluationen werden nicht jedes Problem lösen, aber sie können die Modellauswahl weniger wie Astrologie mit GPUs machen.
Was Entwicklerinnen und Entwickler daraus mitnehmen sollten
Die praktische Lektion aus der Berichterstattung von TechCrunch ist nicht, dass jeder Benchmark kaputt ist. Sie lautet, dass veraltete öffentliche Benchmarks leichter zu optimieren sind, besonders wenn eine Platzierung auf der Bestenliste zu Werbung wird. Entwicklerinnen und Entwickler sollten Modell-Scores als Eingaben behandeln, nicht als Urteile, und Evaluationen verlangen, die zu ihrer Domäne, Datenform, ihrem Latenzbudget und ihrer Fehlertoleranz passen.
Wenn du zwischen Modellen für juristische Prüfung, Finanz-Workflows, Coding-Agenten oder regulierte Einsätze auswählst, ist die richtige Frage nicht, welches Modell allgemein gewinnt, sondern welches Modell bei deiner tatsächlichen Arbeit am wenigsten seltsam scheitert. Beobachte, ob Vals neutral bleiben kann, während es Evaluationen an eine Branche verkauft, die verzweifelt schmeichelhafte Zahlen in 48-Punkt-Schrift haben will. Beobachte auch, ob Wettbewerber mit stärkeren Kontaminationskontrollen, privaten Aufgabensätzen und domänenspezifischen Bewertungsrastern auftauchen, die besser altern als die übliche Benchmark-Eintagsfliege.
Das Benchmark-Geschäft wird zum Schiedsrichter, zur Anzeigetafel und zum Videobeweis-System für die KI-Einführung. Und wie dir alle im Sport sagen können: Der Videobeweisraum ist nur dann wichtig, wenn alle glauben, dass er nicht von dem Team gesponsert wird, das gerade gepunktet hat.
Quellen5 Quellen
Die Berichte, Ankündigungen und Studien, mit denen der KI-Redakteur gearbeitet hat. Die Links führen zur Originalquelle.
- Vals, unterstützt von Andreessen Horowitz, will zum Goldstandard für KI-Benchmarking werdentechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals veröffentlicht Ergebnisse der ersten Benchmark-Studie zu Rechts-KIartificiallawyer.com
- Vals AI, der LLM-Evaluator, kündigt eine marktweit erste Benchmark-Studie zu Rechts-KI an - LegalTechTalklegaltech-talk.com
- Vals AI sammelt 40 Mio. US-Dollar ein, um unabhängige KI ...citybiz.co
