
Dans cet article (4)
Benchmarking de Vals AI : la solution à 40 M$ d’Andreessen Horowitz pour les tests
Points clés
- Traitez les benchmarks de modèles comme des éléments probants, et non comme une vérité absolue, surtout lorsque des tests publics alimentent les affirmations marketing.
- Choisissez des évaluations qui reflètent vos tâches métier, votre budget de latence et les schémas d’erreurs acceptables.
- Surveillez les outils de benchmarking indépendants dans le cadre de la pile de déploiement de l’IA, et pas seulement comme infrastructure de relations publiques.
Pourquoi c'est important
- ProduitBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- InvestisseursVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
Andreessen Horowitz soutient Vals après que la startup a affirmé que les anciens tests d’IA ne mesurent plus clairement les capacités des modèles modernes.
Les benchmarks sont censés être des compteurs de vitesse. Dans l’IA, ils sont aussi devenus des panneaux publicitaires, du remplissage de CV et, parfois, un jeu de fête foraine où l’entreprise qui fabrique le modèle possède secrètement les bouteilles. TechCrunch rapporte que Vals, une startup créée en 2024, a levé une série A de 40 millions de dollars menée par Andreessen Horowitz, après avoir soutenu que les anciens benchmarks universitaires ne suivent pas le rythme des modèles modernes. Ce n’est pas seulement une info de financement, c’est une étiquette d’avertissement pour toute personne qui choisit des modèles à coups de confettis de classements.
Le test est devenu le produit
TechCrunch note que le benchmarking est désormais la manière dont les entreprises d’IA valident les capacités des modèles, se différencient de leurs concurrents et mettent en avant leur supériorité quand les chiffres coopèrent. Le point gênant, selon le même article, est que les entreprises ont compris comment déjouer les anciens systèmes de benchmark, dont beaucoup sont plus vieux et ne sont pas conçus pour le comportement actuel des modèles. Rayan Krishnan, cofondateur de Vals, a déclaré à TechCrunch que de nouveaux modèles performants arrivaient rapidement, tandis que les benchmarks universitaires ne suivaient pas les avancées de pointe. Traduction : le sujet de l’examen a fuité, la classe a pris des tuteurs, et le professeur utilise encore le corrigé de la décennie dernière.
La page officielle du Vals Index montre comment l’entreprise veut faire évoluer l’évaluation vers le travail professionnel plutôt que vers la chasse aux trophées génériques. Vals explique que l’indice mesure les performances des modèles agentiques dans des tâches de finance, de codage et de droit, pondérées selon la part de chaque secteur dans le PIB des États-Unis. Elle indique aussi que l’indice agrège cinq benchmarks privés et deux publics afin de faire apparaître les compromis entre capacité, latence et coût. Ce dernier trio compte, car le meilleur modèle dans un classement n’est pas toujours le meilleur modèle dans votre produit, comme peut le confirmer tout ingénieur qui a vu la latence dévorer une session utilisateur comme un raton laveur dans une poubelle.
L’IA juridique a servi de répétition
Artificial Lawyer a rapporté que Vals a publié sa première étude de benchmark sur l’IA juridique le 27 février 2025, en testant plusieurs entreprises de legal tech avec de grands cabinets d’avocats, dont Reed Smith et Fisher Phillips. Les entreprises dont les résultats ont été partagés comprenaient Harvey, CoCounsel de Thomson Reuters, Vecflow et vLex, avec des comparaisons avec des avocats humains fournies par l’ALSP Cognia. Artificial Lawyer a aussi indiqué que Vals avait utilisé sa plateforme propriétaire de cadre d’auto-évaluation pour produire une évaluation à l’aveugle des réponses soumises par rapport à des réponses modèles. C’est de l’évaluation comme infrastructure, pas une feuille de calcul de vibes avec un logo.
LegalTechTalk avait auparavant décrit l’étude comme une collaboration entre de grands cabinets d’avocats américains, des fournisseurs d’IA dont Thomson Reuters, LexisNexis, Harvey, vLex et Vecflow, ainsi que Cognia. Le média a indiqué que cela marquait la première fois que plusieurs cabinets d’avocats et fournisseurs se réunissaient pour évaluer objectivement les performances de plateformes d’IA juridique sur des exemples réels de tâches juridiques. Voilà le modèle utile : des benchmarks construits avec des opérateurs du domaine, et non de simples prompts aspirés dans un classement et légèrement assaisonnés d’optimisme. Si votre modèle doit conseiller des avocats, le test devrait probablement ressembler moins à une soirée quiz et davantage à du vrai travail juridique.
Pourquoi l’argent compte moins que le mécanisme
citybiz a rapporté le 18 août 2026 que Vals avait levé 40 millions de dollars en financement de série A, avec une valorisation de 400 millions de dollars, menée par Andreessen Horowitz, afin d’étendre le benchmarking indépendant de l’IA. Le même article indiquait que l’entreprise évalue les modèles sur des tâches professionnelles et lance des benchmarks pour le codage, la cybersécurité et les risques de pointe. Il rapportait aussi que le chiffre d’affaires avait été multiplié par huit cette année, tandis que le nombre de clients avait doublé et que l’équipe avait triplé. Je laisserai à Jules le thé sur la valorisation des startups, mais le signal produit est clair : l’évaluation devient une catégorie logicielle à part entière.
citybiz a aussi rapporté que le PDG Rayan Krishnan développe le travail de Vals sur les politiques publiques avec des agences américaines, dont le NIST. C’est important, car la conception des benchmarks n’est plus seulement une préoccupation de laboratoire de ML : c’est l’approvisionnement, la conformité, la sécurité produit et l’hygiène marketing qui portent tous le même trench-coat. Les entreprises veulent savoir si un modèle peut réaliser leurs tâches de manière fiable, pas s’il peut réussir un test public qui a été blogué, copié, mémorisé et possiblement tatoué dans le corpus d’entraînement. Les évaluations indépendantes ne résoudront pas tous les problèmes, mais elles peuvent rendre le choix des modèles moins semblable à de l’astrologie avec des GPU.
Ce que les créateurs devraient en retenir
La leçon pratique du reportage de TechCrunch n’est pas que tous les benchmarks sont cassés. C’est que les benchmarks publics vieillissants deviennent plus faciles à optimiser, surtout lorsque la place dans un classement se transforme en publicité. Les créateurs devraient traiter les scores des modèles comme des entrées, pas comme des verdicts, et exiger des évaluations qui correspondent à leur domaine, à la forme de leurs données, à leur budget de latence et à leur tolérance aux échecs. Si vous choisissez entre des modèles pour de la revue juridique, des flux de travail financiers, des agents de codage ou des déploiements réglementés, la bonne question n’est pas de savoir quel modèle gagne en général, mais quel modèle échoue le moins bizarrement sur votre travail réel.
Il faudra voir si Vals peut maintenir sa neutralité tout en vendant de l’évaluation à une industrie qui veut désespérément des chiffres flatteurs en police 48. Il faudra aussi voir si des concurrents émergent avec de meilleurs contrôles de contamination, des ensembles de tâches privés et des grilles d’évaluation propres à chaque domaine qui vieillissent mieux que l’éphémère benchmark habituel. Le business des benchmarks est en train de devenir l’arbitre, le tableau d’affichage et le système de ralenti instantané de l’adoption de l’IA. Et comme n’importe qui dans le sport peut vous le dire, la cabine de ralenti n’a d’importance que si tout le monde croit qu’elle n’est pas sponsorisée par l’équipe qui vient de marquer.
Sources5 sources
Les articles, annonces et travaux de recherche dont le rédacteur IA s'est servi. Les liens ouvrent la publication d'origine.
- Vals, soutenue par Andreessen Horowitz, cherche à devenir la référence absolue du benchmarking de l’IAtechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals publie les résultats de la première étude de benchmark sur l’IA juridiqueartificiallawyer.com
- Vals AI, l’évaluateur de LLM, annonce une étude de benchmark sur l’IA juridique, une première sur le marché - LegalTechTalklegaltech-talk.com
- Vals AI lève 40 M$ pour développer l’IA indépendante ...citybiz.co