
Neste artigo (4)
Benchmarking da Vals AI: a correção do teste de US$ 40 milhões da Andreessen Horowitz
Principais conclusões
- Trate benchmarks de modelos como evidência, não como verdade absoluta, especialmente quando testes públicos impulsionam alegações de marketing.
- Escolha avaliações que reflitam as tarefas do seu domínio, seu orçamento de latência e padrões de erro aceitáveis.
- Acompanhe ferramentas independentes de benchmarking como parte da pilha de implantação de IA, não apenas como infraestrutura de relações públicas.
Por que importa
- ProdutoBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- InvestidoresVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
A Andreessen Horowitz está apoiando a Vals depois que a startup argumentou que testes de IA mais antigos já não medem de forma clara a capacidade dos modelos modernos.
Benchmarks deveriam ser velocímetros. Em IA, eles também viraram outdoors, enchimento de currículo e, às vezes, uma barraca de argolas de parque de diversões em que a empresa do modelo secretamente é dona das garrafas. O TechCrunch relata que a Vals, uma startup formada em 2024, levantou uma rodada Série A de US$ 40 milhões liderada pela Andreessen Horowitz depois de argumentar que benchmarks acadêmicos mais antigos não estão acompanhando o ritmo dos modelos modernos. Isso não é apenas uma notícia de financiamento; é um aviso para qualquer pessoa que escolhe modelos seguindo confete de rankings.
O teste virou o produto
O TechCrunch observa que benchmarking agora é a forma como empresas de IA validam a capacidade dos modelos, se diferenciam dos concorrentes e divulgam superioridade quando os números colaboram. A parte constrangedora, segundo a mesma reportagem, é que as empresas descobriram como enganar sistemas de benchmark legados, muitos dos quais são mais antigos e não foram criados para o comportamento atual dos modelos.
O cofundador da Vals, Rayan Krishnan, disse ao TechCrunch que novos modelos capazes estavam chegando rapidamente, enquanto benchmarks acadêmicos não estavam acompanhando os avanços de fronteira. Tradução: a prova vazou, a turma arrumou tutores, e o professor ainda está usando o gabarito da década passada.
A página oficial do Vals Index mostra como a empresa quer levar a avaliação para o trabalho profissional, em vez de uma caça genérica por troféus. A Vals diz que o índice mede o desempenho de modelos agênticos em tarefas de finanças, programação e direito, ponderadas pela participação de cada setor no PIB dos EUA. Ela também diz que o índice agrega cinco benchmarks privados e dois públicos para revelar compensações entre capacidade, latência e custo. Esse último trio importa porque o melhor modelo em um ranking nem sempre é o melhor modelo dentro do seu produto, como pode confirmar qualquer engenheiro que já viu a latência devorar uma sessão de usuário como um guaxinim em uma lata de lixo.
A IA jurídica foi o ensaio
O Artificial Lawyer informou que a Vals publicou seu primeiro estudo de benchmark de IA jurídica em 27 de fevereiro de 2025, testando várias empresas de tecnologia jurídica com grandes escritórios de advocacia, incluindo Reed Smith e Fisher Phillips. As empresas cujos resultados foram compartilhados incluíam Harvey, CoCounsel da Thomson Reuters, Vecflow e vLex, com comparações com advogados humanos fornecidas pela ALSP Cognia.
O Artificial Lawyer também disse que a Vals usou sua plataforma proprietária de estrutura de autoavaliação para produzir uma avaliação cega das respostas enviadas em comparação com respostas-modelo. Isso é avaliação como infraestrutura, não uma planilha de “sensações” com um logotipo.
O LegalTechTalk havia descrito antes o estudo como uma colaboração entre grandes escritórios de advocacia dos EUA, fornecedores de IA incluindo Thomson Reuters, LexisNexis, Harvey, vLex e Vecflow, além da Cognia. O veículo disse que isso marcou a primeira vez que vários escritórios e fornecedores se reuniram para avaliar objetivamente o desempenho de plataformas de IA jurídica em exemplos reais de tarefas jurídicas.
Esse é o padrão útil: benchmarks criados com operadores do domínio, não apenas prompts raspados para um ranking e levemente temperados com otimismo. Se o seu modelo vai aconselhar advogados, o teste provavelmente deveria parecer menos uma noite de trivia e mais o exercício da advocacia.
Por que o dinheiro importa menos que o mecanismo
A citybiz informou em 18 de agosto de 2026 que a Vals levantou US$ 40 milhões em financiamento Série A com uma avaliação de US$ 400 milhões, liderada pela Andreessen Horowitz, para expandir o benchmarking independente de IA. A mesma reportagem disse que a empresa avalia modelos em tarefas profissionais e está lançando benchmarks de programação, cibersegurança e risco de fronteira. Ela também informou que a receita cresceu oito vezes este ano, enquanto os clientes dobraram e a equipe triplicou.
Vou deixar o chá das avaliações de startup para Jules, mas o sinal de produto é claro: avaliação está se tornando sua própria categoria de software. A citybiz também informou que o CEO Rayan Krishnan está expandindo o trabalho de políticas públicas da Vals com agências dos EUA, incluindo o NIST. Isso importa porque o design de benchmarks não é mais apenas uma preocupação de laboratório de ML; é aquisição, conformidade, segurança de produto e higiene de marketing, tudo vestindo o mesmo sobretudo.
Empresas querem saber se um modelo consegue executar suas tarefas de forma confiável, não se ele consegue gabaritar um teste público que já foi publicado em blogs, copiado, memorizado e possivelmente tatuado no corpus de treinamento. Avaliações independentes não vão resolver todos os problemas, mas podem tornar a escolha de modelos menos parecida com astrologia com GPUs.
O que quem constrói deve aprender com isso
A lição prática da reportagem do TechCrunch não é que todo benchmark está quebrado. É que benchmarks públicos ultrapassados ficam mais fáceis de otimizar ao redor, especialmente quando a posição no ranking vira publicidade. Quem constrói deve tratar pontuações de modelos como insumos, não veredictos, e exigir avaliações que correspondam ao seu domínio, formato de dados, orçamento de latência e tolerância a falhas.
Se você está escolhendo entre modelos para revisão jurídica, fluxos de trabalho financeiros, agentes de programação ou implantações reguladas, a pergunta certa não é qual modelo vence em geral, mas qual modelo falha de maneira menos estranha no seu trabalho real.
Observe se a Vals consegue manter neutralidade enquanto vende avaliação para uma indústria que quer desesperadamente números elogiosos em fonte tamanho 48. Observe também se surgem concorrentes com controles de contaminação mais fortes, conjuntos de tarefas privados e rubricas específicas de domínio que envelheçam melhor do que a efêmera média dos benchmarks de sempre.
O negócio de benchmarks está se tornando o árbitro, o placar e o sistema de replay instantâneo da adoção de IA. E, como qualquer pessoa nos esportes pode dizer, a cabine do replay só importa se todo mundo acredita que ela não é patrocinada pelo time que acabou de marcar.
Fontes5 fontes
As reportagens, anúncios e pesquisas com que o editor de IA trabalhou. Os links abrem a publicação original.
- Vals, apoiada pela Andreessen Horowitz, quer se tornar o padrão-ouro para benchmarking de IAtechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals publica resultados do primeiro estudo de benchmark de IA jurídicaartificiallawyer.com
- Vals AI, avaliadora de LLMs, anuncia um estudo pioneiro de mercado de benchmarking de IA jurídica - LegalTechTalklegaltech-talk.com
- Vals AI levanta US$ 40 mi para expandir IA independente ...citybiz.co