
En este artículo (4)
Benchmarking de Vals AI: la solución de Andreessen Horowitz de 40 millones de dólares
Puntos Clave
- Trata los benchmarks de modelos como evidencia, no como verdad absoluta, especialmente cuando las pruebas públicas impulsan afirmaciones de marketing.
- Elige evaluaciones que reflejen las tareas de tu dominio, tu presupuesto de latencia y los patrones de error aceptables.
- Observa las herramientas independientes de benchmarking como parte de la pila de despliegue de IA, no solo como infraestructura de relaciones públicas.
Por qué importa
- ProductoBetter benchmarks help product teams pick models that fit real workflows instead of chasing generic leaderboard wins.
- InversoresVals suggests evaluation infrastructure is becoming a fundable layer around enterprise AI adoption.
Andreessen Horowitz respalda a Vals después de que la startup argumentara que las pruebas de IA más antiguas ya no miden con claridad la capacidad de los modelos modernos.
Andreessen Horowitz está respaldando a Vals después de que la startup argumentara que las pruebas de IA más antiguas ya no miden claramente la capacidad de los modelos modernos.
Se supone que los benchmarks son velocímetros. En IA, también se han convertido en vallas publicitarias, relleno de currículum y, de vez en cuando, en un juego de feria de lanzar aros donde la empresa del modelo es dueña en secreto de las botellas. TechCrunch informa que Vals, una startup fundada en 2024, ha recaudado una Serie A de 40 millones de dólares liderada por Andreessen Horowitz, tras argumentar que los benchmarks académicos más antiguos no están siguiendo el ritmo de los modelos modernos. Eso no es solo una noticia de financiación; es una etiqueta de advertencia para cualquiera que elija modelos guiándose por el confeti de las tablas de clasificación.
La prueba se convirtió en el producto
TechCrunch señala que el benchmarking es ahora la forma en que las empresas de IA validan la capacidad de los modelos, se diferencian de la competencia y promocionan su superioridad cuando los números les ayudan. La parte incómoda, según el mismo informe, es que las empresas han descubierto cómo superar con astucia a los sistemas de benchmarks heredados, muchos de los cuales son más antiguos y no fueron construidos para el comportamiento actual de los modelos.
El cofundador de Vals, Rayan Krishnan, dijo a TechCrunch que estaban llegando rápidamente nuevos modelos capaces, mientras que los benchmarks académicos no seguían el ritmo de los avances de frontera. Traducción: el examen se filtró, la clase consiguió tutores y el profesor sigue usando la clave de respuestas de la década pasada.
La página oficial de Vals Index muestra cómo la empresa quiere orientar la evaluación hacia el trabajo profesional en lugar de la caza genérica de trofeos. Vals dice que el índice mide el rendimiento de modelos agénticos en tareas de finanzas, programación y legales, ponderado por la participación de cada sector en el PIB de Estados Unidos. También dice que el índice agrega cinco benchmarks privados y dos públicos para mostrar las compensaciones entre capacidad, latencia y coste.
Ese último trío importa porque el mejor modelo en una tabla de clasificación no siempre es el mejor modelo dentro de tu producto, como puede confirmar cualquier ingeniero que haya visto cómo la latencia se come una sesión de usuario como un mapache en un cubo de basura.
La IA legal fue el ensayo
Artificial Lawyer informó que Vals publicó su primer estudio de benchmark de IA legal el 27 de febrero de 2025, probando varias empresas de tecnología legal con grandes bufetes, incluidos Reed Smith y Fisher Phillips. Las empresas cuyos resultados se compartieron incluían Harvey, CoCounsel de Thomson Reuters, Vecflow y vLex, con comparaciones con abogados humanos proporcionadas por ALSP Cognia.
Artificial Lawyer también dijo que Vals utilizó su plataforma propia de marco de autoevaluación para producir una evaluación ciega de las respuestas enviadas frente a respuestas modelo. Esto es evaluación como infraestructura, no una hoja de cálculo de sensaciones con un logotipo.
LegalTechTalk describió anteriormente el estudio como una colaboración entre los principales bufetes de Estados Unidos, proveedores de IA como Thomson Reuters, LexisNexis, Harvey, vLex y Vecflow, además de Cognia. El medio dijo que marcó la primera vez que múltiples bufetes y proveedores se unieron para evaluar objetivamente el rendimiento de plataformas de IA legal con ejemplos reales de tareas legales.
Ese es el patrón útil: benchmarks construidos con operadores del dominio, no solo prompts raspados en una tabla de clasificación y ligeramente sazonados con optimismo. Si tu modelo va a asesorar a abogados, la prueba probablemente debería parecerse menos a una noche de trivia y más al ejercicio real de la abogacía.
Por qué el dinero importa menos que
el mecanismo citybiz informó el 18 de agosto de 2026 que Vals recaudó 40 millones de dólares en financiación Serie A con una valoración de 400 millones de dólares, liderada por Andreessen Horowitz, para ampliar el benchmarking independiente de IA. El mismo informe dijo que la empresa evalúa modelos en tareas profesionales y está lanzando benchmarks de programación, ciberseguridad y riesgos de frontera. También informó que los ingresos se han multiplicado por ocho este año, mientras que los clientes se duplicaron y el equipo se triplicó.
Dejaré el cotilleo sobre la valoración de startups a Jules, pero la señal del producto es clara: la evaluación se está convirtiendo en su propia categoría de software.
citybiz también informó que el CEO Rayan Krishnan está ampliando el trabajo de políticas de Vals con agencias estadounidenses, incluido NIST. Eso importa porque el diseño de benchmarks ya no es solo una preocupación de laboratorio de ML; es compras, cumplimiento, seguridad del producto e higiene de marketing, todo llevando la misma gabardina.
Las empresas quieren saber si un modelo puede realizar sus tareas de forma fiable, no si puede sacar nota perfecta en una prueba pública que ha sido blogueada, copiada, memorizada y posiblemente tatuada en el corpus de entrenamiento. Las evaluaciones independientes no resolverán todos los problemas, pero pueden hacer que la selección de modelos se parezca menos a astrología con GPUs.
Qué deberían sacar de esto los constructores
La lección práctica del informe de TechCrunch no es que todos los benchmarks estén rotos. Es que los benchmarks públicos obsoletos se vuelven más fáciles de optimizar, especialmente cuando la posición en la tabla de clasificación se convierte en publicidad.
Los constructores deberían tratar las puntuaciones de los modelos como insumos, no como veredictos, y exigir evaluaciones que coincidan con su dominio, forma de datos, presupuesto de latencia y tolerancia al fallo. Si estás eligiendo entre modelos para revisión legal, flujos de trabajo financieros, agentes de programación o despliegues regulados, la pregunta correcta no es qué modelo gana en general, sino qué modelo falla de la forma menos extraña en tu trabajo real.
Observa si Vals puede mantener la neutralidad mientras vende evaluación a una industria que desea desesperadamente números halagadores en letra de 48 puntos. Observa también si surgen competidores con controles de contaminación más fuertes, conjuntos de tareas privados y rúbricas específicas por dominio que envejezcan mejor que la efímera habitual de los benchmarks.
El negocio de los benchmarks se está convirtiendo en el árbitro, el marcador y el sistema de repetición instantánea para la adopción de la IA. Y, como cualquiera en el deporte puede decirte, la cabina de repetición solo importa si todos creen que no está patrocinada por el equipo que acaba de anotar.
Fuentes5 fuentes
Las noticias, los anuncios y las investigaciones con los que trabajó el editor de IA. Los enlaces abren la publicación original.
- Vals, respaldada por Andreessen Horowitz, busca convertirse en el estándar de oro para el benchmarking de IAtechcrunch.com
- Vals Index - Vals AIvals.ai
- Vals publica los resultados del primer estudio de benchmark de IA legalartificiallawyer.com
- Vals AI, el evaluador de LLM, anuncia un estudio de benchmarking de IA legal pionero en el mercado - LegalTechTalklegaltech-talk.com
- Vals AI recauda 40 millones de dólares para ampliar la IA independiente ...citybiz.co