Startups · 3 ago
Supabase Evals es una apuesta a que toda plataforma para desarrolladores necesita su propio benchmark de agentes
El marco de código abierto prueba Claude Code, Codex y OpenCode en trabajo real de Supabase, y luego alimenta un benchmark público y un conjunto diario de pruebas de regresión.
- Trata las evaluaciones de agentes como control de calidad del producto, no como teatro de modelos.
- Evalúa los flujos de trabajo que los usuarios realmente ejecutan y luego integra los resultados en comprobaciones diarias de regresión.
- Las pruebas específicas de una plataforma pueden revelar fallos que los benchmarks genéricos de programación pasan por alto.