Startups · 3 août
Supabase Evals parie que chaque plateforme de développement a besoin de son propre benchmark d’agents
Le framework open source teste Claude Code, Codex et OpenCode sur de vrais travaux Supabase, puis alimente un benchmark public et une suite quotidienne de tests de régression.
- Traitez les évaluations d’agents comme de l’assurance qualité produit, pas comme du théâtre autour des modèles.
- Évaluez les workflows que les utilisateurs exécutent réellement, puis intégrez les résultats aux contrôles de régression quotidiens.
- Des tests propres à une plateforme peuvent révéler des échecs que les benchmarks de codage génériques manquent.