Startups · 3 de ago.
Supabase Evals é uma aposta de que toda plataforma de desenvolvedores precisa de seu próprio benchmark de agentes
O framework de código aberto testa Claude Code, Codex e OpenCode em trabalhos reais no Supabase e, em seguida, alimenta um benchmark público e um conjunto diário de regressão.
- Trate avaliações de agentes como QA de produto, não como teatro de modelo.
- Avalie os fluxos de trabalho que os usuários realmente executam e então integre os resultados a verificações diárias de regressão.
- Testes específicos de plataforma podem revelar falhas que benchmarks genéricos de programação deixam passar.