Startups · 3. Aug.
Supabase Evals ist eine Wette darauf, dass jede Entwicklerplattform ihren eigenen Agenten-Benchmark braucht
Das Open-Source-Framework testet Claude Code, Codex und OpenCode an echter Supabase-Arbeit und speist die Ergebnisse dann in einen öffentlichen Benchmark und eine tägliche Regressionssuite ein.
- Behandle Agenten-Evals als Produkt-QA, nicht als Modelltheater.
- Benchmarke die Workflows, die Nutzer tatsächlich ausführen, und integriere die Ergebnisse anschließend in tägliche Regressionsprüfungen.
- Plattformspezifische Tests können Fehler aufdecken, die generische Coding-Benchmarks übersehen.