
Dalam artikel ini (5)
Evaluasi Berkelanjutan: Sistem Operasi Agen Coding
Poin utama
- Bangun rangkaian eval lokal kecil sebelum memberi agen akses repositori yang luas.
- Stratifikasikan eval berdasarkan jenis tugas, karena dokumentasi dan pekerjaan fitur dapat menunjukkan performa yang sangat berbeda.
- Gunakan kegagalan produksi untuk memperluas cakupan eval, tetapi audit pengujian yang tidak stabil sebelum memercayai sinyalnya.
Mengapa penting
- ProdukProduct leaders can ship agent features more safely by requiring eval evidence before broad rollout.
- InvestorInvestors should look for teams with measurable agent quality, not just impressive coding demos.
Sebelum tim membiarkan agen menjelajahi seluruh repo, mereka membutuhkan pengujian kecil yang dapat diulang untuk menangkap regresi sebelum terjadi di produksi.
Tawar-menawar lama dengan asisten coding itu sederhana: ia menyarankan satu baris, kamu memicingkan mata, dan mungkin tidak ada yang terluka. Sekarang agen coding bisa memanggil alat, mengubah state, dan berjalan tersandung-sandung di dalam repositori seperti anak magang yang sangat percaya diri dengan akses root. Mengandalkan feeling bukan lagi strategi QA. Itu hanya lilin aromaterapi di dalam terowongan angin.
Kerangka yang berguna dari LetsLearnGenAI adalah bahwa eval sedang menjadi sistem operasi untuk coding berbantuan AI. Bukan lapisan aplikasi yang mengilap, bukan wallpaper papan peringkat, melainkan permukaan kendali yang memberi tahu tim apa yang berubah, apa yang rusak, dan apakah agen sebaiknya terus bekerja atau diberi kotak jus lalu diantar keluar dari pipeline build.
Anthropic Memberi Definisi Membosankan yang Kita Butuhkan
Anthropic mendefinisikan eval sebagai sebuah tes untuk sistem AI: berikan input, lalu terapkan logika penilaian pada output untuk mengukur keberhasilan. Dalam posting engineering tanggal 09 Jan 2026, Anthropic mengatakan evaluasi yang baik membantu tim merilis agen dengan lebih percaya diri dengan membuat kegagalan dan perubahan perilaku terlihat sebelum sampai ke pengguna. Perusahaan itu juga menunjukkan mengapa agen lebih sulit diukur daripada chatbot: mereka beroperasi dalam banyak giliran, memanggil alat, mengubah state, dan beradaptasi berdasarkan hasil antara.
@title Struktur evaluasi
@source Demystifying evals for AI agents
Input
│
▼
AI system
│
▼
Output
│
▼
Grading logic
│
▼
Success measure
@caption Anthropic menggambarkan eval sebagai input, output, logika penilaian, dan pengukuran keberhasilan.
Definisi itu terdengar hampir terlalu polos sampai terasa menyebalkan, dan justru karena itu ia penting. Agen repositori tidak sekadar memprediksi token berikutnya, mereka mengambil tindakan di dalam lingkungan yang penuh tes rapuh, dependensi menyeramkan, dan satu file bernama final_final_really.py. Jika kamu tidak bisa memutar ulang sebuah tugas dan menilai hasilnya secara konsisten, kamu bukan sedang mengadopsi agen. Kamu sedang memanggilnya seperti makhluk gaib.
Jenis Tugas Adalah Variabel yang Diam-Diam Licik
Sebuah studi arXiv yang distratifikasi berdasarkan tugas membandingkan OpenAI Codex, GitHub Copilot, Devin, Cursor, dan Claude Code pada 7.156 pull request dari dataset AIDev. Makalah tersebut menemukan bahwa jenis tugas memiliki pengaruh besar: tugas dokumentasi mencapai tingkat penerimaan 82,1%, sementara fitur baru mencapai 66,1%, selisih 16 poin persentase yang melampaui variasi antargen yang umum untuk sebagian besar tugas. Studi itu juga melaporkan bahwa Devin menunjukkan satu-satunya tren positif yang konsisten dalam tingkat penerimaan, yaitu 0,77% per minggu selama 32 minggu, sementara agen lainnya sebagian besar stabil.
Inilah bagian yang sebaiknya ditato tim di sisi dalam dashboard CI mereka. Memilih agen coding berdasarkan skor benchmark rata-rata itu seperti memilih restoran berdasarkan jumlah garpu di laci. Suite eval lokalmu harus membagi tugas berdasarkan pekerjaan yang benar-benar kamu lakukan: dokumentasi, perbaikan bug, refactor, migrasi, tes, dan fitur baru. Kalau tidak, agen yang terlihat cemerlang pada pekerjaan maintenance mudah bisa diam-diam memakan arsitekturmu seperti rakun di ruang server.
Eval Produksi Membutuhkan Tugas yang Berbentuk Seperti Produksi
Makalah REAP berargumen bahwa penerapan agen coding AI di produksi membutuhkan sinyal evaluasi yang cepat dan dapat direproduksi. Makalah itu mengatakan bahwa pengujian A/B online bisa memakan waktu berminggu-minggu dan berisiko terhadap pengalaman pengguna, shadow deployment tidak menghasilkan sinyal yang dapat direproduksi di berbagai run, dan benchmark publik bisa menyimpang dari beban kerja nyata dalam distribusi bahasa, gaya prompt, dan struktur codebase. REAP mengusulkan kurasi otomatis benchmark yang diturunkan dari produksi berdasarkan sesi nyata developer-agen tanpa pelabelan manual.
Ini adalah jembatan dari eval riset menuju disiplin operasional. Eval tim yang berguna bukan museum berisi soal teka-teki, melainkan suite regresi hidup yang dibangun dari kekacauan yang memang dihasilkan codebase-mu. Makalah REAP juga menandai ranjau praktis: prompt yang tidak bisa dites, tes yang tidak selaras, dan tes flaky dapat merusak keandalan. Terjemahannya: jika eval-mu tidak bisa membedakan agen yang buruk dari tes yang buruk, selamat, kamu baru saja membuat mesin kabut dengan YAML.
Benchmark Itu Perlu, tetapi Tidak Cukup
ProjDevBench menekan kelemahan yang berbeda: pengembangan proyek end-to-end. Menurut abstrak arXiv-nya, benchmark ini memberikan kebutuhan proyek kepada agen coding dan mengevaluasi repositori yang dihasilkan menggunakan pengujian Online Judge plus code review berbantuan LLM. Benchmark ini mencakup 20 masalah pemrograman di 8 kategori, mengevaluasi enam agen coding, dan melaporkan tingkat penerimaan keseluruhan sebesar 27,38%.
Tingkat penerimaan yang rendah itu bukan alasan untuk panik, melainkan alasan untuk menentukan cakupan secara bertanggung jawab. Makalah tersebut mengatakan agen mampu menangani fungsionalitas dasar dan struktur data, tetapi kesulitan dengan desain sistem yang kompleks, optimisasi kompleksitas waktu, dan manajemen sumber daya. Bagi pembangun, langkah praktisnya jelas: mulai dari tugas sempit dengan sinyal tinggi yang kebenarannya bisa diperiksa, lalu perluas hanya ketika eval-mu menunjukkan agen tersebut membaik. Otonomi tanpa pengukuran hanyalah autocomplete yang memakai jas hujan panjang.
Pertahankan Manusia dalam Loop, Idealnya dalam Keadaan Terjaga
Makalah Agents That Teach menambahkan mode kegagalan yang lebih lembut tetapi penting: pembelajaran developer. Makalah itu berargumen bahwa ketika developer mendelegasikan tugas coding yang besar kepada agen otonom, pembelajaran insidental dapat terpotong, menciptakan apa yang disebut penulis sebagai Knowledge Debt. Makalah tersebut mengusulkan enam prinsip desain dan memperkenalkan SHIELD, sistem multi-agen yang dimaksudkan untuk memunculkan pembelajaran kontekstual di luar alur utama dari penalaran agen coding itu sendiri.
Ini penting karena eval seharusnya mengukur lebih dari sekadar apakah tes berwarna hijau. Tim juga perlu bertanya apakah developer dapat menjelaskan perubahan tersebut, memeliharanya, dan menyadari ketika agen dengan percaya diri menciptakan katedral kecil berisi omong kosong. Langkah praktis berikutnya bukan membangun kerajaan eval raksasa. Bangun suite lokal kecil, jalankan pada tugas nyata, stratifikasi berdasarkan jenis tugas, lacak regresi, dan terus tambahkan kasus dari kegagalan di produksi.
Jika agen akan mengemudi, eval adalah setirnya, bukan dadu berbulu yang digantung di kaca depan.
Sumber5 sumber
Laporan, pengumuman, dan riset yang menjadi bahan kerja editor AI. Tautan membuka publikasi aslinya.
- Demystifying evals for AI agentsanthropic.com
- Comparing AI Coding Agents: A Task-Stratified Analysis of ...arxiv.org
- REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usagearxiv.org
- ProjDevBench: Benchmarking AI Coding Agents on End-to ...arxiv.org
- Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Developmentarxiv.org