
Dalam artikel ini (4)
Analisis Audit Kode LLM: Tanda Terima GlobaLeaks ISGroup
Poin utama
- Gunakan LLM untuk memperluas cakupan audit, tetapi hitung hanya temuan yang telah divalidasi sebagai hasil keamanan.
- Padukan peninjauan model dengan analisis statis, sandboxing, log, dan kasus uji yang dapat direproduksi.
- Audit juga runtime agen, terutama alat dengan akses shell, sistem berkas, peramban, atau kredensial.
Mengapa penting
- ProdukProduct leaders can use LLM audits to widen review coverage while keeping accountability with human security owners.
- InvestorInvestor diligence should favor audit tools with validation workflows, traceability, and runtime controls over raw alert volume.
Bagian yang paling heboh adalah skala token. Bagian yang berguna adalah memperlakukan model sebagai penguat audit, bukan hakim kecil berhoodie.
Tinjauan kode dengan satu miliar token terdengar mengesankan sampai kita ingat bahwa token tidak bisa dikompilasi, mereproduksi bug, atau membuat tiket perbaikan yang rapi. Token hanyalah konfeti dengan embedding vektor. Kisah ISGroup GlobaLeaks menarik justru karena bahan terpentingnya bukan gaya pamer model, melainkan validasi manusia. Jika audit berbantuan AI ingin menjadi praktik keamanan yang serius, satuan keberhasilannya tidak bisa berupa “model melihat baris yang menyeramkan.” Satuan itu harus berupa temuan terverifikasi yang bisa ditindaklanjuti oleh maintainer tanpa perlu memanggil arwah.
Masalah bukti
“Token Is All You Need” dari Ken Huang membingkai penemuan kerentanan berbantuan LLM baru-baru ini di sekitar keluarga Anthropic Claude dan OpenAI GPT, dengan mengatakan bahwa model-model ini telah menunjukkan kemampuan untuk mengidentifikasi kerentanan keamanan kode sumber yang lolos dari tinjauan ahli, fuzzing, dan analisis statis. Itu klaim yang pedas, tetapi juga tepat di titik ketika tim keamanan sebaiknya memakai topi membosankan. Topi membosankan menyelamatkan produksi, sementara topi menarik biasanya punya kode QR dompet kripto di atasnya.
Bagi pembaca yang mengevaluasi diskusi ISGroup GlobaLeaks, pelajarannya adalah kebersihan sumber terlebih dahulu. Jejak riset publik yang tersedia di sini mendukung pola yang lebih luas: LLM digunakan untuk memeriksa kode, menalar tentang kerentanan, dan memperbesar skala tinjauan repositori. Namun, jejak itu tidak memberikan setiap detail operasional yang diperlukan untuk memvalidasi secara independen angka-angka utama dari audit GlobaLeaks. Perbedaan itu penting karena “LLM menemukannya” bukan bukti, melainkan petunjuk.
Apa yang sebenarnya didukung oleh riset keamanan kode saat ini
Tinjauan literatur sistematis “Large Language Models and Code Security” menjelaskan tradeoff-nya dengan jelas: LLM dapat membantu mendeteksi dan memperbaiki kerentanan, tetapi juga dapat memperkenalkan kerentanan saat menghasilkan atau memodifikasi kode, melewatkan kerentanan yang jelas saat analisis, atau menandai masalah yang sebenarnya tidak nyata. Terjemahannya: model Anda adalah anak magang brilian yang kadang-kadang memberi label mesin kopi sebagai remote code execution. Berguna, ya. Otoritas otonom, sama sekali tidak.
Tinjauan itu juga menekankan bahwa strategi prompt memengaruhi performa deteksi dan perbaikan kerentanan, dan ini sangat berharga bagi pembangun sistem. Tim sebaiknya memperlakukan prompt, context window, retrieval, dan test harness sebagai bagian dari sistem audit, bukan bumbu dekoratif yang ditaburkan di atas kotak chat.
Makalah “CodeSpeak” dari ScienceDirect berada di jalur praktis yang sama dengan berfokus pada analisis kode berbantuan LLM untuk deteksi kerentanan smart contract, sebuah domain di mana “kemungkinan aman” secara historis sering diikuti oleh “lalu kasnya menguap.” Pelajaran praktisnya bukan bahwa LLM menggantikan static analyzer atau peninjau manusia. Pelajarannya adalah LLM dapat memperluas ruang pencarian, merangkum alur yang mencurigakan, dan menghasilkan hipotesis cukup cepat untuk membuat manusia lebih selektif. Nilai keamanannya muncul ketika keluaran model dipaksa melewati reproduksibilitas, analisis dampak, dan tinjauan patch.
Agen membuat skala menjadi berguna, sekaligus berisiko
Proyek GitHub RepoAudit menggambarkan dirinya sebagai agen LLM otonom untuk audit kode skala besar pada tingkat repositori. Kerangka ini penting karena audit tingkat repositori adalah tempat konteks menjadi tokoh utama. Cuplikan satu file adalah makan malam microwave dalam tinjauan keamanan: praktis, tetapi secara nutrisi mencurigakan. Bug nyata sering hidup di titik serah-terima antara parser, pemeriksaan izin, lapisan penyimpanan, dan satu fungsi pembantu menyedihkan yang terakhir disentuh saat migrasi.
Namun, alat audit berbasis agen juga memperluas hal yang dipercaya. Makalah arXiv “Local LLM Agents as Vulnerable Runtimes” mencatat bahwa agen LLM lokal dapat bertindak pada sumber daya host seperti shell, filesystem, browser, kredensial tersimpan, dan aplikasi perpesanan melalui tujuan berbasis bahasa alami. Makalah itu berargumen bahwa komponen implementasi seperti pembuat prompt, parser, dispatcher alat, pemuat skill, penulis memori, klien jaringan, dan gerbang izin membentuk batas keselamatan yang masih kurang diteliti. Dengan kata lain, auditor itu sendiri mungkin perlu diaudit, yang terasa sangat khas dunia perangkat lunak.
Bagi tim yang membangun dengan alat-alat ini, itu berarti sandboxing, least privilege, logging, dan replay deterministik bukan hiasan opsional. Semua itu adalah perbedaan antara asisten audit dan rakun dengan akses terminal. Skala hanya membantu jika Anda dapat melacak konteks apa yang masuk, klaim apa yang keluar, dan manusia mana yang menerima tanggung jawab atas temuan akhir.
Latar kebijakan mulai menyusul
Axios melaporkan bahwa Eropa dan Britania Raya sedang menyempurnakan pendekatan mereka terhadap pengujian model AI, sementara Amerika Serikat menghadapi tenggat aturannya sendiri. Pergerakan kebijakan itu penting untuk audit keamanan kode karena evaluasi tidak lagi sekadar piknik benchmark akademik. Jika model akan memengaruhi triase kerentanan, prioritas patch, atau bukti kepatuhan, organisasi akan membutuhkan pengujian dan dokumentasi yang dapat diulang.
Kabar baiknya, tim keamanan tidak perlu menunggu gulungan regulasi sempurna jatuh dari awan. Mulailah dengan memisahkan penemuan dari validasi, mencatat konteks dan keluaran model, memasangkan tinjauan LLM dengan analisis statis yang sudah ada, dan mengukur temuan yang terkonfirmasi alih-alih alert mentah. Percakapan ISGroup GlobaLeaks adalah suar yang berguna karena menunjukkan pola alur kerja: tinjauan model dengan konteks besar, triase agresif, dan manusia melakukan bagian ketika kenyataan diperiksa.
Perhatikan gelombang alat berikutnya untuk disiplin bukti, bukan hanya context window yang lebih besar. Para pemenang akan membuat klaim model mudah direproduksi, memetakannya ke jalur kode, dan menyerahkan perbaikan yang bisa dipercaya kepada maintainer. Token itu murah dibandingkan keahlian, tetapi keahlian tetap yang mengubah tumpukan autocomplete mencurigakan menjadi pekerjaan keamanan. Model bisa menemukan asap. Seseorang dengan lencana tetap harus memeriksa apakah itu api atau toaster yang sedang dramatis.
Sumber6 sumber
Laporan, pengumuman, dan riset yang menjadi bahan kerja editor AI. Tautan membuka publikasi aslinya.
- Token Is All You Need: Finding 0days with LLMs and Agentic AIkenhuangus.substack.com
- Large Language Models and Code Security: A Systematic Literature Reviewarxiv.org
- CodeSpeak: Improving smart contract vulnerability detection via LLM-assisted code analysissciencedirect.com
- GitHub - PurCL/RepoAudit: An autonomous LLM-agent for large-scale, repository-level code auditing · GitHubgithub.com
- Local LLM Agents as Vulnerable Runtimes: A Source-Code Audit of the Agent Runtime Layerarxiv.org