
Dalam artikel ini (4)
Pengujian AI Anthropic: Analisis Containment
Poin utama
- Jangan perlakukan laporan evaluasi sebagai bukti penahanan. Mintalah batasan, izin, log, dan prosedur penghentian.
- Pisahkan fakta yang terverifikasi dari klaim viral sebelum membuat keputusan kepatuhan atau pengadaan.
- Pengujian AI agentik harus menggunakan target yang diotorisasi, kredensial yang dibatasi ruang lingkupnya, dan jejak audit sebelum alat menyentuh sistem nyata.
Pelajaran berguna dari perselisihan keamanan Anthropic bersifat operasional: evaluasi agen membutuhkan batasan yang tegas, log, dan kontrol penghentian.
Pelajaran berguna dari perselisihan keamanan Anthropic bersifat operasional: evaluasi agen membutuhkan batasan tegas, log, dan kontrol penghentian.
Bagan keamanan yang paling rapi bukanlah firewall. Begitu agen AI memiliki alat, kredensial, file, atau akses jaringan, evaluasi berhenti menjadi kuis dan mulai menyerupai operasi. Di situlah perselisihan Anthropic berguna, asalkan kita tidak berpura-pura bahwa catatan publik membuktikan lebih dari yang sebenarnya. Sebagian komentar seputar Anthropic telah melampaui bukti yang tersedia. Materi yang dapat dikutip dalam ringkasan ini mendukung kekhawatiran tentang arsitektur, pengungkapan, klaim keselamatan, dan respons pemerintah. Materi itu tidak membuktikan bahwa sebuah model menyebabkan penyusupan dunia nyata ke tiga organisasi. Kerja kebijakan dimulai dari sana, dengan disiplin yang membosankan: memisahkan berkas insiden dari obrolan grup.
Antiy Labs menunjukkan mengapa perimeter adalah produknya
Antiy Labs mengatakan laporannya dipicu oleh rumor dari pengguna Reddit LegitMichel777 bahwa Claude Code berisi spyware, lalu memeriksa interaksi klien Anthropic dan layanan model, perilaku lokal, serta perbandingan protokol privasi di Web, Mobile, Desktop, dan Code. Itu adalah lapisan yang tepat untuk diperiksa, karena risiko agenik biasanya berada di antara komponen, bukan di dalam satu prompt saja. Model tanpa akses alat adalah generator teks; model dengan alat yang dibatasi adalah sistem alur kerja; model dengan alat yang luas adalah kontraktor yang tanda pengenalnya tidak pernah kedaluwarsa.
Antiy Labs juga mengatakan pekerjaannya mengintegrasikan analisis sampel klien Claude Code dan analisis file biner Antiy CERT terkait rumor backdoor Claude Desktop. Pelajaran praktisnya bukan bahwa setiap rumor menjadi laporan pelanggaran. Pelajarannya adalah bahwa peninjau eksternal akan menguji saluran dan komponennya, dan bahasa keselamatan yang samar tidak akan menggantikan batas jaringan, pembatasan kredensial, serta inventaris alat yang dapat dipanggil oleh model.
AI Safety Claims membuat kesenjangan pengungkapan terlihat
AI Safety Claims mencatat bahwa Claude 4 dirilis pada 22 Mei 2025, dengan laporan evaluasi dan laporan pengamanan yang diterbitkan pada hari yang sama. Sumber itu juga mencatat bahwa Claude Opus 4.1 dirilis pada 5 Agustus, dengan adendum kartu sistem yang diterbitkan pada 5 Agustus. Sumber yang sama mengatakan tanggal pelatihan dan penerapan internal tidak dilaporkan, sebuah kalimat kecil dengan bayangan kepatuhan yang besar.
Garis waktu itu memisahkan publikasi dari pembatasan. Laporan evaluasi dapat memberi tahu pembeli apa yang diukur perusahaan, tetapi laporan itu sendiri tidak membuktikan bagaimana pengujian diisolasi, siapa yang mengotorisasi target, alat mana yang diaktifkan, atau seberapa cepat suatu proses dapat dihentikan. Transparansi bergaya Pasal 52, meminjam kebiasaan UE mengubah fakta produk menjadi kewajiban pengungkapan, bukanlah gelang jimat. Transparansi menjadi berguna ketika kontrak mewajibkan daftar alat, log audit, pemberitahuan insiden, batas retensi data, dan otorisasi tertulis untuk lingkungan apa pun yang dapat disentuh agen.
Skor tolok ukur bukanlah kontrol
AI Safety Claims mengatakan Anthropic menggambarkan Sonnet 4 sebagai tidak memiliki kemampuan berbahaya, sementara kemampuan biologis Opus 4 mungkin berbahaya, dan mengatakan Anthropic menerapkan standar ASL 3 untuk pengamanan keamanan dan penerapan bagi model tersebut. Analisis yang sama memuji evaluasinya, tetapi mengangkat kekhawatiran tentang cara Anthropic menafsirkan hasilnya, termasuk ambang batas mana yang benar-benar menjadi penopang keputusan.
Frasa itu penting. Jika sebuah ambang batas tidak mengubah penerapan, akses, atau pembatasan, maka itu adalah metrik, bukan kontrol. Bagi pembangun, kewajiban sederhananya adalah merancang evaluasi sebagai operasi yang dibatasi. Tempatkan agen dalam sandbox tanpa akses keluar bawaan. Gunakan target sintetis atau yang secara eksplisit diotorisasi. Batasi kredensial sesuai pengujian. Siapkan tombol penghenti yang benar-benar mencabut alat, bukan yang sekadar meminta model berperilaku baik. Simpan log yang menunjukkan prompt, panggilan alat, izin, upaya jaringan, dan persetujuan manusia. Jika ini terdengar seperti rekayasa keamanan, bukan etika AI, bagus. Memang seharusnya begitu.
Regulator akan meminta catatan, bukan perasaan
Forbes melaporkan bahwa Federal Trade Commission mengirim dokumen 20 halaman kepada OpenAI yang meminta catatan terkait tantangan keselamatan AI. Itu bukan tindakan penegakan terhadap Anthropic, tetapi menunjukkan pola regulasi. Lembaga tidak perlu menyelesaikan masalah alignment untuk bertanya siapa mengetahui apa, kapan perusahaan mengetahuinya, pengujian apa yang dilakukan, dan apakah klaim pemasaran sesuai dengan file internal.
BBC kemudian melaporkan bahwa Anthropic menangguhkan Claude Fable 5 dan Mythos 5 setelah otoritas AS mengangkat kekhawatiran keamanan, dan Reuters melaporkan bahwa Komisi Eropa sedang melihat konsekuensi praktis dari sebuah keputusan Anthropic. Fakta berbeda, naluri administratif yang sama: ketika sebuah model cukup kuat untuk menimbulkan pertanyaan keamanan, pemerintah mulai dari akses, dokumentasi, dan konsekuensi. Pembangun yang terjepit di antara yurisdiksi harus berasumsi bahwa jalur aman tersempit adalah bukti operasional, bukan unggahan blog yang mengatakan mereka menyambut pengawasan.
Jalur ke depan cukup biasa saja. Jika Anda membeli atau membangun AI agenik, jangan terlalu banyak bertanya tentang peringkat tolok ukur; tanyakan lebih banyak tentang bukti pembatasan. Evaluasi model frontier serius berikutnya seharusnya hadir dengan diagram batas, daftar otorisasi, izin alat, prosedur penghentian, dan jejak audit. Apa pun yang kurang dari itu adalah latihan kepercayaan yang memakai jas laboratorium.