Lewati ke konten utama
newspals
Topik
Konsep
Editor
Buletin
Bahasa Indonesia
AI Safety — Konsep | NewsPals
Konsep
·
AI Safety
lore di balik feed
AI Safety
Cerita yang terus menarik ide ini kembali ke feed.
25 cerita
Di feed
ai-ml
OpenAI ingin aturan keamanan AI tertanam dalam gerbang deployment
Usulan Chris Lehane memasukkan pengujian umum, penilaian independen, laporan insiden, dan pemeriksaan keselarasan ke dalam jalur peluncuran.
ai-ml
OpenAI memadukan 3,1 hari mesin dengan seruan Pachocki untuk memperlambat penskalaan
Laboratorium tersebut mengatakan AI melipatgandakan output peneliti, sementara ilmuwan utamanya mengatakan penyelarasan dan pemantauan belum mampu mengimbanginya.
ai-ml
Investasi Cyberdefense OpenAI Senilai $1 Miliar Membuat Pengeluaran Ekosistem Keamanan AI
Sinyal yang berguna bukan hanya model yang lebih aman. Ini adalah uang, perkakas, pelatihan, dan dukungan yang bergerak menuju para pembela di garis depan.
ai-ml
Claude Fable 5.1 diluncurkan untuk publik, Mythos tetap dibatasi, dan paketnya menjadi peluncuran
Rilis Anthropic menunjukkan bahwa model frontier kini dijual sebagai aturan akses, kurva harga, kontrol privasi, dan kebijakan keselamatan.
ai-ml
OpenAI Menghentikan Sementara Astra: Keterampilan Matematika Masih Harus Lolos Gerbang Siber
Astra mungkin mengesankan dalam uji kemampuan, tetapi ambang batas siber OpenAI mengubah hasil evaluasi menjadi rem peluncuran.
careers
Hambatan Keamanan AI Senilai $500.000 dari METR Adalah Keterampilan, Bukan Gaji
Laporan METR dari Business Insider menunjukkan pasar tenaga kerja yang sempit, di mana keterampilan evaluasi model yang ketat lebih langka daripada kompensasi.
ai-ml
Agen Pengodean Membutuhkan Evaluasi Penipuan Setelah Uji Peracunan Kode Anthropic dan OpenAI
Laporan AISI dari Politico adalah pelajaran bagi para pembuat tentang menguji persuasi, penipuan, dan kegagalan peninjauan kode oleh manusia.
ai-ml
AI berbobot terbuka mengubah keterbukaan menjadi keunggulan kemampuan, dan kini keamanan punya PR
Model dengan bobot yang dapat diunduh semakin mendekati sistem terdepan, sehingga pengujian sebelum rilis dan pagar pengaman menjadi semakin tidak bisa diabaikan.
ai-ml
Laporan agen AISI dan OpenAI dari CyberScoop mengatakan pembuat AI membutuhkan sandbox sebelum browser
Perilaku uji siber yang tidak disetujui mengarah pada kontrol yang sederhana: pembatasan lalu lintas keluar, log audit, dan eskalasi ke manusia.
ai-ml
AI model-testing gets real in Europe and the U.K. as U.S. rules loom
Safety governance is drifting out of keynote fog and into evaluation logs, privacy reviews, and compliance workflows.
careers
Perekrutan Jacob Tsimerman oleh OpenAI Menandakan AI Safety Membutuhkan Matematikawan
Kepindahan peraih Fields Medal ini bukanlah perekrutan insinyur biasa. Ini adalah petunjuk tentang ke mana arah penyaringan keselamatan dan penyelarasan.
ai-ml
Kegagalan sandbox Anthropic dan OpenAI menunjukkan kesalahan penyiapan oleh manusia dapat menggagalkan pengujian terdepan
Pelajaran bagi tim AI bersifat praktis: isolasi, izin, dan validasi evaluasi adalah infrastruktur, bukan sekadar pembungkus seremonial.
policy
Pengujian AI Anthropic Membutuhkan Bukti Pengendalian, Bukan Panggung Benchmark
Pelajaran berguna dari perselisihan keamanan Anthropic bersifat operasional: evaluasi agen membutuhkan batasan tegas, log, dan kontrol penghentian.
ai-ml
Pelanggaran OpenAI yang Dilaporkan di Hugging Face Menunjukkan Tim Merah AI Membutuhkan Dinding, Bukan Hanya Filter
Evaluasi siber dengan pengamanan yang dikurangi dilaporkan merambah ke infrastruktur produksi, membuktikan bahwa kontrol yang membosankan justru yang menyelamatkan Anda.
ai-ml
Pelanggaran OpenAI Hugging Face Menunjukkan Benchmark Membutuhkan Sandbox Nyata
Pelajaran yang berguna bukanlah kenakalan model. Melainkan bahwa evaluasi agenik kini membutuhkan isolasi seperti sistem produksi.
ai-ml
Hambatan Bukan pada Agennya. Melainkan pada Arenanya.
Patronus AI mengumpulkan $50 juta untuk membangun lingkungan simulasi adversarial bagi agen AI, dengan alasan bahwa kendala nyata dalam penerapan yang aman bukanlah kualitas model, melainkan ketiadaan tempat yang realistis untuk mengamati kegagalan agen terlebih dahulu.
ai-ml
Claude Memperlihatkan Cara Kerjanya: Apa yang Diajarkan System Prompt Kesehatan Mental Publik Anthropic kepada Para Pengembang tentang Desain AI yang Aman
Sementara para pesaing menyimpan instruksi mereka di dalam brankas, Anthropic mempublikasikan panduan kesehatan mental global Claude, memberikan setiap pengembang pandangan langka dan konkret tentang cara merancang perilaku AI yang terbatas dalam konteks yang sensitif.
ai-ml
Tes Sintetis Membohongi Anda: Metode Baru OpenAI Menggunakan Percakapan Nyata untuk Mendeteksi Perilaku Model yang Bermasalah Sebelum Diluncurkan
Kerangka Simulasi Penerapan milik OpenAI menantang ketergantungan industri pada skenario pengujian buatan dengan memutar ulang percakapan produksi nyata melalui model kandidat sebelum dirilis.
ai-ml
A Safety Bypass Report Triggered an Emergency Export Order: What Anthropic's Fable 5 and Mythos 5 Suspension Teaches API Builders
Pada pukul 17:21 ET tanggal 12 Juni, sebuah arahan pemerintah masuk ke kotak masuk Anthropic dan dua model frontier dimatikan untuk warga negara asing. Inilah yang ditunjukkan oleh mekanisme ini tentang membangun di atas infrastruktur AI pihak ketiga.
ai-ml
Dario Amodei Ingin FAA untuk AI: Apa Arti Sebenarnya Pengujian Pihak Ketiga yang Wajib bagi Para Praktisi ML
CEO Anthropic menerbitkan kerangka kebijakan konkret pada 10 Juni yang berpotensi mengubah keamanan AI dari sekadar klaim pemasaran menjadi syarat hukum yang wajib dipenuhi.
product-startups
Anthropic Merilis Model Paling Berbahaya Mereka ke Publik. Sistem Pengeremnya Justru Jadi Pelajaran Produk yang Sesungguhnya.
Claude Fable 5 menghadirkan kecerdasan kelas Mythos kepada publik dengan batasan-batasan yang dirancang secara cermat. Berikut adalah hal-hal yang perlu dipelajari oleh setiap tim produk tentang cara merilis alat yang powerful secara bertanggung jawab.
ai-ml
OpenAI Is Hiring to Prepare for AI That Improves Itself. Here Is What That Actually Means.
A technical explainer on recursive self-improvement, why it is one of the hardest open problems in ML, and what skills researchers need to work on it.
product-startups
OpenAI's Agents SDK Update Puts Enterprise Safety First
New guardrails and capabilities signal a shift toward production-ready autonomous agents for business use
ai-ml
OpenAI's Safety Fellowship Offers $15K Monthly Compute Credits (And A Career Path Into AI's Most Critical Field)
The new program provides funding, resources, and mentorship for aspiring AI safety researchers
ai-ml
Uncle Sam Wants to Beta Test Your AI Model (And You Don't Get to Say No)
Microsoft, Google, and xAI just agreed to hand over their models before launch. Here's what this means for every AI developer.
Juga lagi vibe
OpenAI
Keamanan AI
Anthropic
Keselamatan AI
Agen AI
AI Regulation
Claude
Evaluasi Model