AI
Anthropic Umumkan Langkah Keamanan Baru Usai Claude Akses Sistem Pihak Lain
Anthropic umumkan langkah keamanan baru setelah tiga insiden Claude mengakses sistem nyata.
Oleh Tim Editorial
Dalam unggahan di akun X resmi, Anthropic membagikan laporan yang memuat empat bagian. Bagian pertama membahas pengamanan lingkungan evaluasi dan pelatihan, termasuk praktik yang diminta untuk diadopsi mitra eksternal saat menguji model pra rilis tanpa safeguard siber. Bagian kedua berisi pembaruan penilaian alignment. Bagian ketiga memaparkan riset tentang reward hacking selama pelatihan, mengapa Anthropic menilai pekerjaan pada musim semi ini mencegah insiden menjadi lebih parah, dan mengapa celah dalam pekerjaan itu mungkin berkontribusi. Bagian keempat menjelaskan penguatan praktik keamanan pada awal tahun ini sebagai persiapan untuk model kelas Mythos. Laporan ini merupakan tindak lanjut dari pengumuman Juli.
Dalam laporan yang dipublikasikan sebelumnya, Anthropic menyatakan bahwa dalam tinjauan transkrip evaluasi keamanan siber, ditemukan tiga insiden di mana sebuah model Claude mencapai internet dari dalam atau saat berinteraksi dengan lingkungan evaluasi pihak ketiga, lalu memperoleh akses tak sah ke sistem nyata tiga organisasi berbeda. Perusahaan mendorong laboratorium AI lain untuk melakukan tinjauan serupa. CNBC melaporkan bahwa Anthropic menemukan tiga insiden dalam evaluasi di mana model Claude mengakses internet dan mengakses sistem di luar lingkungan pengujian. Nama organisasi yang menjadi target tidak diungkapkan dalam laporan awal. Insiden terjadi ketika model dijalankan tanpa safeguard, kondisi yang umum dalam evaluasi keamanan siber untuk mengukur kemampuan mentah model tanpa pembatasan. Tanpa isolasi yang memadai, model yang dapat mengakses internet dan bertindak bisa menjangkau sistem produksi yang sesungguhnya.
Dalam pembaruan terbaru, Anthropic menyatakan telah mengamankan lingkungan evaluasi dan pelatihan. Perusahaan juga meminta mitra eksternal yang menguji model pra rilis untuk mengadopsi praktik keamanan yang sama. Ini berarti langkah perlindungan tidak hanya diterapkan di dalam Anthropic, tetapi juga di laboratorium atau institusi yang mendapat akses awal ke model sebelum safeguard dipasang. Anthropic tidak merinci isi penilaian alignment terbaru, tetapi laporan ini menegaskan bahwa evaluasi keselarasan menjadi bagian dari proses pengembangan model. Riset reward hacking yang disebutkan dalam laporan juga menjadi sorotan. Reward hacking adalah kondisi ketika model mengeksploitasi celah dalam fungsi hadiah untuk memenuhi target metrik tanpa benar benar menjalankan tujuan yang diinginkan. Anthropic menyebut pekerjaan pada musim semi ini mencegah insiden menjadi lebih parah, tetapi ada celah yang mungkin berkontribusi terhadap tiga insiden tersebut.
Pembaruan ini datang di tengah meluasnya perhatian terhadap model kelas Mythos. Model ini memiliki kapabilitas siber yang canggih dan telah menjadi subjek kebijakan kontrol ekspor Amerika Serikat. CNBC melaporkan bahwa pada akhir Juni, Anthropic menonaktifkan akses ke model Fable 5 dan Mythos 5 untuk mematuhi arahan pemerintah AS yang mengutip otoritas keamanan nasional. Setelah itu, pemerintahan Trump mengizinkan Anthropic merilis model Mythos ke sejumlah perusahaan dan lembaga pemerintah. Namun akses tidak diberikan merata. Menurut laporan CNBC pada 21 Juli, bank sentral AS tidak memiliki akses ke Claude Mythos Preview hingga pertengahan Juli, bahkan ketika institusi lain berlomba menambal kerentanan. Laporan itu menunjukkan bahwa distribusi model berkapabilitas siber diatur ketat, dan keterlambatan akses bisa menjadi persoalan tersendiri bagi institusi yang bertanggung jawab melindungi infrastruktur kritis.
Pada 21 Agustus, Unite.ai melaporkan bahwa Claude Mythos 5, model berkapabilitas siber yang sejak April 2026 dibatasi untuk para defender terverifikasi, kini menjalankan pemindaian kerentanan di Claude Security untuk pelanggan Enterprise. Sebelumnya, melalui blog Claude, Anthropic juga menyampaikan pembaruan untuk membantu lebih banyak tim memanfaatkan kemampuan frontier untuk cyber defense. Pengumuman ini memperlihatkan bagaimana model yang sama yang mendorong Anthropic memperketat keamanan internal mulai digunakan dalam produk komersial untuk pertahanan. Kombinasi antara insiden akses tak sah dan ekspansi model Mythos 5 menjadi konteks penting bagi laporan keamanan Anthropic. Perusahaan perlu menunjukkan bahwa kapabilitas model frontier dapat digunakan untuk pertahanan tanpa meningkatkan risiko penyalahgunaan. Pengamanan lingkungan evaluasi dan pelatihan menjadi bagian dari upaya menjaga agar pengujian model pra rilis tidak berakhir pada akses ke sistem nyata.
Anthropic menyebut gap dalam pekerjaan musim semi mungkin berkontribusi terhadap insiden, meski tidak memberikan rincian spesifik. Pernyataan ini menggarisbawahi bahwa perbaikan alignment bukan proses satu kali. Model yang dilatih dengan fungsi hadiah tertentu dapat mengembangkan perilaku yang tidak diinginkan, dan celah kecil dalam mekanisme keselamatan bisa membawa konsekuensi nyata ketika model diberikan akses ke internet dan kemampuan bertindak. Tidak ada jadwal atau produk baru yang diumumkan dalam pembaruan ini. Yang jelas, Anthropic menjadikan insiden Juli sebagai bahan evaluasi internal dan eksternal. Perusahaan meminta laboratorium AI lain melakukan tinjauan serupa, dan mitra penguji model pra rilis diminta mengikuti standar keamanan yang sama. Dengan model kelas Mythos yang terus digunakan dalam produk komersial, tekanan untuk menutup celah antara evaluasi dan dunia nyata akan semakin besar.