Technology

OpenAI Rilis GPT-Red, LLM Super Hacker untuk Uji Keamanan Model

OpenAI membangun GPT-Red, LLM super hacker yang digunakan untuk menguji dan memperkuat keamanan model-model AI mereka.

Oleh Tim Editorial

OpenAI Rilis GPT-Red, LLM Super Hacker untuk Uji Keamanan Model
wp.technologyreview.com

Menurut laporan eksklusif MIT Technology Review, OpenAI menggunakan GPT Red untuk mengotomatiskan proses red teaming, yaitu pengujian keamanan dengan mensimulasikan serangan dari pihak lawan. Perusahaan menyatakan bahwa pelatihan model andalan terbarunya, GPT 5.6, bersama GPT Red menjadikannya rilis paling tangguh yang pernah mereka buat. GPT 5.6 dirilis pada pekan lalu. OpenAI mengklaim bahwa integrasi GPT Red dalam siklus pengembangan telah secara signifikan meningkatkan ketahanan model terhadap berbagai vektor serangan siber. Langkah ini merupakan bagian dari upaya OpenAI untuk memproteksi masa depan prosedur keamanan mereka dan tetap selangkah lebih maju dari penyerang manusia. Poin yang perlu digarisbawahi adalah bahwa GPT Red bukanlah model yang dirilis untuk publik, melainkan alat internal yang dirancang khusus untuk menemukan celah keamanan sebelum model model komersial diluncurkan.

Pendekatan ini mencerminkan tren yang lebih luas di industri AI, di mana perusahaan semakin mengandalkan AI untuk menguji AI lainnya guna mempercepat dan memperdalam proses audit keamanan. Dari sisi industri, pengembangan GPT Red menunjukkan bahwa OpenAI serius dalam mengatasi risiko keamanan yang melekat pada model bahasa besar. Dengan kemampuan untuk secara otomatis menghasilkan serangan siber yang canggih, GPT Red dapat mengidentifikasi kerentanan yang mungkin terlewatkan oleh penguji manusia. Implikasi second order dari langkah ini adalah potensi standarisasi praktik red teaming otomatis di seluruh industri AI. Jika terbukti efektif, GPT Red dapat menjadi cetak biru bagi perusahaan AI lain untuk mengadopsi metodologi serupa, yang pada akhirnya dapat meningkatkan keamanan ekosistem AI secara keseluruhan. Hingga saat ini, OpenAI belum mengungkapkan detail teknis lebih lanjut mengenai arsitektur atau metode pelatihan GPT Red.

Namun, rilis GPT 5.6 yang diklaim sebagai model paling aman menjadi bukti awal efektivitas pendekatan ini.

Sumber dan referensi