Dalam pengujian berbasis peneliti, Anthropic menemukan GLM-5.3 mampu menemukan sejumlah kerentanan yang sebelumnya tidak diketahui pada mesin JavaScript sebuah browser populer. Model tersebut kemudian merangkai kerentanan itu menjadi eksploitasi yang dapat membaca file secara sewenang-wenang dari komputer pengguna.
Anthropic mengatakan kerentanan tersebut telah dilaporkan kepada pengelola terkait. Peneliti juga menemukan kerentanan yang dapat dieksploitasi pada sejumlah sistem lain, termasuk driver nirkabel dan grafis serta perangkat lunak untuk perangkat yang terhubung ke jaringan. “Saat ini kami tengah meninjau laporan-laporan ini dan kami akan mengungkapkannya kepada pengelola sebagaimana mestinya,” tulis laporan tersebut.
Dalam pengujian lain, GLM-5.3-Flash, versi yang lebih kecil, berhasil mengembangkan eksploitasi terhadap kerentanan Google Chrome CVE-2026-11645. Model tersebut merangkai dua kelemahan menjadi eksploitasi untuk target ARM64 dan melewati perlindungan autentikasi pointer (PAC).
Eksperimen itu membutuhkan sekitar 20 menit perhatian manusia dan delapan jam pekerjaan model. Berdasarkan harga API Zhipu, Anthropic memperkirakan biaya eksperimen sekitar US$20,40.
Perlindungan GLM-5.3 Mudah Dilewati
Anthropic menemukan perlindungan bawaan GLM-5.3 dapat dilewati menggunakan sejumlah teknik sederhana. Salah satunya adalah abliterasi, yang memungkinkan pengguna memodifikasi model dengan bobot terbuka untuk mengurangi kecenderungannya menolak permintaan berbahaya.
Anthropic membuat versi GLM-5.3 yang telah dimodifikasi dan mengujinya menggunakan JailbreakBench, HarmBench, serta StrongREJECT. Tingkat penolakan model turun dari lebih dari 90% menjadi sekitar 3% hingga 12%, tergantung tolok ukur yang digunakan.
Anthropic juga menemukan kemampuan umum model tetap terjaga setelah modifikasi. Dalam evaluasi GPQA-Diamond, misalnya, versi standar dan versi yang telah dimodifikasi mencatat hasil yang sama.
Perlindungan GLM-5.3 juga dapat dilewati tanpa memodifikasi bobot model. Dalam simulasi Anthropic, model awalnya menolak seluruh permintaan berbahaya yang diberikan secara langsung. Namun, saat diberikan skenario acak dan sesatk. yang seolah-olah menempatkan model sebagai agen red-team otonom, GLM-5.3 menanggapi permintaan tersebut dalam 64% percobaan.
Angka tersebut meningkat menjadi 92% ketika proses penalaran model diisi terlebih dahulu dan mencapai 100% pada versi model yang telah dimodifikasi. Anthropic mengatakan teknik tersebut tidak berhasil membuat model Claude yang diuji menjalankan tugas berbahaya dalam pengujian mereka.
“Dalam pengujian kami, tidak satu pun dari teknik ini yang dilindungi model Claude untuk melakukan tugas-tugas berbahaya yang kami uji. Perlindungan Claude memblokir permintaan yang menggunakan petunjuk yang menipu,” tulis laporan tersebut.
Anthropic: Kemampuan Siber Perlu Diamankan
Anthropic menilai kemampuan GLM-5.3 dapat memberikan aktor siber akses untuk menemukan dan mengeksploitasi kerentanan tanpa pembatasan berarti.
Pada 17 September, Center for AI Standards and Innovation (CAISI) di National Institute of Standards and Technology (NIST) juga menerbitkan penilaian terhadap kemampuan siber GLM-5.3.
CAISI menyebut GLM-5.3 sebagai model berbobot terbuka dengan kemampuan siber paling tinggi yang dirilis hingga saat itu. Anthropic mengatakan hasil pengujiannya secara umum sejalan dengan temuan CAISI, meski terdapat perbedaan dalam kondisi pengujian.
Model-model AS dalam perbandingan CAISI diuji dengan perlindungan siber yang dinonaktifkan jika berlaku. Sejumlah model tersebut juga hanya tersedia bagi pengguna yang telah diperiksa. Sementara itu, GLM-5.3 dapat diunduh secara bebas.
Anthropic menyebut kemampuan tersebut tidak hanya berpotensi digunakan oleh penyerang, tetapi juga dapat dimanfaatkan pembela siber untuk mengidentifikasi dan memperbaiki kerentanan. Perusahaan mengatakan pembela siber perlu memiliki akses terhadap model dengan kemampuan yang setidaknya sebanding dengan alat yang digunakan penyerang.
Anthropic juga mendorong pemerintah melakukan pengujian keamanan terhadap model AI dengan kemampuan siber tinggi, termasuk penerus GLM-5.3.
(mef/wep)
































