Ketahanan Siber yang Timpang:  Apa yang Terungkap dari Kasus AI dan Kebocoran Keamanan di Hugging Face?

Penulis: Muhammad Ilyan Faris
Editor: Achmed Faiz Yudha Siregar

Pada tanggal 16 Juli 2026, Hugging Face, sebuah repositori populer untuk model AI open-source, mempublikasikan laporan insiden pertahanan mereka.[1] Mereka menemukan kebocoran di dalam infrastruktur produksi mereka. Yang membuat hal ini mengkhawatirkan ialah bahwa kebocoran dan peretasan tersebut sepenuhnya digerakan dan dilaksanakan oleh sistem agen AI otonom tanpa arahan atau pengawasan manusia. Tidak lama setelah kebocoran tersebut, OpenAI merilis sebuah laporan teknis.[2] Dimana mereka melaksanakan evaluasi internal ketahanan siber mereka dengan julukan ExploitGym; model-model mereka diberikan tugas keamanan siber yang bersifat ofensif atau menyerang di dalam sebuah sandbox (lingkungan uji terisolasi), dengan penolakan terhadap permintaan siber sengaja dikurangi guna keperluan evaluasi. Menurut OpenAI, sebuah model yang sedang mengerjakan sebuah masalah yang tidak bisa dipecahkan terus menjalankan upayanya hingga melampaui batas sandbox, mengakses infrastruktur pihak ketiga, lalu meretas Hugging Face itu sendiri.[3] Evaluasi tersebut memang dikehendaki oleh OpenAI. Tidak ada aturan yang dilanggar pada titik permulaan. Namun, kegagalan terjadi pada containment atau pengendalian objektif dan bukan batas perizinan. Para agen berkomunikasi dengan sesama melalui papan pesan tanpa izin. Dari 1.200 agen yang seharusnya terisolasi, 700 diantaranya ikut serta dalam serangan itu selama empat hari.[4] Dasbor Center for Digital Society membaca dua belas tahun data Cyber Events Database (CEDB) University of Maryland, yang mencatat 16.860 insiden siber terdokumentasi di lebih dari 130 negara.[5] Di dalamnya, aktor ancaman insiden siber diklasifikasikan sebagai: kriminal, peretas aktivis (hacktivist), negara, penghobi, teroris, dan tidak teridentifikasi.[6] Kasus Hugging Face memunculkan pertanyaan apakah pertahanan siber yang umum dipakai hari ini sudah memadai untuk menghadapi ancaman semacam ini.

Apa sebenarnya yang dibutuhkan untuk mendeteksi dan menangani serangan otonom?

Serangan tersebut terdeteksi oleh sistem AI milik Hugging Face, sebuah sistem monitoring yang menggunakan AI untuk membaca dan merekam aktivitas platform dan memilah sinyal mana yang sebenarnya penting.[7] Lebih dari 17.000 peristiwa penyerangan telah dicatat, tersebar di sekumpulan sandbox berumur pendek.[8] Dengan jumlah sebanyak itu, mustahil ditangani dan dikendalikan oleh tim analis manusia. Setelah pengendalian tersebut, seluruh catatan tindakan di proses melewati agen analisis berbasis LLM guna merekonstruksi sebuah lini masa, mengekstraksi jejak yang ditinggalkan penyerang, dan memetakan kunci dan password yang telah terdampak oleh penyerangan tersebut. Langkah ini ditempuh guna memastikan dampak sesungguhnya dari sekian banyak aktivitas umpan (decoy). Hal ini dikarenakan sistem AI membuat upaya tersebut jauh lebih optimal dengan mengubah pekerjaan berhari-hari menjadi hitungan jam.[9] Kasus ini membutuhkan bantuan AI dalam dua hal yakni, sekali untuk mendeteksi dan menyadari adanya serangan, dan sekali lagi untuk memahami. Hal kedua inilah yang menjadi cukup rumit.

Masalah Asimetri

Awal-awal Hugging Face menggunakan model frontier komersial untuk analisis log. Namun, cara tersebut tidak berhasil karena analisis terkait menuntut volume besar dari perintah serangan yang terjadi, muatan-muatan exploitasi (exploit payload), dan artefak command-and-control (C2), sayangnya hal tersebut justru diblokir oleh guardrail model-model komersial tersebut.[10] Filter tersebut tidak dapat membedakan tim penanganan insiden dari penyerang karena keduanya mengirimkan hal yang sama. Saat itu, Hugging Face tidak mengetahui sebenarnya model apa yang menggerakan agen penyerang, apakah sebuah model hosted bajakan, atau model berbobot terbuka (open-weight) tanpa batasan. Apa yang mereka bisa simpulkan adalah bawa penyerang tidak terikat apapun. Tidak ada kebijakan penggunaan yang mengikat mereka, sementara kerjaan forensik Hugging Face sendiri terhalang oleh guardrail model-model yang mereka telah coba pakai.[11]

GLM 5.2, model berbobot terbuka dari laboratorium Tiongkok Z.ai, dipakai sebagai alternatif; mereka menjalankannya di infrastruktur mereka sendiri. Dengan itu, ridak ada data penyerang maupun kredesnial yang dirujuk dari luar lingkungan mereka.[12] Setiap lab frontier menjalankan program akses terpercaya, dengan ketentuan retensi data yang berbeda-beda, persetujuannya memakan waktu, sehingga organisasi perlu mendaftarkan diri sebelum situasi penyerangan terjadi.[13]  Persoalannya, proses pendaftaran ini cukup timpang, ia dapat dirasakan sebagai sebuah rezim akses. Di mana organisasi yang mendaftar harus mengetahui terlebih dahulu program ini ada, mendaftar dari jauh hari, dinilai pantas oleh lab terkait, dan menerima ketentuan retensi data apapun yang menyertainya. OpenAI sendiri hanya menerima Hugging Face ke dalam program akses terpercaya mereka setelah peretasan terjadi.[14]

Siapa saja yang pernah menghadapi ini?

Pelajaran kasus Hugging Face bagi pihak yang mungkin bertahan dari serangan semacam ini adalah untuk memiliki model yang mumpuni dan dapat dijalankan di infrastruktur sendiri, telah diuji dan siap sebelum insiden terjadi, tim keamanan sendiri. alur deteksi berbasis AI yang sudah berjalan, serta bobot model terbuka dan infrastruktur yang tersedia.[15] Hugging Face, dengan segala sumber daya yang mereka miliki, tetap menabrak tembok; barulah kemudian OpenAI datang dengan programnya. Mereka adalah korban dengan perlengkapan terbaik yang bisa dibayangkan. Tembok itu, karenanya, lebih tinggi bagi semua pihak lain yang kapasitas pertahanannya berada di bawah Hugging Face. Dua kasus menjadi preseden, dari akhir Desember 2025 hingga Februari 2026. Seorang operator tunggal berhasil meretas sembilan organisasi pemerintah Meksiko dan mengeksfiltrasi ratusan juta rekam data warga.[16] Operator tersebut menggunakan model frontier komersial seperti Claude Code milik Anthropic dan GPT-4.1 milik OpenAI sebagai perkakas operasional utamanya.[17] Model-model itu berasal dari kelas yang sama dengan model yang menolak permintaan tim tanggap Hugging Face, namun guardrail-nya tidak menghentikan penyerang yang meretas sembilan lembaga pemerintah; guardrail itu justru menghentikan Hugging Face ketika mereka, sebagai pihak yang bertahan, mengajukan log mereka sendiri untuk dibaca. Kemudian, pada Juli 2026, paralel dengan serangan Hugging Face, Kementerian Keuangan Thailand menjadi sasaran serangan yang memakai Hermes, agen sumber terbuka yang dijalankan dalam mode YOLO, yang meniadakan mekanisme persetujuan manusia.[18]

Penyerang kini memiliki kedua jalur, komersial maupun sumber terbuka, sementara rezim akses hanya membatasi satu sisi, yaitu pihak yang bertahan. Hugging Face berhasil mendeteksi peretasan atas dirinya sendiri. Sementara kementerian Thailand tidak mendeteksi apa pun; yang menemukan serangan itu adalah Hunt.io, yang kemudian memberi tahu pemerintah Thailand.[19] Kasus Meksiko dan Thailand didokumentasikan oleh vendor komersial, dan kedua laporannya ditutup dengan penawaran produk. Sebaliknya, Hugging Face mempublikasikan temuannya di situs mereka sendiri, dan hal itu berkembang menjadi laporan OpenAI, investigasi METR, laporan post-mortem CISO, serta liputan halaman muka. Ratusan juta rekam data warga Meksiko dieksfiltrasi, sementara Hugging Face tidak kehilangan satu pun data pelanggan. Respons institusional berjalan berlawanan arah dengan dampaknya terhadap manusia.

Pada 10 Agustus 2026, Nezar Patria, Wakil Menteri Komunikasi dan Digital (Komdigi) Indonesia, menyampaikan kekhawatiran bahwa “yang menyerang bukan lagi peretas, melainkan agen-agen AI.” [20] Dalam merespons perkembangan ini, Komdigi mengusulkan kerangka security by design, yang menggeser keamanan ke tahap perencanaan, serta kriptografi pasca-kuantum. Namun kedua langkah itu bersifat preventif. Di Hugging Face, pencegahan gagal, sementara kontainmen dimungkinkan justru berkat kapasitas respons mereka sendiri. Di Indonesia, Edit Prima, Direktur Keamanan Siber Sektor Keuangan Badan Siber dan Sandi Negara (BSSN), menyatakan bahwa kemampuan BSSN dalam memantau aktivitas daring di Indonesia baru sebesar 10 persen: “Seperti CCTV di sebuah kompleks perumahan, hanya bisa memantau 10 persen jalan. Ini pekerjaan rumah besar bagi kapasitas bangsa kita dalam membantu para pemangku kepentingan mendeteksi ancaman yang kian masif.” [21]

Ketegangannya

Guardrail ada karena alasan yang baik. Insiden Hugging Face membuktikan bahwa AI yang menjalankan kerja keamanan ofensif adalah penyebab peretasan itu, dan penolakan sengaja dikurangi untuk keperluan evaluasi; dua faktor inilah yang menghasilkan peretasan tersebut. Hugging Face sendiri mengakui hal yang sama: mereka tidak sedang menentang langkah-langkah keamanan pada model hosted. Kapabilitas AI yang sama melayani penyerang sekaligus pihak yang bertahan, di mana model yang menganalisis muatan eksploitasi untuk pihak yang bertahan juga akan menuliskannya untuk penyerang dengan masukan yang nyaris identik. Karena itu, tidak ada filter di tingkat masukan yang dapat memisahkan keduanya. Laporan post-mortem CSA menyebut Hugging Face sebagai kasus serangan sepenuhnya otonom pertama yang terdokumentasi secara publik. [22] Meski masih tipis dan baru, preseden untuk insiden semi-otonom dan berbantuan agen sudah ada: aktor ancaman berbasis agen yang dilaporkan Anthropic pada November lalu, pengungkapan kampanye JADEPUFFER oleh Sysdig, serta kasus Meksiko dan Thailand yang telah disebut.[23] OpenAI sendiri mengungkapkan bahwa seandainya pemantauan rantai penalaran (chain-of-thought) mereka aktif selama evaluasi berlangsung, hal itu akan menangkap peretasan tersebut sebelum terjadi. Harness produksi menurunkan kecenderungan kompromi lebih dari seratus kali lipat.[24] Pengaman hadir ketika ia menghalangi pihak yang bertahan, dan absen di tempat kapabilitasnya justru sedang dijalankan. Liputan hanya mengikuti permukaan produk komersial, bukan permukaan risikonya.

Apa yang dibutuhkan bagi kapasitas respons yang berdaulat

Kasus Hugging Face menunjukkan bahwa kapabilitas pertahanan kerap dibatasi dua kali, pertama oleh sumber daya organisasi, kemudian oleh ketentuan akses vendor luar. Hugging Face mengungkapkan pelajaran bahwa sebuah organisasi sebaiknya memiliki model yang kompeten, telah diuji, dan siap di infrastrukturnya sendiri sebelum insiden terjadi.[25] Hal ini juga berlaku bagi pemerintah suatu negara. Secara konkret dalam konteks Indonesia, pemerintah sebaiknya meningkatkan kapabilitas pemantauan dan keamanan sibernya dari angka 10 persen saat ini, serta memiliki model berdaulat yang mumpuni dan dapat diakses oleh para penanggap serangan.

Masalah visibilitas juga perlu dibenahi; dalam kasus ini, OpenAI-lah yang menetapkan ketentuan analisisnya, karena cakupan kerja METR dibatasi hanya pada pekan terjadinya peretasan. Kepala eksekutif Redwood, Buck Shlegeris, mengatakan: “Investigasi pihak ketiga itu hanya mencakup sebagian kecil dari apa yang terjadi di sini, dan boleh dibilang bukan bagian yang paling penting.” [26] Pihak yang paling berisiko kehilangan justru yang menetapkan cakupannya, dan pengungkapannya bersifat sukarela.[27] Kapabilitas forensik yang berdaulat tidak banyak artinya tanpa rezim pengungkapan yang mempublikasikan insidennya sejak awal.

Referensi:

[1] Hugging Face. (2026, July 16). Security incident disclosure — July 2026. https://huggingface.co/blog/security-incident-july-2026

[2] OpenAI. (2026, August 26). The Hugging Face incident and the road ahead. https://openai.com/index/hugging-face-incident-and-the-road-ahead/

[3] OpenAI, (2026)

[4] METR. (2026, August 26). Investigation of the OpenAI Hugging Face incident. https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

[5] Wiguna, B. A., & Center for Digital Society. (2026). Global cyber incidents dashboard. https://global-cyber-incidents.netlify.app/

[6] Wiguna and Center for Digital Society, (2026)

[7] Hugging Face, (2026)

[8] Hugging Face, (2026)

[9] Hugging Face, (2026)

[10] Hugging Face, (2026)

[11] Hugging Face, (2026)

[12] Hugging Face, (2026); Cloud Security Alliance. (2026). Hugging Face incident initial post-mortem: Expedited strategy briefing (Version 0.8, draft). https://cloudsecurityalliance.org/artifacts/hugging-face-ciso-post-mortem

[13] Cloud Security Alliance, (2026)

[14] Cloud Security Alliance, (2026)

[15] Cloud Security Alliance, (2026)

[16] Simpson, C. (2026, April 10). A single operator, two AI platforms, nine government agencies: The full technical report. Gambit Security. https://gambit.security/blog-posts/a-single-operator-two-ai-platforms-nine-government-agencies-the-full-technical-report

[17] Simpson, (2026)

[18] Hunt.io. (2026). Thailand Ministry of Finance targeted with Hermes AI agent. https://hunt.io/blog/thailand-ministry-finance-targeted-with-hermes-ai-agent

[19] Hunt.io, (2026)

[20] Pangestuti, Y. K. R. (2026a, August 10). Komdigi ungkap AI bisa jadi pelaku serangan siber, bukan lagi hacker. Warta Ekonomi. https://wartaekonomi.co.id/read627668/komdigi-ungkap-ai-bisa-jadi-pelaku-serangan-siber-bukan-lagi-hacker

[21] Pangestuti, Y. K. R. (2026b, August 14). Indonesia cyber protection 2026 dorong industri keuangan perkuat ketahanan siber berbasis era AI. Warta Ekonomi. https://wartaekonomi.co.id/read628631/indonesia-cyber-protection-2026-dorong-industri-keuangan-perkuat-ketahanan-siber-berbasis-era-ai

[22] Cloud Security Alliance, (2026)

[23] Cloud Security Alliance, (2026)

[24] OpenAI, (2026)

[25] Hugging Face, (2026); Cloud Security Alliance, (2026)

[26] Freedman, D. (2026, September 3). After OpenAI’s bots went rogue, watchdogs were kept on a short leash. The New York Times.

[27] Freedman, (2026)