BerandaPusat Berita LBank
'Pikiran Dalam' dari Setiap Model AI Besar Terungkap dalam Eksploitasi Besar-besaran
inner-thoughts-every-major-ai-model-exposed-exploit
'Pikiran Dalam' dari Setiap Model AI Besar Terungkap dalam Eksploitasi Besar-besaran
Peneliti menemukan bahwa setiap penyedia AI utama mengenkripsi token penalaran dengan satu kunci global—dan memanfaatkannya untuk mendekode 315.320 blok pemikiran tersembunyi dari log publik, sekaligus memulihkan kata sandi dan kunci API aktif di sepanjang proses.
2026-08-12 Sumber:decrypt.co

Singkatnya

  • Sebuah tim peneliti menemukan bahwa Anthropic, OpenAI, dan Google semuanya menggunakan kunci enkripsi global tunggal untuk token penalaran AI.
  • Dengan mendekode 315.320 blok penalaran yang diambil dari repositori GitHub dan Hugging Face publik, para peneliti berhasil mendapatkan kembali 182 kredensial, termasuk 62 kunci API aktif, 33 kata sandi, dan 30 alamat email pribadi.
  • OpenAI, Anthropic, dan Google menerapkan perbaikan sisi server setelah pengungkapan yang bertanggung jawab, namun log sesi historis yang sudah dibagikan secara publik tetap dapat didekode.

Peneliti keamanan telah menemukan cara untuk membaca "pikiran batin" terenkripsi dari setiap model penalaran AI utama—dan menemukan 62 kunci API aktif serta 33 kata sandi yang terkubur dalam log sesi yang telah dibagikan pengembang secara publik secara daring tanpa mengetahui apa yang ada di dalamnya.

"Dengan mendekode 315.320 blok penalaran yang diambil dari repositori publik, kami mendapatkan kembali 367 artefak Informasi Identifikasi Pribadi (PII) dan 182 kredensial," tulis para peneliti.

Makalah yang diajukan pada 10 Agustus oleh tim dari MATS Research, ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, dan perusahaan keamanan Snyk, menargetkan kelas AI spesifik: model penalaran. Ini adalah model yang tidak hanya langsung menjawab, melainkan memulai dengan rantai pemikiran internal (sebuah catatan langkah-demi-langkah di mana AI memecahkan masalah sebelum menunjukkan jawaban), lalu memberikan respons akhir.

Anthropic, OpenAI, dan Google semuanya mengenkripsi catatan tersembunyi itu. Enkripsi—proses mengacak data menjadi kode yang tidak dapat dibaca—dimaksudkan untuk melindungi kekayaan intelektual perusahaan dan menjaga penalaran perantara yang sensitif dari pengguna. Blok terenkripsi dikirim kembali ke server penyedia dengan setiap pesan lanjutan, menjaga percakapan tanpa menyimpan apa pun di sisi perusahaan.

Satu kunci untuk menguasai segalanya

Kelemahannya bersifat arsitektural. Alih-alih mengikat setiap blok penalaran terenkripsi ke pengguna, sesi, atau model tertentu, ketiga penyedia tersebut menggunakan kunci enkripsi tunggal di seluruh ekosistem mereka. "Blok terenkripsi ini sepenuhnya kompatibel dan dapat dipertukarkan di berbagai sesi, pengguna, dan bahkan model yang berbeda dalam ekosistem penyedia," tulis para peneliti.

Itu berarti blok penalaran terenkripsi dari Claude Opus 4.8—model unggulan Anthropic—dapat disuntikkan ke Claude Haiku 4.5, versi yang lebih murah dan kurang dilindungi tanpa melanggar aturan Anthropic. Haiku tidak memiliki keselarasan anti-distilasi (pelatihan keamanan yang dirancang khusus untuk menghentikan model mentranskrip penalaran sendiri atas perintah) yang dimiliki Opus.

Minta Haiku untuk membaca blok terenkripsi secara verbatim, dan itu akan dilakukan. "Dengan menyuntikkan jejak penalaran terenkripsi dari model tertentu ke dalam model yang lebih lemah, dan kurang terlindungi dari penyedia yang sama, kami memaksanya untuk mendekode dan mengeluarkan jejak tersebut secara verbatim dalam bentuk teks biasa, tanpa pernah melakukan jailbreak pada model yang lebih mumpuni secara langsung," demikian pernyataan dalam makalah tersebut.

"Portabilitas lintas model berarti Haiku 4.5 dapat membaca pemikiran Opus 4.8," tulis peneliti utama Alexander Panfilov di X. Serangan yang sama direplikasi di seluruh keluarga GPT-5.6 OpenAI dan jajaran model Gemini Google. Tidak diperlukan akses khusus—akses API standar (koneksi yang digunakan pengembang untuk membangun aplikasi di atas model AI) sudah cukup untuk melaksanakannya.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Isi log publik

Untuk menunjukkan kerusakan di dunia nyata, tim mengumpulkan 6.708 transkrip agen AI yang dibagikan secara publik—log sesi otomatis yang biasa diposting pengembang ke GitHub dan Hugging Face untuk kolaborasi atau debugging. Mereka mendekode 315.320 blok penalaran dari log tersebut.

"Para pengembang sering berbagi log sesi dan jejak pemikiran terenkripsi mereka secara publik daring, sama sekali tidak menyadari data sensitif yang tersembunyi di dalam blok terenkripsi," catat makalah tersebut. Sebagian besar rahasia tersebut tidak pernah muncul dalam keluaran AI yang terlihat—mereka hanya ada di dalam penalaran terenkripsi, tidak terlihat oleh siapa pun yang belum menjalankan serangan itu.

Kerentanan ini membuka empat vektor serangan di luar pencurian kredensial sederhana: mencuri pola penalaran eksklusif dari perusahaan AI untuk melatih model pesaing melalui distilasi (ketika AI yang lebih kecil belajar meniru AI yang lebih besar dengan mempelajari keluarannya); mengekstraksi data pribadi dari log yang dibagikan; mengeksekusi injeksi perintah tak terlihat, di mana instruksi berbahaya disembunyikan di dalam blok penalaran terenkripsi yang tidak pernah dilihat oleh alat pemantauan keamanan; dan menjebol model canggih melalui model saudara mereka yang kurang terlindungi.

Anthropic, OpenAI, dan Google semuanya menerapkan mitigasi sisi server setelah tim mengikuti prosedur pengungkapan yang bertanggung jawab. Seperti yang dilaporkan Decrypt sebelumnya, Anthropic telah menjadi fokus berulang bagi peneliti keamanan tahun ini, terutama karena model terbarunya mengonsumsi lebih banyak token dalam proses tersebut.

Patch sudah diterapkan. Namun, 6.708 transkrip sesi dengan blok penalaran yang telah didekode dan diambil dari web publik tidak akan hilang.