Para peneliti telah menunjukkan bahwa jejak penalaran terenkripsi (encrypted reasoning traces)—paket kecil yang dikirim penyedia ke perangkat pengguna agar percakapan dapat berpindah antar model—dapat didekripsi oleh model yang lebih lemah dari layanan yang sama, sehingga membocorkan ratusan kredensial dan detail pribadi. Temuan ini, yang dirinci dalam makalah Stealing Reasoning Traces from Proprietary LLM APIs, mengancam fitur kenyamanan yang diandalkan Anthropic, OpenAI, dan Google untuk menjaga kelancaran obrolan AI.
Mengapa blok terenkripsi tersebut ada
Saat Anda berbicara dengan model bahasa besar (LLM), layanan tersebut membangun sebuah "jejak penalaran" (reasoning trace): rangkaian perintah internal, panggilan alat (tool calls), dan langkah-langkah rantai pemikiran (chain-of-thought) yang mengarah pada jawaban. Agar Anda dapat beralih dari model yang lebih besar ke model yang lebih murah tanpa kehilangan rangkaian tersebut, penyedia mengenkripsi jejak tersebut, mengirimkannya ke perangkat Anda, dan mengharapkan Anda mengirimkannya kembali pada permintaan berikutnya. Enkripsi ini dimaksudkan untuk menjaga privasi jejak tersebut sambil tetap memungkinkan kontinuitas lintas sesi dan lintas model.
Cara kerja serangan ini
Para peneliti mendemonstrasikan eksploitasi tiga langkah yang tidak memerlukan pembobolan pada model kuat itu sendiri:
- Tangkap (Capture) blok penalaran terenkripsi yang dihasilkan oleh model yang kuat selama percakapan normal.
- Berikan (Feed) blok tersebut ke model yang lebih lemah dari penyedia yang sama, dan minta model tersebut untuk "membaca" bloknya.
- Karena model yang lebih lemah berbagi kunci dekripsi yang sama, ia akan mengeluarkan (outputs) konten yang telah didekripsi dalam bentuk teks biasa (plain text).
Model yang lebih lemah bertindak sebagai decryption oracle. Penyerang tidak pernah menyentuh bagian internal model yang kuat; mereka hanya menggunakan API penyedia itu sendiri untuk menyerang balik.
Apa yang berhasil dipulihkan oleh para peneliti
- 182 kredensial – kunci API, token, dan rahasia lainnya yang tertanam dalam jejak tersebut.
- 367 informasi pribadi – nama, email, alamat yang diberikan pengguna selama obrolan.
- Payload prompt-injection – instruksi berbahaya yang tersembunyi dalam blok terenkripsi yang nantinya dapat dieksekusi saat jejak tersebut dimainkan kembali.
- Bypass filter keamanan (safety-filter bypasses) – jejak yang didekripsi mengungkapkan langkah-langkah yang seharusnya diblokir jika diperiksa dalam teks biasa, sehingga memungkinkan konten berbahaya lolos.
Makalah tersebut menekankan bahwa kelemahan ini bukanlah cacat pada algoritma kriptografi; enkripsinya sendiri tetap kokoh. Pelanggaran ini berasal dari pilihan desain untuk membiarkan model apa pun dalam armada penyedia mendekripsi blok tersebut demi kenyamanan pengguna.
Pertukaran (trade-off) di inti masalah
Penyedia membangun kemampuan "perpindahan model" (model-switching) ini ke dalam API mereka karena pengembang dan pengguna akhir menghargai kontinuitas. Jika enkripsi terikat pada satu instansi atau sesi model saja, proses transisi yang lancar akan terganggu, sehingga memaksa pengembang untuk membangun manajemen status (state management) mereka sendiri. Makalah tersebut berargumen bahwa keamanan sengaja dikorbankan demi fleksibilitas.
Apa yang harus dilakukan pengembang sekarang
- Anggap jejak terenkripsi sebagai teks biasa (clear-text). Asumsikan bahwa log, cache, atau sistem pemantauan apa pun yang menyimpannya dapat dibaca oleh penyerang.
- Hindari memasukkan (committing) jejak ke repositori publik. Bahkan satu blok yang terselip dapat mengekspos puluhan rahasia.
- Rencanakan kontrol yang lebih ketat. Penyedia mungkin akan memperketat keamanan, yang dapat mengubah cara agen multi-model dibangun.
- Beralih ke penyerahan status yang eksplisit (explicit state hand-offs). Alih-alih mengandalkan penalaran tersembunyi, rancanglah agen untuk menghasilkan data terstruktur (JSON, XML, dll.) yang dapat diteruskan dengan aman antar model tanpa enkripsi.
- Audit prompt Anda. Cari data sensitif apa pun yang berakhir di rantai penalaran dan hapus sebelum mengirimkan permintaan.
Apa yang perlu diperhatikan dari penyedia besar
Rilis makalah ini akan mendorong Anthropic, OpenAI, dan Google untuk menilai kembali kebijakan dekripsi yang tertanam dalam API mereka.
Implikasi yang lebih luas
Penemuan ini menggarisbawahi dilema keamanan klasik: kenyamanan sering kali membuka pintu belakang (backdoor). Dengan mengizinkan model apa pun mendekripsi blok milik pengguna, penyedia telah memberikan jalur mudah bagi penyerang untuk mengakses data sensitif. Perbaikannya kemungkinan akan membuat integrasi AI menjadi sedikit lebih rumit, tetapi hal itu juga akan memulihkan ekspektasi bahwa data terenkripsi akan tetap terenkripsi.
Kesimpulan: Jejak penalaran terenkripsi bukanlah batas keamanan; itu adalah jalan pintas kenyamanan yang dapat berbalik menyerang Anda. Perlakukan jejak tersebut sebagai teks biasa, hapus dari log, dan rancang ulang agen Anda untuk menghadapi masa depan di mana hanya model asal yang dapat membaca pemikirannya sendiri.
