Penyelidik telah menunjukkan bahawa jejak penaakulan tersulit—paket kecil yang dihantar oleh penyedia ke peranti pengguna supaya perbualan boleh beralih antara model—boleh dinyahsulit oleh model yang lebih lemah daripada perkhidmatan yang sama, sehingga membocorkan ratusan kredensial dan butiran peribadi. Penemuan ini, yang diperincikan dalam kertas kerja Stealing Reasoning Traces from Proprietary LLM APIs, mengancam ciri kemudahan yang bergantung kepada Anthropic, OpenAI dan Google untuk memastikan sembang AI berjalan lancar.
Mengapa blok tersulit wujud
Apabila anda berbual dengan model bahasa besar (LLM), perkhidmatan tersebut membina "jejak penaakulan": rantaian prom dalaman, panggilan alatan, dan langkah rantaian pemikiran yang membawa kepada jawapan. Untuk membolehkan anda bertukar daripada model yang lebih besar kepada model yang lebih murah tanpa kehilangan rantaian tersebut, penyedia menyulitkan jejak itu, menghantarnya ke peranti anda, dan menjangkakan anda menghantarnya semula dengan permintaan seterusnya. Penyulitan ini bertujuan untuk menjaga privasi jejak tersebut sambil tetap membolehkan kesinambungan merentas sesi dan merentas model.
Bagaimana serangan ini berfungsi
Penyelidik telah menunjukkan eksploitasi tiga langkah yang tidak memerlukan sebarang pencerobohan terhadap model yang kuat itu sendiri:
- Tangkap blok penaakulan tersulit yang dihasilkan oleh model yang berkuasa semasa perbualan biasa.
- Berikan blok tersebut kepada model yang lebih lemah daripada penyedia yang sama, dan minta ia untuk "membaca" blok tersebut.
- Oleh kerana model yang lebih lemah berkongsi kunci penyahsulitan yang sama, ia akan mengeluarkan kandungan yang telah dinyahsulit dalam bentuk teks biasa.
Model yang lebih lemah bertindak sebagai orak penyahsulitan. Penyerang tidak pernah menyentuh bahagian dalaman model yang kuat; mereka hanya menggunakan API penyedia itu sendiri terhadap dirinya sendiri.
Apa yang berjaya dipulihkan oleh penyelidik
- 182 kredensial – kunci API, token dan rahsia lain yang tertanam dalam jejak tersebut.
- 367 maklumat peribadi – nama, e-mel, alamat yang telah dibekalkan oleh pengguna semasa sembang.
- Payload suntikan-prom – arahan berniat jahat yang tersembunyi dalam blok tersulit yang boleh dilaksanakan kemudian apabila jejak itu dimainkan semula.
- Pintasan penapis keselamatan – jejak yang dinyahsulit mendedahkan langkah-langkah yang sepatutnya disekat jika diperiksa dalam teks biasa, membolehkan kandungan berbahaya terlepas.
Kertas kerja tersebut menekankan bahawa kelemahan ini bukanlah kecacatan dalam algoritma kriptografi; penyulitan itu sendiri masih kukuh. Pelanggaran ini berpunca daripada pilihan reka bentuk untuk membenarkan mana-mana model dalam rangkaian penyedia menyahsulit blok tersebut demi pengalaman pengguna.
Pertukaran (trade-off) di tengah-tengah isu ini
Penyedia membina keupayaan "penukaran model" ini ke dalam API mereka kerana pembangun dan pengguna akhir menghargai kesinambungan. Jika penyulitan terikat pada satu instans atau sesi model sahaja, peralihan yang lancar akan terganggu, memaksa pembangun membina pengurusan keadaan (state management) sendiri. Kertas kerja tersebut berhujah bahawa keselamatan telah dikorbankan secara sengaja demi fleksibiliti.
Apa yang perlu dilakukan oleh pembangun sekarang
- Anggap jejak tersulit sebagai teks biasa. Andaikan mana-mana log, cache atau sistem pemantauan yang menyimpannya boleh dibaca oleh penyerang.
- Elakkan menyimpan jejak dalam repositori awam. Walaupun hanya satu blok yang tersasar boleh mendedahkan berpuluh-puluh rahsia.
- Rancang kawalan yang lebih ketat. Penyedia mungkin akan memperketat keselamatan, yang boleh mengubah cara ejen pelbagai model dibina.
- Beralih kepada penyerahan keadaan secara eksplisit. Daripada bergantung kepada penaakulan tersembunyi, reka ejen untuk mengeluarkan data berstruktur (JSON, XML, dll.) yang boleh dihantar dengan selamat antara model tanpa penyulitan.
- Audit prom anda. Cari sebarang data sensitif yang berakhir dalam rantaian penaakulan dan buangkannya sebelum menghantar permintaan.
Apa yang perlu diperhatikan daripada penyedia besar
Penerbitan kertas kerja ini akan mendorong Anthropic, OpenAI dan Google untuk menilai semula dasar penyahsulitan yang terbina dalam API mereka.
Implikasi yang lebih luas
Penemuan ini menekankan dilema keselamatan klasik: kemudahan sering kali membuka pintu belakang. Dengan membenarkan mana-mana model menyahsulit blok milik pengguna, penyedia telah memberikan penyerang laluan mudah untuk mendapatkan data sensitif. Pembaikan tersebut berkemungkinan akan menjadikan integrasi AI sedikit lebih rumit, tetapi ia juga akan mengembalikan jangkaan bahawa data tersulit akan kekal tersulit.
Rumusan: Jejak penaakulan tersulit bukanlah sempadan keselamatan; ia adalah jalan pintas kemudahan yang boleh digunakan terhadap anda. Anggap ia sebagai teks biasa, hapuskan ia daripada log, dan reka semula ejen anda untuk bertahan dalam masa hadapan di mana hanya model asal yang boleh membaca pemikirannya sendiri.
