গবেষকরা দেখিয়েছেন যে এনক্রিপ্টেড রিজনিং ট্রেস (encrypted reasoning traces)—ছোট ছোট ডেটা প্যাকেট যা একজন প্রোভাইডার ব্যবহারকারীর ডিভাইসে পাঠায় যাতে একটি কথোপকথন এক মডেল থেকে অন্য মডেলে স্থানান্তরিত হতে পারে—একই সার্ভিসের একটি দুর্বল মডেল দ্বারা ডিক্রিপ্ট করা সম্ভব, যার ফলে শত শত ক্রেডেনশিয়াল (credentials) এবং ব্যক্তিগত তথ্য ফাঁস হয়ে যেতে পারে। Stealing Reasoning Traces from Proprietary LLM APIs শীর্ষক গবেষণাপত্রে বিস্তারিতভাবে বর্ণিত এই ফলাফলটি এমন একটি সুবিধাজনক ফিচারকে হুমকির মুখে ফেলেছে যা Anthropic, OpenAI এবং Google তাদের AI চ্যাটগুলোকে নিরবচ্ছিন্ন রাখতে ব্যবহার করে।
কেন এই এনক্রিপ্টেড ব্লকগুলো বিদ্যমান
আপনি যখন একটি লার্জ ল্যাঙ্গুয়েজ মডেলের (LLM) সাথে কথা বলেন, তখন সার্ভিসটি একটি "রিজনিং ট্রেস" (reasoning trace) তৈরি করে: এটি হলো অভ্যন্তরীণ প্রম্পট, টুল কল এবং চেইন-অফ-থট (chain-of-thought) ধাপের একটি ধারাবাহিকতা যা উত্তরের দিকে নিয়ে যায়। এই ধারাবাহিকতা না হারিয়ে আপনাকে একটি বড় মডেল থেকে একটি সস্তা মডেলে পরিবর্তন করার সুযোগ দিতে প্রোভাইডাররা এই ট্রেসটি এনক্রিপ্ট করে আপনার ডিভাইসে পাঠিয়ে দেয় এবং আশা করে যে আপনি পরবর্তী অনুরোধের সাথে এটি আবার ফেরত পাঠাবেন। এনক্রিপশনের উদ্দেশ্য হলো ক্রস-সেশন এবং ক্রস-মডেল ধারাবাহিকতা বজায় রাখার পাশাপাশি ট্রেসটিকে গোপন রাখা।
আক্রমণটি যেভাবে কাজ করে
গবেষকরা একটি তিন-ধাপের এক্সপ্লয়েট (exploit) প্রদর্শন করেছেন যার জন্য শক্তিশালী মডেলটির নিজস্ব কোনো নিরাপত্তা ভাঙার প্রয়োজন নেই:
- ক্যাপচার (Capture): একটি স্বাভাবিক কথোপকথনের সময় একটি শক্তিশালী মডেল দ্বারা তৈরি করা এনক্রিপ্টেড রিজনিং ব্লকটি সংগ্রহ করা।
- ফিড (Feed): সেই ব্লকটি একই প্রোভাইডারের একটি দুর্বল মডেলকে দেওয়া এবং এটিকে ব্লকটি "পড়ার" জন্য বলা।
- যেহেতু দুর্বল মডেলটি একই ডিক্রিপশন কী (decryption keys) ব্যবহার করে, তাই এটি ডিক্রিপ্ট করা কন্টেন্টটি প্লেইন টেক্সট হিসেবে আউটপুট (outputs) দেয়।
দুর্বল মডেলটি একটি ডিক্রিপশন ওরাকল (decryption oracle) হিসেবে কাজ করে। আক্রমণকারীরা শক্তিশালী মডেলের অভ্যন্তরীণ কাঠামোর কোনো ক্ষতি করেনি; তারা কেবল প্রোভাইডারের নিজস্ব API-কেই তাদের বিরুদ্ধে ব্যবহার করেছে।
গবেষকরা যা উদ্ধার করেছেন
- ১৮২টি ক্রেডেনশিয়াল (credentials) – ট্রেসের মধ্যে থাকা API কী, টোকেন এবং অন্যান্য গোপন তথ্য।
- ৩৬৭টি ব্যক্তিগত তথ্য – ব্যবহারকারীরা চ্যাটের সময় যে নাম, ইমেল, ঠিকানা প্রদান করেছিলেন।
- প্রম্পট-ইনজেকশন পেলোড (Prompt-injection payloads) – এনক্রিপ্টেড ব্লকের মধ্যে লুকানো ক্ষতিকারক নির্দেশাবলী যা পরবর্তীতে ট্রেসটি পুনরায় প্লে (replay) করার সময় কার্যকর হতে পারে।
- সেফটি-ফিল্টার বাইপাস (Safety-filter bypasses) – ডিক্রিপ্ট করা ট্রেসটি এমন কিছু ধাপ প্রকাশ করেছে যা প্লেইন টেক্সট হিসেবে থাকলে ব্লক হয়ে যেত, ফলে ক্ষতিকারক কন্টেন্ট সহজেই বেরিয়ে আসতে পারে।
গবেষণাপত্রটিতে জোর দিয়ে বলা হয়েছে যে এই দুর্বলতাটি ক্রিপ্টোগ্রাফিক অ্যালগরিদমের কোনো ত্রুটি নয়; এনক্রিপশন নিজেই কার্যকর। এই নিরাপত্তা লঙ্ঘনটি মূলত ব্যবহারকারীর অভিজ্ঞতার কথা মাথায় রেখে প্রোভাইডারের ফ্লিট বা বহরের যেকোনো মডেলকে ব্লকটি ডিক্রিপ্ট করার অনুমতি দেওয়ার ডিজাইনের কারণে ঘটেছে।
সমস্যার মূলে থাকা আপস (trade-off)
প্রোভাইডাররা তাদের API-তে এই "মডেল-সুইচিং" ক্ষমতাটি তৈরি করেছে কারণ ডেভেলপার এবং ব্যবহারকারীরা ধারাবাহিকতাকে গুরুত্ব দেন। যদি এনক্রিপশনটি কোনো একটি নির্দিষ্ট মডেল ইনস্ট্যান্স বা সেশনের সাথে যুক্ত থাকত, তবে এই মসৃণ হস্তান্তর প্রক্রিয়াটি ভেঙে পড়ত এবং ডেভেলপারদের স্টেট ম্যানেজমেন্ট (state management) নিজেরাই তৈরি করতে হতো। গবেষণাপত্রটি যুক্তি দেয় যে নমনীয়তার জন্য ইচ্ছাকৃতভাবে নিরাপত্তাকে বিসর্জন দেওয়া হয়েছে।
ডেভেলপারদের এখন যা করা উচিত
- এনক্রিপ্টেড ট্রেসগুলোকে প্লেইন টেক্সট হিসেবে বিবেচনা করুন। ধরে নিন যে যেকোনো লগ, ক্যাশ বা মনিটরিং সিস্টেম যা এগুলো সংরক্ষণ করে, তা একজন আক্রমণকারী পড়তে পারে।
- পাবলিক রিপোজিটরিতে ট্রেস কমিট করা এড়িয়ে চলুন। একটি মাত্র ভুল ব্লকও ডজন ডজন গোপন তথ্য ফাঁস করে দিতে পারে।
- আরও কঠোর নিয়ন্ত্রণের পরিকল্পনা করুন। প্রোভাইডাররা নিরাপত্তা আরও কঠোর করতে পারে, যা মাল্টি-মডেল এজেন্ট তৈরির পদ্ধতি পরিবর্তন করে দিতে পারে।
- স্পষ্ট স্টেট হ্যান্ড-অফ (explicit state hand-offs)-এর দিকে ঝুঁকুন। লুকানো রিজনিংয়ের ওপর নির্ভর না করে, এজেন্টগুলোকে এমনভাবে ডিজাইন করুন যাতে তারা স্ট্রাকচার্ড ডেটা (JSON, XML, ইত্যাদি) আউটপুট দেয় যা এনক্রিপশন ছাড়াই নিরাপদে মডেলগুলোর মধ্যে আদান-প্রদান করা যায়।
- আপনার প্রম্পটগুলো অডিট করুন। রিজনিং চেইনে কোনো সংবেদনশীল তথ্য যাচ্ছে কিনা তা দেখুন এবং অনুরোধ পাঠানোর আগে তা সরিয়ে ফেলুন।
বড় প্রোভাইডারদের ক্ষেত্রে যা লক্ষ্য রাখতে হবে
এই গবেষণাপত্রটি প্রকাশ হওয়ার ফলে Anthropic, OpenAI এবং Google তাদের API-তে থাকা ডিক্রিপশন পলিসিগুলো পুনর্মূল্যায়ন করতে বাধ্য হবে।
বৃহত্তর প্রভাব
এই আবিষ্কারটি একটি ধ্রুপদী নিরাপত্তা দ্বিধাকে (security dilemma) তুলে ধরে: সুবিধা বা কনভিনিয়েন্স প্রায়শই একটি ব্যাকডোর খুলে দেয়। ব্যবহারকারীর মালিকানাধীন যেকোনো ব্লককে ডিক্রিপ্ট করার অনুমতি দিয়ে প্রোভাইডাররা আক্রমণকারীদের সংবেদনশীল ডেটা পাওয়ার একটি সহজ পথ করে দিয়েছে। এর সমাধান সম্ভবত AI ইন্টিগ্রেশনকে কিছুটা জটিল করে তুলবে, তবে এটি এই প্রত্যাশাও ফিরিয়ে আনবে যে এনক্রিপ্টেড ডেটা এনক্রিপ্টেড অবস্থাতেই থাকবে।
মূল কথা (Takeaway): এনক্রিপ্টেড রিজনিং ট্রেস কোনো নিরাপত্তা সীমানা নয়; এগুলো একটি সুবিধাজনক শর্টকাট যা আপনার বিরুদ্ধেই ব্যবহৃত হতে পারে। এগুলোকে প্লেইন টেক্সট হিসেবে বিবেচনা করুন, লগ থেকে এগুলো মুছে ফেলুন এবং আপনার এজেন্টগুলোকে এমনভাবে নতুন করে ডিজাইন করুন যাতে ভবিষ্যতে শুধুমাত্র মূল মডেলটিই তার নিজস্ব চিন্তা বা রিজনিং পড়তে পারে।
