“Friendly Fire” নিরাপত্তা গবেষণাটি দেখিয়েছে যে, একটি README ফাইলে কেবল একটি ক্ষতিকারক নির্দেশ ঢুকিয়ে দিলেই একটি AI এজেন্টকে প্রতারিত করা সম্ভব, এবং এজেন্টটি মূল কোডটি না দেখেই সেটি মেনে নেবে। একই ত্রুটি একটি ব্যক্তিগত ব্লগ-অটোমেশন পাইপলাইনেও দেখা গেছে, যা একটি অনিরীক্ষিত জেনারেশন ফেজের সময় “auto-approve” ফ্ল্যাঙ্কের ওপর নির্ভর করেছিল, যা একটি লুকানো অ্যাটাক সারফেস উন্মোচন করেছে।

Friendly Fire গবেষণা একটি লুকানো অ্যাটাক ভেক্টর উন্মোচন করেছে

Friendly Fire পেপারের গবেষকরা একটি সামান্য অথচ শক্তিশালী এক্সপ্লয়েট প্রদর্শন করেছেন: একজন আক্রমণকারী একটি ডকুমেন্টেশন ফাইলে এমন একটি কমান্ড অন্তর্ভুক্ত করেন যা AI তার স্বাভাবিক কাজের অংশ হিসেবে পড়ে। যেহেতু এজেন্ট ফাইলটির বিষয়বস্তুর ওপর বিশ্বাস করে, তাই এটি লুকানো কমান্ডটি একটি বৈধ নির্দেশ হিসেবে কার্যকর করে। এই আক্রমণের জন্য AI মডেলটিকে হ্যাক করার প্রয়োজন নেই; মানুষের নজরদারির বাইরে থাকা অবস্থায় মডেলটি যে ডেটা প্রসেস করে, কেবল সেটিকে প্রভাবিত করাই যথেষ্ট।

এই গবেষণার মূল অবদান পেলোডের অভিনবত্ব নয়, বরং এই প্রকাশ যে “auto-approve” মোড—এমন সেটিংস যা AI-কে কোনো দ্বিতীয় যাচাই ছাড়াই যা কিছু পড়বে তার ওপর ভিত্তি করে কাজ করতে বলে—বাহ্যিক ডেটা সোর্সের সাথে একটি অন্তর্নিহিত বিশ্বাসের সম্পর্ক তৈরি করে। যখন সেই বিশ্বাস অন্ধ হয়, তখন পাইপলাইনটি নির্বিচারে কোড এক্সিকিউশনের (arbitrary code execution) একটি প্রবেশদ্বারে পরিণত হয়।

কীভাবে একটি অনিরীক্ষিত ব্লগ পাইপলাইন ভেঙে পড়ল

গবেষণার লেখক একই যুক্তি একটি ব্যক্তিগত ব্লগ-অটোমেশন সিস্টেমে প্রয়োগ করেছিলেন। এই ওয়ার্কফ্লোতে তিনটি ধাপ রয়েছে:

  1. Generation stretch – কোনো মানুষের তদারকি ছাড়াই AI নিবন্ধটি লেখে।
  2. QA gate – একটি স্বয়ংক্রিয় কোয়ালিটি-স্কোর চেক আউটপুটটি মূল্যায়ন করে।
  3. Telegram button – পোস্টটি প্রকাশ করার জন্য একজন মানুষকে একটি বোতাম চাপতে হয়।

জেনারেশন স্ট্রেচ চলাকালীন লেখক dangerously-skip-permissions নামক একটি ফ্ল্যাগ সক্রিয় করেছিলেন, যা AI-কে যেকোনো ইনপুটকে অনুমোদিত হিসেবে গণ্য করতে বলে। এই ফ্ল্যাগটি মূলত Friendly Fire পেপারে চিহ্নিত “auto-approve” মোডটির পুনরাবৃত্তি করে।

পরবর্তীতে একটি অডিট একটি বিশাল ফাঁক উন্মোচন করে: যদি একজন আক্রমণকারী সেই সময়ের মধ্যে AI যে কোনো ফাইল পড়ে তাতে প্রভাব ফেলতে পারে, তবে তারা পুরো পাইপলাইনটিকে নিয়ন্ত্রণ করতে পারে। লেখকের নিজস্ব সিস্টেমটি ছয়বারের মধ্যে পাঁচবার নিঃশব্দে ব্যর্থ হয়েছিল কারণ একটি কনফিগারেশন স্ক্রিপ্ট অনিচ্ছাকৃতভাবে অন্য একটি স্ক্রিপ্টের সেটিংস ওভাররাইট করে ফেলেছিল। এক্সিট কোড বা QA স্কোরের কোনো লগিং না থাকায়, বিষয়টি ধরা পড়ার আগে তিন দিন ধরে চলতে থাকে।

এই ঘটনাটি প্রমাণ করে যে নিরাপত্তা AI-এর আউটপুটের ওপর বিশ্বাস করার মাধ্যমে আসে না, বরং জেনারেশন ফেজের চারপাশের তিনটি সুনির্দিষ্ট চেকপয়েন্টের মাধ্যমে আসে।

নিরাপত্তা আসলে কোথায় থাকে

গবেষণা এবং ব্লগ-অটোমেশনের ব্যর্থতা একটি মাত্র বিন্দুতে মিলিত হয়: সুরক্ষা অবশ্যই জেনারেশন প্রক্রিয়ার বাইরে থাকতে হবে। AI যখন auto-approve অবস্থায় কাজ করে, তখন তাকে যেকোনো আচরণ করতে প্ররোচিত করা সম্ভব; কেবল চারপাশের নিয়ন্ত্রণ ব্যবস্থাগুলোই অনাকাঙ্ক্ষিত কাজ শনাক্ত করতে এবং ব্লক করতে পারে।

মূল পর্যবেক্ষণসমূহ:

  • শেষে মানুষের অনুমোদন কার্যকর হয় কারণ এটি চূড়ান্ত ফলাফলটি পর্যালোচনা করে, মধ্যবর্তী ধাপগুলো নয় যা রিয়েল-টাইম তদারকির জন্য অত্যন্ত দ্রুত এবং অসংখ্য।
  • কোয়ালিটি থ্রেশহোল্ড জেনারেশনের পরে কিন্তু প্রকাশের আগে প্রয়োগ করা হয়, যা কম-নিশ্চিত আউটপুটগুলোকে শনাক্ত করে যা কারসাজি করা হয়ে থাকতে পারে।
  • প্রতিটি এক্সিট কোড, QA স্কোর এবং কনফিগারেশন পরিবর্তনের বিস্তারিত লগিং নিঃশব্দ ব্যর্থতাগুলোকে বড় ধরনের বিপর্যয় ঘটার আগেই দৃশ্যমান করে তোলে।

যারা auto-approve এজেন্ট পরিচালনা করেন তাদের জন্য শিক্ষা

  1. সবকিছু লগ করুন – এক্সিট কোড, QA স্কোর এবং কনফিগারেশন ফাইলের যেকোনো পরিবর্তন রেকর্ড করুন। আপনি যা দেখতে পাবেন না, তা আপনি ঠিক করতে পারবেন না।
  2. একটি কঠোর কোয়ালিটি গেট প্রয়োগ করুন – একটি আপোষহীন থ্রেশহোল্ড নির্ধারণ করুন যা পাইপলাইন পরবর্তী ধাপে যাওয়ার আগে অবশ্যই পূরণ করতে হবে।
  3. চূড়ান্ত ধাপের জন্য মানুষের অনুমোদন সংরক্ষণ করুন – AI জেনারেশন করার সময় তাকে পর্যবেক্ষণ করার চেষ্টা করা অবাস্তব; সমস্ত যাচাইয়ের পরে একটি মাত্র বোতাম চাপার পদ্ধতি অনেক বেশি নির্ভরযোগ্য।
  4. কনফিগারেশন ফাইল সুরক্ষিত রাখুন – সেগুলোকে অন্যান্য টুল থেকে আলাদা রাখুন যা সেটিংস পরিবর্তন করতে পারে, এবং নিয়মিতভাবে রাইট অ্যাক্সেস (write access) অডিট করুন।

সারসংক্ষেপ

অনিরীক্ষিত AI এজেন্টগুলো কেবল ততটুকুই নিরাপদ যতটা আপনি তাদের চারপাশের ফাঁকগুলো বন্ধ করতে পারেন। একটি “auto-approve” ফ্ল্যাগ সুবিধাকে একটি নিঃশব্দ ব্যাকডোরে পরিণত করে; পুঙ্খানুপুঙ্খ লগিং, কঠোর কোয়ালিটি গেট এবং চূড়ান্ত মানুষের স্বাক্ষর হলো সেই ব্যবহারিক প্রতিরক্ষা যা পাইপলাইনকে একটি অ্যাটাক ভেক্টরে পরিণত হওয়া থেকে রক্ষা করে।