OpenAI আজ GPT-Red লঞ্চ করেছে, যা একটি লার্জ-ল্যাঙ্গুয়েজ মডেল এবং এটি একটি স্বয়ংক্রিয় রেড-টিম হ্যাকার হিসেবে কাজ করে। এই সিস্টেমটি ইতিমধ্যেই কোম্পানির সর্বশেষ GPT-5.6 মডেলটিকে আরও সুরক্ষিত করছে, যা সিমুলেটেড আক্রমণের সাফল্যের হার ৯০%-এর বেশি থেকে কমিয়ে ২৩%-এর নিচে নামিয়ে এনেছে।

কীভাবে GPT-Red রেড-টিম কাজকে স্বয়ংক্রিয় করে তোলে

রেড-টিম টেস্টিং—একটি সিস্টেমকে ইচ্ছাকৃতভাবে ভেঙে ফেলা বা হাইজ্যাক করার চেষ্টা করা—ঐতিহ্যগতভাবে নিরাপত্তা বিশেষজ্ঞদের ওপর নির্ভরশীল ছিল। যেহেতু LLM-গুলো এখন ওয়েব ব্রাউজ করা, কোড চালানো এবং থার্ড-পার্টি সার্ভিস ব্যবহার করতে শিখছে, তাই এগুলোকে অপব্যবহার করার উপায়গুলো একটি মানব দল অন্বেষণ করার গতির চেয়েও দ্রুত বৃদ্ধি পাচ্ছে।

OpenAI এর উত্তরে একটি “self-play loop” নিয়ে এসেছে, যেখানে গবেষকরা একটি সিমুলেটেড পরিবেশ (যাকে তারা dojo বলেন) এর মধ্যে একটি মডেলের একটি কপিকে অন্যটির বিরুদ্ধে লড়তে দেওয়া হয়। এই স্যান্ডবক্সে, GPT-Red আক্রমণকারীর ভূমিকা পালন করে, অন্যদিকে এক বা একাধিক ডিফেন্ডার মডেল তা প্রতিরোধ করার চেষ্টা করে। উভয় পক্ষ অসংখ্য রাউন্ড সম্পন্ন করে; প্রতিটি ইটারেশন আক্রমণকারীকে আরও সূক্ষ্ম ত্রুটি খুঁজে বের করতে এবং ডিফেন্ডারকে নতুন প্রতিরক্ষা ব্যবস্থা শিখতে বাধ্য করে। OpenAI এই প্রক্রিয়াটিকে GPT-5.6 তৈরির ট্রেনিং পাইপলাইনে অন্তর্ভুক্ত করেছে, যাকে কোম্পানিটি তাদের এযাবৎকালের সবচেয়ে শক্তিশালী রিলিজ হিসেবে দাবি করছে।

আক্রমণের একটি নতুন ধরন: ফেক চেইন অফ থট (fake chain of thought)

এই self-play প্রক্রিয়ার মাধ্যমে একটি চমকপ্রদ “fake chain of thought” আক্রমণের কথা প্রকাশ পেয়েছে। LLM-গুলো প্রায়শই ধাপে ধাপে যুক্তির একটি ধারা বা “chain of thought” প্রদান করে, যা চূড়ান্ত উত্তরের পথ নির্দেশ করে। GPT-Red সেই ধারার মধ্যে ভুয়া তথ্য বা এন্ট্রি যুক্ত করতে শিখেছে, যার ফলে মডেলটি মনে করে যে এটি ইতিমধ্যে ভুল তথ্য যাচাই করে নিয়েছে। উদাহরণস্বরূপ, আক্রমণকারী মডেলটিকে বিশ্বাস করাতে পারে যে “1 + 1 = 3” যাচাই করা হয়েছে, যা সিস্টেমটিকে সেই কাল্পনিক ফলাফলের ওপর ভিত্তি করে আউটপুট তৈরি করতে প্ররোচিত করে।

এই আক্রমণটি শুধুমাত্র টেক্সট জেনারেটরের মধ্যেই সীমাবদ্ধ নয়। একটি এক্সটার্নাল ল্যাব দ্বারা তৈরি ভেন্ডিং-মেশিন স্টাইল এজেন্ট “Vendy”-এর বিরুদ্ধে পরীক্ষায় দেখা গেছে যে, GPT-Red মূল্যের ঘরগুলো (price fields) পরিবর্তন করতে এবং অর্ডার বাতিল করতে সক্ষম হয়েছে। এটি প্রমাণ করে যে, ব্যবহারকারীর কমান্ড অনুযায়ী কাজ করে এমন বিশেষায়িত এজেন্টগুলোর বিরুদ্ধেও এই কৌশলটি কার্যকর।

পরিমাপযোগ্য নিরাপত্তা বৃদ্ধি

OpenAI কিছু পরিসংখ্যান প্রকাশ করেছে যা GPT-Red-এর বিরুদ্ধে প্রশিক্ষণের প্রভাব দেখায়। যখন নতুন মডেল দ্বারা তৈরি সবচেয়ে শক্তিশালী আক্রমণগুলো আগস্টে মুক্তি পাওয়া GPT-5-এর বিরুদ্ধে চালানো হয়েছিল, তখন ৯০%-এর বেশি আক্রমণ সফল হয়েছিল। কিন্তু GPT-5.6-এর বিরুদ্ধে একই আক্রমণগুলোর সাফল্যের হার ছিল ২৩%-এর কম।

২০২৫ সালের একটি পরীক্ষায় GPT-Red-কে মানুষের তৈরি রেড-টিমারদের বিরুদ্ধে লড়ানো হয়েছিল; সেখানে দেখা গেছে যে AI মানুষের চেয়েও অনেক বেশি দক্ষতার সাথে আক্রমণের বিভিন্ন ধরন খুঁজে বের করতে এবং উন্নত করতে সক্ষম। এটি ইঙ্গিত দেয় যে, একটি অ্যাডভারসারিয়াল মডেল অনেক কম সময়ে দুর্বলতার বিশাল ক্ষেত্র অন্বেষণ করতে পারে।

সীমাবদ্ধতা এবং মানুষের দক্ষতার নিরন্তর প্রয়োজন

GPT-Red মানুষের তৈরি নিরাপত্তা বিশ্লেষকদের বিকল্প নয়। এটি এখনও মাল্টি-টার্ন কনভারসেশনাল অ্যাটাক (যেখানে আক্রমণকারী বেশ কয়েকটি কথোপকথনের মাধ্যমে একটি প্রেক্ষাপট তৈরি করে) এবং ভিজ্যুয়াল প্রম্পট ইনজেকশন (যেখানে ছবির ভেতরে ক্ষতিকারক টেক্সট লুকিয়ে রাখা হয়) মোকাবিলা করতে হিমশিম খায়। OpenAI এই মডেলটিকে প্রথম স্তরের অনুসন্ধানকারী (first-line probe) হিসেবে ব্যবহার করার পরিকল্পনা করছে, যা সম্ভাব্য আক্রমণের ধারণাগুলো সামনে আনবে যাতে মানব বিশেষজ্ঞরা সেগুলো আরও গভীরভাবে তদন্ত ও সম্প্রসারণ করতে পারেন।

এই টুলটি এখনও মালিকানাধীন (proprietary), তাই বাইরের গবেষকরা সরাসরি এর সক্ষমতা পরীক্ষা করতে বা রিপোর্ট করা ফলাফলগুলো যাচাই করতে পারবেন না।