ক্লডের (Claude) স্বয়ংক্রিয় প্রোটিন-বাইন্ডার ক্যাম্পেইন একটি ২৭% হিট রেট নথিভুক্ত করেছে, যা মানুষের দ্বারা পরিচালিত ল্যাবগুলোর সাধারণ ১০-১৫% হিট রেটকে ছাড়িয়ে গেছে এবং একই টার্গেটের ওপর সমান্তরাল মানুষের প্রচেষ্টাকেও পেছনে ফেলে দিয়েছে। এই ফলাফলটি দেখায় যে, একটি বিশাল এবং সুনিপুণভাবে তৈরি করা প্রম্পট একটি ল্যাঙ্গুয়েজ মডেলকে একটি ভার্চুয়াল বায়োটেক ওয়ার্কফ্লোতে রূপান্তরিত করতে পারে, তবে এটি এটিও তুলে ধরে যে মডেলের কনফিডেন্স মেট্রিক্স (confidence metrics) ভুল হলে সেই পদ্ধতিটি কতটা ভঙ্গুর হয়ে পড়ে।

সংখ্যায় পরীক্ষাটি

Anthropic তাদের Claude মডেলকে একটি পূর্ণাঙ্গ প্রোটিন ডিজাইন প্রোটোকল এবং একটি নির্দিষ্ট GPU বাজেট দিয়েছিল, তারপর ১৬টি প্রোটিন টার্গেটের ওপর একটি এন্ড-টু-এন্ড ক্যাম্পেইন চালানোর সুযোগ দেয়। ল্যাব-সাইড ব্যর্থতার কারণে একটি টার্গেট বাদ দেওয়া হয়, ফলে ১৫টি কার্যকর ক্যাম্পেইন অবশিষ্ট থাকে। সেখান থেকে Claude ১,৩২০টি সম্ভাব্য সিকোয়েন্স তৈরি করেছিল; ল্যাবরেটরি পরীক্ষা ৩৫৪টিকে প্রকৃত বাইন্ডার হিসেবে নিশ্চিত করেছে, যার ফলে সাফল্যের হার দাঁড়ায় ২৬.৮%।

তুলনার জন্য বলা যায়, মানুষের নেতৃত্বে পরিচালিত বেশিরভাগ বাইন্ডার প্রজেক্ট ১০% থেকে ১৫% হিট রেট রিপোর্ট করে। RBX1 টার্গেটের ওপর সরাসরি মুখোমুখি লড়াইয়ে, মানুষের অংশগ্রহণকারীরা ৩.৭% হিট রেট অর্জন করেছে যেখানে Claude-এর ডিজাইনগুলো পেয়েছে ৩১.১%। মডেলটি সেলফ-র‍্যাঙ্কিং (self-ranking) করতেও সক্ষম প্রমাণিত হয়েছে: Claude তার সেরা হিসেবে চিহ্নিত করা একটি ডিজাইন থেকে ৪৯% ক্ষেত্রে সফল হয়েছে এবং শীর্ষ দশটি ডিজাইন ৩৯% ক্ষেত্রে সফল হয়েছে।

যেখানে সিস্টেমটি ব্যর্থ হয়েছে

এই সংখ্যাগুলোর আড়ালে দুটি বড় ধরনের অন্ধবিন্দু (blind spots) রয়েছে। MBP টার্গেটে Claude সম্পূর্ণ ব্যর্থ হয়েছে এবং TNFα টার্গেটে খারাপ ফলাফল করেছে, তবুও সেই রানগুলোর জন্য এর অভ্যন্তরীণ কনফিডেন্স স্কোর ছিল উচ্চ। অন্য কথায়, মডেলটি নিশ্চিত ছিল যে এটি সফল হচ্ছে, অথচ ওয়েট-ল্যাব (wet-lab) ফলাফল ভিন্ন কথা বলছে। এই ভুলভাবে ক্যালিব্রেট করা সংকেতগুলো একটি ঝুঁকি প্রকাশ করে: একটি স্বয়ংক্রিয় পাইপলাইন যা তার নিজস্ব মেট্রিক্সের ওপর অতিরিক্ত আস্থা রাখে, তা অকার্যকর বা মৃতপ্রায় পরীক্ষায় সম্পদ অপচয় করতে পারে।

প্রম্পট ইঞ্জিনিয়ারিং: নতুন ল্যাব নোটবুক হিসেবে

এই গবেষণার সবচেয়ে চমকপ্রদ দিকটি জীববিজ্ঞান নয়, বরং এটি চালিত করা প্রম্পটটি। একজন সিনিয়র বিজ্ঞানী সাধারণত কোন প্রোটিন অঞ্চলগুলো অন্বেষণ করতে হবে, কোন কম্পিউটেশনাল টুল ব্যবহার করতে হবে এবং কীভাবে কম্পিউট টাইম বরাদ্দ করতে হবে তা নির্ধারণ করতে কয়েক সপ্তাহ ব্যয় করেন। Anthropic সেই দক্ষতাগুলোকে একটি ১৬,০০০ শব্দের প্রম্পটে সংকুচিত করেছে—যা মোটামুটি একটি ছোট উপন্যাসের দৈর্ঘ্যের সমান। টেক্সটের প্রায় দুই-তৃতীয়াংশ অপারেশনাল বিষয় নিয়ে ছিল: সময় নির্ধারণ, বাজেট মনিটরিং এবং এক্সটার্নাল সফটওয়্যার কল করার জন্য সাব-এজেন্টদের সমন্বয় করা।

Claude RFdiffusion (একটি ডিফিউশন-ভিত্তিক স্ট্রাকচার জেনারেটর) এবং ProteinMPNN (একটি সিকোয়েন্স ডিজাইন নেটওয়ার্ক)-এর মতো ওপেন-সোর্স ডিজাইন ইঞ্জিনগুলোকে কল করেছিল। ল্যাঙ্গুয়েজ মডেলটি একটি শিডিউলার হিসেবে কাজ করেছে, যা এই টুলগুলোর মধ্যে মধ্যবর্তী ফলাফল প্রদান করা, প্যারামিটার সমন্বয় করা এবং কখন একটি ডিজাইন সাইকেল বন্ধ করতে হবে তা নির্ধারণ করে। কার্যত, প্রম্পটটি একটি ভার্চুয়াল ল্যাবরেটরি ম্যানেজার হয়ে উঠেছিল, যা মানুষের কাজের সমন্বয় করার ক্ষুদ্র ক্ষুদ্র ঝামেলা থেকে বিজ্ঞানীদের মুক্তি দিয়েছে।

বাইন্ডারগুলো আসলে কী

নিশ্চিত হওয়া ৩৫৪টি হিট-ই সবই এমন অণু যা শারীরিকভাবে তাদের টার্গেট প্রোটিনের সাথে যুক্ত হয়। গবেষণাপত্রটি বাইন্ডিং অ্যাসে (binding assays) রিপোর্ট করলেও কোনো ফাংশনাল ডেটা প্রদান করেনি—অর্থাৎ কোনো বাইন্ডার কার্যকারিতা পরিবর্তন করে, কনফরমেশন স্থিতিশীল করে বা থেরাপিউটিক সম্ভাবনা প্রদর্শন করে তার কোনো প্রমাণ নেই। একইভাবে, স্ট্রাকচারাল ভ্যালিডেশন (যেমন, X-ray crystallography বা cryo-EM) অনুপস্থিত, তাই সঠিক বাইন্ডিং মোডটি এখনও অনুমাননির্ভর। অতএব, এই ক্যাম্পেইনটি দ্রুত বাইন্ডার আবিষ্কারের একটি প্রুফ-অফ-কনসেপ্ট প্রদর্শন করে, কোনো ড্রাগ ক্যান্ডিডেট সরবরাহকারী পাইপলাইন নয়।

বায়োটেক এবং এআই গবেষণার জন্য গুরুত্ব

যদি প্রম্পট-চালিত মডেলটি নির্ভরযোগ্যভাবে মানুষের হিট রেট পুনরায় তৈরি করতে পারে বা ছাড়িয়ে যেতে পারে, তবে বায়োটেক কোম্পানিগুলো প্রাথমিক পর্যায়ের আবিষ্কারের খরচ এবং সময় কমিয়ে আনতে পারে। তবে, MBP এবং TNFα-এর ভুল কনফিডেন্স স্কোরগুলো চিত্রিত করে যে, একটি সম্পূর্ণ স্বয়ংক্রিয় বা 'হ্যান্ডস-অফ' সিস্টেম এখনও উৎপাদনের জন্য প্রস্তুত নয়। কনফিডেন্স মেট্রিক্স ব্যাখ্যা করতে এবং ফাংশনাল প্রাসঙ্গিকতা যাচাই করতে কোম্পানিগুলোর এখনও মানুষের তত্ত্বাবধান প্রয়োজন হবে।

এআই (AI) দৃষ্টিকোণ থেকে, এই কাজটি "টুল" এবং "এজেন্ট"-এর মধ্যকার সীমারেখা অস্পষ্ট করে দেয়। Claude কোনো নতুন প্রোটিন-ডিজাইন অ্যালগরিদম নয়; এটি একটি সাধারণ উদ্দেশ্যমূলক ল্যাঙ্গুয়েজ মডেল যা পর্যাপ্ত বিস্তারিত নির্দেশাবলী পেলে বিদ্যমান বিশেষায়িত টুলগুলোকে পরিচালনা করতে পারে। এই পরীক্ষাটি এমন একটি ভবিষ্যতের ইঙ্গিত দেয় যেখানে এআই কোনো একক উপাদানকে প্রতিস্থাপন করার পরিবর্তে ওপেন-সোর্স বৈজ্ঞানিক সফটওয়্যারের একটি মডুলার ইকোসিস্টেমকে একত্রে যুক্ত করার আঠা (glue) হিসেবে কাজ করবে।

পাল্টা যুক্তি: প্রম্পট জটিলতার লুকানো খরচ

যদিও এই গবেষণাটি ১৬,০০০ শব্দের প্রম্পটকে জ্ঞান আহরণের সাফল্য হিসেবে প্রচার করছে, তবে প্রম্পটের এই বিশাল আকার কিছু ব্যবহারিক উদ্বেগ সৃষ্টি করে। এই ধরনের একটি নথি তৈরি করতে গভীর ডোমেইন জ্ঞান, অন্তর্নিহিত টুলগুলোর সাথে পরিচিতি এবং এজ কেসগুলো (edge cases) অনুমান করার ক্ষমতা প্রয়োজন। অন্য কথায়, দক্ষতা হারিয়ে যায়নি—এটি ল্যাবরেটরির বিজ্ঞানীদের কাছ থেকে প্রম্পট ইঞ্জিনিয়ারদের কাছে স্থানান্তরিত হয়েছে।

অধিকন্তু, একটি নির্দিষ্ট GPU বাজেটের ওপর নির্ভরতা অনুসন্ধানের গভীরতার ওপর একটি কঠোর সীমাবদ্ধতা আরোপ করে। মানব দলগুলো অন্তর্বর্তীকালীন ফলাফলের ভিত্তিতে গতিশীলভাবে সম্পদ পুনর্নির্ধারণ করতে পারে, যেখানে Claude-এর ক্যাম্পেইন একটি পূর্বনির্ধারিত বাজেট মেনে চলেছিল, যা সম্ভাব্যভাবে নমুনা হিসেবে নেওয়া সিকোয়েন্স স্পেসের ব্যাপ্তিকে সীমিত করেছে।

পরবর্তীতে যা লক্ষ্য রাখা প্রয়োজন

Anthropic-এর পেপারটি বেশ কিছু প্রশ্ন উন্মুক্ত রেখে গেছে। ভবিষ্যতের কাজে কনফিডেন্স ক্যালিব্রেশনের বিষয়টি সমাধান করতে হবে যাতে মডেলের স্ব-মূল্যায়ন পরীক্ষামূলক ফলাফলের সাথে সামঞ্জস্যপূর্ণ হয়। ফাংশনাল অ্যাসে—যেমন এনজাইমেটিক ইনহিবিশন বা কোষীয় কার্যকলাপ—স্বায়ত্তশাসিত লুপের সাথে যুক্ত করা হলে এই প্রযুক্তিটি কেবল বাইন্ডার শনাক্তকরণের পরিবর্তে ওষুধ আবিষ্কারের আরও কাছাকাছি পৌঁছে যাবে। পরিশেষে, বিস্তৃত লক্ষ্যবস্তু এবং বিভিন্ন বাজেটের পরিস্থিতিতে এই পদ্ধতির বেঞ্চমার্কিং করলে বোঝা যাবে যে, পর্যবেক্ষিত হিট রেটটি কি পুনরুৎপাদনযোগ্য নাকি এটি কেবল একটি ব্যতিক্রমী ঘটনা।

সারকথাটি স্পষ্ট: বিস্তারিত প্রম্পট অর্কেস্ট্রেশন একটি ল্যাঙ্গুয়েজ মডেলকে একটি ভার্চুয়াল বায়োটেক ল্যাবে পরিণত করতে পারে, যা মানুষের গড় হারের চেয়েও বেশি বাইন্ডার হিট রেট প্রদান করতে সক্ষম। তবুও, এই পদ্ধতিটি এখনও বিশেষজ্ঞ প্রম্পট লেখকের দক্ষতার ওপর নির্ভরশীল এবং কনফিডেন্সের ত্রুটির কারণে ক্ষতিগ্রস্ত হতে পারে, যা ব্যয়বহুল পরীক্ষাগুলোকে বিচ্যুত করতে পারে। কমিউনিটি যখন এই পাইপলাইনগুলোকে আরও উন্নত করবে, তখন AI-এর স্বায়ত্তশাসন এবং মানুষের তত্ত্বাবধানের মধ্যে ভারসাম্যই নির্ধারণ করবে যে এই ধরনের সিস্টেমগুলো নিত্যপ্রয়োজনীয় সরঞ্জাম হিসেবে প্রতিষ্ঠিত হবে নাকি কেবল পরীক্ষামূলক কৌতূহল হিসেবে থেকে যাবে।