টেমপ্লেট টোকেন হেড প্রুনিং (Head Pruning) সক্ষম করে

টেমপ্লেট টোকেন গবেষকদের পুনরায় প্রশিক্ষণ (retraining) ছাড়াই একটি ডিফিউশন ট্রান্সফরমারের (diffusion transformer) কাজের প্রায় এক-পঞ্চমাংশ কমিয়ে আনতে সাহায্য করে; এতে গুণমানের (quality) কোনো উল্লেখযোগ্য পরিবর্তন হয় না।

একটি নতুন গবেষণায় দেখা গেছে যে নির্দিষ্ট কিছু টোকেন 'সিম্যান্টিক রেজিস্টার' (semantic registers) হিসেবে কাজ করে—এগুলো হলো ছোট "সিঙ্ক" (sinks) যা প্রম্পট থেকে তথ্য সংগ্রহ করে রাখে। কোন অ্যাটেনশন হেডগুলো (attention heads) এই রেজিস্টারগুলোর ওপর সবচেয়ে বেশি মনোযোগ দেয় তা ট্র্যাক করার মাধ্যমে, গবেষকরা সেই হেডগুলো বাদ দিয়ে দেন, যা মডেলের অ্যাটেনশন FLOPs প্রায় ২০% কমিয়ে দেয়, অথচ GenEval বেঞ্চমার্কে স্কোর মাত্র ১.৪ পয়েন্ট কমে।

ডিফিউশন মডেলের জন্য প্রুনিং (pruning) কেন গুরুত্বপূর্ণ

ডিফিউশন ট্রান্সফরমারগুলো অনেক টেক্সট-টু-ইমেজ (text-to-image) জেনারেটরকে চালিত করে। ইনফারেন্সের (inference) সময় এদের অ্যাটেনশন লেয়ারগুলো কম্পিউট বাজেটের সিংহভাগ দখল করে থাকে, তাই সামান্য হ্রাসও ইমেজ জেনারেশন দ্রুত করতে এবং শক্তির ব্যবহার কমাতে পারে। প্রচলিত প্রুনিং কৌশলগুলো সাধারণত ওয়েট ম্যাগনিটিউড (weight magnitude) বা গ্রেডিয়েন্ট সিগন্যাল পরীক্ষা করে, যেখানে ধরে নেওয়া হয় যে প্রতিটি হেড সমানভাবে অবদান রাখে। এই ঢালাও পদ্ধতিটি হয় অনেক কাজ অপরিবর্তিত রেখে দেয়, অথবা অতিরিক্ত হেড সরিয়ে ফেললে আউটপুট কোয়ালিটির ক্ষতি করে।

টেমপ্লেট-টোকেন ট্রিক (The template-token trick)

গবেষকরা লক্ষ্য করেছেন যে অল্প কিছু টোকেন টেক্সট প্রম্পট থেকে ধারাবাহিকভাবে অবজেক্ট-লেভেল সংকেত (object-level cues) সংগ্রহ করে। এই "টেমপ্লেট টোকেনগুলো" ডেডিকেটেড রেজিস্টারের মতো আচরণ করে: তারা প্রম্পটের সিম্যান্টিকস (semantics) শোষণ করে এবং পরবর্তী ধাপে পাঠিয়ে দেয়, যখন মডেলের বাকি অংশ ভিজ্যুয়াল ডিটেইলস প্রসেস করা চালিয়ে যায়।

প্রুনিং পাইপলাইনটি বেশ সহজ:

  1. কয়েকটি প্রম্পটের ওপর একটি ফরওয়ার্ড পাস (forward pass) চালান এবং অ্যাটেনশন স্কোর রেকর্ড করুন।
  2. সেই হেডগুলো শনাক্ত করুন যাদের সবচেয়ে শক্তিশালী সংযোগ টেমপ্লেট টোকেনগুলোর দিকে নির্দেশ করে।
  3. মডেল থেকে সেই হেডগুলো সরিয়ে ফেলুন; এর জন্য অতিরিক্ত ডেটা, ফাইন-টিউনিং বা আর্কিটেকচারাল পরিবর্তনের প্রয়োজন নেই।

যেহেতু সরিয়ে ফেলা হেডগুলো মূলত সেই একই প্রম্পট তথ্য সরবরাহ করত যা টেমপ্লেট টোকেনগুলো ইতিমধ্যে ধারণ করে আছে, তাই সামগ্রিক সিগন্যাল প্রবাহ অক্ষুণ্ণ থাকে।

পরিসংখ্যান যা নিজেই কথা বলে

স্ট্যান্ডার্ড টেক্সট-টু-ইমেজ ডিফিউশন ট্রান্সফরমারগুলোতে এই পদ্ধতি প্রয়োগ করলে পাওয়া যায়:

  • অ্যাটেনশন FLOPs-এ ≈ ২০% হ্রাস, যা সরাসরি ইনফারেন্সের গতি বাড়ায়।
  • GenEval স্কোরে মাত্র ১.৪ পয়েন্ট হ্রাস, যা কম্পিউট গেইনের তুলনায় সামান্যতম পরিবর্তন।
  • ভিজ্যুয়াল ফিডেলিটি (visual fidelity) অনেকটা অপরিবর্তিত রেখে ২০%-৩০% হেড প্রুনিং করার ক্ষমতা।

এর বিপরীতে, সাধারণ হেড-পার্সেন্টেজ কাট (head-percentage cuts) প্রায়ই গুণমানের বড় ধরনের অবনতি ঘটায়, কারণ সেগুলো নির্বিচারে প্রয়োজনীয় কনটেক্সট-মিক্সিং পাথওয়েগুলোকে (context-mixing pathways) বাদ দিয়ে দেয়।

সীমাবদ্ধতা এবং অমীমাংসিত প্রশ্নসমূহ

এই কাজটি শুধুমাত্র সেই ডিফিউশন ট্রান্সফরমারগুলোর ওপর আলোকপাত করে যা টেক্সট প্রম্পটকে ইমেজে রূপান্তর করে। বড় ল্যাঙ্গুয়েজ মডেল (LLM) বা অন্যান্য মাল্টিমোডাল আর্কিটেকচারে একই টেমপ্লেট-টোকেন ঘটনাটি ঘটে কি না তা এখনও অস্পষ্ট। যদি রেজিস্টারগুলো অনুপস্থিত থাকে বা ভিন্নভাবে আচরণ করে, তবে এই প্রুনিং পদ্ধতিটি তার কার্যকারিতা হারাতে পারে।

সতর্কতার আরেকটি বিষয় হলো গুণমানের সামান্য হ্রাস।

পরবর্তী লক্ষ্য

ভবিষ্যৎ গবেষণা সম্ভবত খতিয়ে দেখবে:

  • অন্যান্য ট্রান্সফরমার ফ্যামিলিতে টেমপ্লেট টোকেনগুলো স্বাভাবিকভাবে উদ্ভূত হয় কি না।
  • মডেলের আকার এবং ট্রেনিং ডেটার পরিমাণের সাথে এই পদ্ধতিটি কতটা কার্যকরভাবে স্কেল করা যায়।

সারকথা: টেমপ্লেট টোকেনগুলোকে সিম্যান্টিক রেজিস্টার হিসেবে ব্যবহার করে গবেষকরা ডিফিউশন ট্রান্সফরমারগুলোকে ছাঁটাই করার একটি সুনির্দিষ্ট (surgical) উপায় খুঁজে পেয়েছেন—যা আউটপুট কোয়ালিটি প্রায় অক্ষুণ্ণ রেখে কাজের প্রায় এক-পঞ্চমাংশ কমিয়ে দেয়। এটি ব্যয়বহুল রিট্রেনিং ছাড়াই এআই-জেনারেটেড ইমেজগুলোকে দ্রুততর এবং সাশ্রয়ী করে তুলতে পারে।