PIVOT, স্পার্স-অ্যাটেনশন মডেলের জন্য একটি নতুন ইনফারেন্স-টাইম কৌশল, মডেলের ওয়েটস পরিবর্তন না করেই ইনডেক্সার খরচ চারগুণ পর্যন্ত কমায় এবং সামগ্রিক ল্যাটেন্সি প্রায় ১.৬ গুণ হ্রাস করে। এটি কুয়েরিগুলোকে গ্রুপ করার মাধ্যমে এবং একটি মাত্র "প্রক্সি" কুয়েরিকে মূল কাজ করতে দিয়ে কাজ করে।
কেন স্পার্স অ্যাটেনশন ১০০ কে (100 K) টোকেনে থমকে যায়
স্পার্স অ্যাটেনশনের লক্ষ্য ছিল ট্রান্সফর্মারগুলোকে খুব দীর্ঘ সিকোয়েন্স—যেমন ১০০ কে টোকেন বা তার বেশি—দেখতে সাহায্য করা এবং একই সাথে কম্পিউট খরচ সাশ্রয়ী রাখা। বাস্তবে, সিকোয়েন্স যখন কয়েক হাজার টোকেনের বেশি হয়ে যায়, তখন কাঙ্ক্ষিত গতি বৃদ্ধির প্রতিশ্রুতি ম্লান হয়ে যায়। এর মূল কারণ হলো ইনডেক্সার, যা কোন টোকেনগুলো স্পার্স প্যাটার্নের অন্তর্ভুক্ত হবে তা নির্ধারণ করতে প্রতিটি কুয়েরির বিপরীতে প্রতিটি টোকেনকে স্কোর করে। এর কাজের পরিধি $O(L^2)$ (L = সিকোয়েন্স দৈর্ঘ্য) হিসেবে বৃদ্ধি পায়, তাই ১০০ কে টোকেনের ক্ষেত্রে ইনডেক্সার একাই রানটাইমের সিংহভাগ দখল করে নেয় এবং স্পার্সিটি থেকে প্রাপ্ত যেকোনো সুবিধা নষ্ট করে দেয়।
PIVOT-এর পেছনের দুটি পর্যবেক্ষণ
গবেষকরা দেখেছেন যে পার্শ্ববর্তী কুয়েরিগুলো প্রায় সব সময় একই টপ-k টোকেন বেছে নেয়—প্রায় ৯০% ওভারল্যাপ থাকে। এর মানে হলো, একটি মাত্র প্রতিনিধি কুয়েরি পুরো প্রতিবেশী কুয়েরিগুলোর ব্যাচের পরিবর্তে কাজ করতে পারে এবং তবুও একটি কার্যকর ক্যান্ডিডেট সেট খুঁজে পেতে পারে। PIVOT এই সুযোগটি গ্রহণ করে এভাবে:
- একটি নির্দিষ্ট সংখ্যক ধারাবাহিক কুয়েরিকে গ্রুপ করা (সাইজ g)।
- একটি প্রক্সি কুয়েরি তৈরি করতে গ্রুপটিকে গড় (average) করা।
- প্রতিটি মূল কুয়েরির জন্য আলাদাভাবে না চালিয়ে প্রক্সির ওপর একবার ইনডেক্সার চালানো।
- গ্রুপের প্রতিটি সদস্যের জন্য প্রক্সির ক্যান্ডিডেট লিস্টকে পরিমার্জিত (refining) করা।
গাণিতিক জটিলতা $O(L^2)$ থেকে কমে $O(L^2 / g)$ হয়ে যায়। আটটি সদস্যের একটি গ্রুপ সাইজ হলে, ইনডেক্সারকে আট গুণ কম ফুল স্ক্যান করতে হয়।
দুটি অপারেটিং মোড
- PIVOT-Refine ডেন্স ইনডেক্সারের নির্ভুলতা বজায় রাখে এবং ইনডেক্সার পর্যায়ে প্রায় তিনগুণ গতি বৃদ্ধি করে।
- PIVOT-Reuse গতিকে আরও বাড়িয়ে দেয়, তবে সর্বোচ্চ থ্রুপুট লাভের জন্য সামান্য নির্ভুলতা বিসর্জন দেয়।
DeepSeek-V3.2 এবং GLM-5.1 মডেলের বেঞ্চমার্কগুলো দেখায় যে, ইনফারেন্সের সময় PIVOT প্রয়োগ করলে ইনডেক্সারের গতি ধারাবাহিকভাবে চারগুণ বৃদ্ধি পায় এবং এন্ড-টু-এন্ড ল্যাটেন্সি ১.৬ গুণ হ্রাস পায়।
প্লাগ-অ্যান্ড-প্লে ইমপ্লিমেন্টেশন
এই কৌশলটি একটি রেফারেন্স ইমপ্লিমেন্টেশন হিসেবে এসেছে যা যেকোনো বিদ্যমান Dynamic Sparse Attention (DSA) পাইপলাইনে যুক্ত করা সম্ভব। এতে কোনো ওয়েট পরিবর্তনের প্রয়োজন হয় না, তাই স্ট্যান্ডার্ড স্পার্স-অ্যাটেনশন পদ্ধতিতে প্রশিক্ষিত মডেলগুলো অপরিবর্তিত অবস্থায় কাজ করে। একমাত্র caveat বা শর্ত হলো, রেফারেন্স কোডটি জেনেরিক GPU কার্নেলে চলে; পূর্ণ গতি পেতে প্রোডাকশন ডিপ্লয়মেন্টের জন্য হ্যান্ড-টিউনড Triton বা CUDA কার্নেলের প্রয়োজন হবে।
ট্রেড-অফগুলো কেমন
PIVOT-Reuse-এর গতির সুবিধার সাথে অ্যাটেনশন কোয়ালিটির সামান্য হ্রাস ঘটে, যা সঠিক টোকেন নির্বাচনের প্রতি অত্যন্ত সংবেদনশীল কাজের ক্ষেত্রে গুরুত্বপূর্ণ হতে পারে। টিমগুলোকে তাদের ল্যাটেন্সি বাজেটের বিপরীতে এই ক্ষতির বিষয়টি বিবেচনা করতে হবে। উপরন্তু, কাস্টম কার্নেলের প্রয়োজনীয়তা সেই সব প্রতিষ্ঠানের জন্য ইঞ্জিনিয়ারিং ওভারহেড বাড়িয়ে দেয় যাদের GPU-কার্নেল বিষয়ে বিশেষ দক্ষতা নেই।
পরবর্তী লক্ষ্য
PIVOT দেখায় যে কাজের একটি বুদ্ধিদীপ্ত পুনর্বিন্যাস—কুয়েরিগুলোকে গ্রুপ করা এবং একটি প্রক্সি স্ক্যান শেয়ার করা—প্রকৃত দীর্ঘ কনটেক্সটের জন্য স্পার্স অ্যাটেনশনের প্রতিশ্রুতি ফিরিয়ে আনতে পারে, যা পুনরায় প্রশিক্ষণের খরচ ছাড়াই দৃশ্যমান গতি বৃদ্ধি প্রদান করে।
