ٹیمپلیٹ ٹوکنز ہیڈ پروننگ (Head Pruning) کو ممکن بناتے ہیں
ٹیمپلیٹ ٹوکنز محققین کو دوبارہ تربیت (retraining) کے بغیر ڈفیوژن ٹرانسفارمر کے کام میں تقریباً پانچواں حصہ کم کرنے کی اجازت دیتے ہیں؛ معیار میں ہونے والی کمی بمشکل محسوس ہوتی ہے۔
ایک نئی تحقیق سے پتہ چلتا ہے کہ مخصوص ٹوکنز 'سیمنٹک رجسٹرز' (semantic registers) کے طور پر کام کرتے ہیں—یعنی چھوٹے "سنکس" (sinks) جو پرامپٹ سے معلومات جمع کرتے ہیں۔ یہ ٹریک کرتے ہوئے کہ کون سے اٹینشن ہیڈز (attention heads) ان رجسٹرز پر سب سے زیادہ توجہ مرکوز کرتے ہیں، مصنفین ان ہیڈز کو نکال دیتے ہیں، جس سے ماڈل کے اٹینشن FLOPs میں تقریباً 20% کی کمی آتی ہے جبکہ GenEval بینچ مارک میں صرف 1.4 پوائنٹس کی کمی آتی ہے۔
ڈفیوژن ماڈلز کے لیے پروننگ کیوں اہم ہے
ڈفیوژن ٹرانسفارمرز بہت سے ٹیکسٹ-ٹو-امیج (text-to-image) جنریٹرز کو طاقت فراہم کرتے ہیں۔ ان کے اٹینشن لیئرز انفرنس (inference) کے دوران کمپیوٹ بجٹ پر غالب ہوتے ہیں، اس لیے معمولی سی کمی بھی امیج جنریشن کی رفتار بڑھا سکتی ہے اور توانائی کے استعمال کو کم کر سکتی ہے۔ موجودہ پروننگ تکنیکیں عام طور پر ویٹ میگنیٹیوڈ (weight magnitude) یا گریڈینٹ سگنلز کا جائزہ لیتی ہیں، یہ فرض کرتے ہوئے کہ ہر ہیڈ برابر حصہ ڈالتا ہے۔ یہ عمومی طریقہ یا تو بہت زیادہ کام کو غیر تبدیل شدہ چھوڑ دیتا ہے یا بہت زیادہ ہیڈز نکالنے پر آؤٹ پٹ کے معیار کو نقصان پہنچاتا ہے۔
ٹیمپلیٹ-ٹوکن ٹرک
محققین نے مشاہدہ کیا کہ چند ٹوکنز مستقل طور پر ٹیکسٹ پرامپٹ سے آبجیکٹ لیول کے اشارے (cues) جمع کرتے ہیں۔ یہ "ٹیمپلیٹ ٹوکنز" مخصوص رجسٹرز کی طرح کام کرتے ہیں: وہ پرامپٹ کے معنی (semantics) کو جذب کرتے ہیں اور انہیں آگے منتقل کرتے ہیں جبکہ ماڈل کا باقی حصہ بصری تفصیلات (visual details) پر عمل درآمد جاری رکھتا ہے۔
پروننگ کا طریقہ کار سادہ ہے:
- چند پرامپٹس پر فارورڈ پاس (forward pass) چلائیں اور اٹینشن اسکورز ریکارڈ کریں۔
- ان ہیڈز کی نشاندہی کریں جن کے مضبوط ترین رابطے ٹیمپلیٹ ٹوکنز کی طرف اشارہ کرتے ہیں۔
- ماڈل سے ان ہیڈز کو نکال دیں؛ اس کے لیے کسی اضافی ڈیٹا، فائن ٹیوننگ یا آرکیٹیکچرل تبدیلیوں کی ضرورت نہیں ہے۔
چونکہ نکالے گئے ہیڈز بنیادی طور پر وہی پرامپٹ معلومات منتقل کر رہے تھے جو ٹیمپلیٹ ٹوکنز پہلے سے ہی رکھتے ہیں، اس لیے مجموعی سگنل فلو برقرار رہتا ہے۔
اعداد و شمار جو خود بولتے ہیں
اس طریقہ کار کو معیاری ٹیکسٹ-ٹو-امیج ڈفیوژن ٹرانسفارمرز پر لاگو کرنے سے درج ذیل نتائج حاصل ہوتے ہیں:
- اٹینشن FLOPs میں ≈ 20% کمی، جو براہ راست انفرنس کی رفتار بڑھاتی ہے۔
- GenEval اسکور میں صرف 1.4 پوائنٹس کی کمی، جو کمپیوٹ کے فائدے کے مقابلے میں معمولی سی کمی ہے۔
- بصری وفاداری (visual fidelity) کو کافی حد تک برقرار رکھتے ہوئے 20% سے 30% ہیڈز کو پرون کرنے کی صلاحیت۔
اس کے برعکس، سادہ ہیڈ فیصد کٹ (naïve head-percentage cuts) اکثر معیار میں زیادہ کمی کا باعث بنتے ہیں، کیونکہ وہ بلا امتیاز مفید سیاق و سباق مکس کرنے والے راستوں (context-mixing pathways) کو ختم کر دیتے ہیں۔
حدود اور کھلے سوالات
یہ کام خصوصی طور پر ان ڈفیوژن ٹرانسفارمرز پر مرکوز ہے جو ٹیکسٹ پرامپٹس کو تصاویر میں تبدیل کرتے ہیں۔ یہ اب بھی غیر واضح ہے کہ آیا یہی ٹیمپلیٹ-ٹوکن مظہر بڑے لینگویج ماڈلز یا دیگر ملٹی موڈل آرکیٹیکچرز میں بھی نظر آتا ہے۔ اگر رجسٹرز موجود نہ ہوں یا مختلف طریقے سے کام کریں، تو پروننگ کا یہ طریقہ کار اپنی افادیت کھو سکتا ہے۔
احتیاط کا ایک اور پہلو معیار میں ہونے والی معمولی کمی ہے۔
آگے کیا دیکھنا ہے
مستقبل کی تحقیق ممکنہ طور پر ان سوالات کا جائزہ لے گی:
- کیا ٹیمپلیٹ ٹوکنز دیگر ٹرانسفارمر فیملیز میں قدرتی طور پر ابھرتے ہیں۔
- یہ طریقہ کار ماڈل کے سائز اور ٹریننگ ڈیٹا کے حجم کے ساتھ کیسے اسکیل (scale) ہوتا ہے۔
خلاصہ: ٹیمپلیٹ ٹوکنز کے سیمنٹک رجسٹرز کے طور پر چھپے ہوئے کردار سے فائدہ اٹھاتے ہوئے، محققین نے ڈفیوژن ٹرانسفارمرز کو تراشنے کا ایک درست طریقہ (surgical way) تلاش کر لیا ہے—جو آؤٹ پٹ کے معیار کو تقریباً برقرار رکھتے ہوئے کام کا تقریباً پانچواں حصہ کم کر دیتا ہے۔ یہ مہنگی دوبارہ تربیت کے بغیر AI سے تیار کردہ تصاویر کو تیز اور سستا بنا سکتا ہے۔
