ٹرانسفارمرز سے آگے: وہ اسٹارٹ اپس جو LLMs کے اگلے دور کی نئی تعریف کر رہے ہیں

ٹرانسفارمر کا دور ایک بنیادی رکاوٹ کا سامنا کر رہا ہے کیونکہ لارج لینگویج ماڈلز (LLMs) کی کمپیوٹیشنل ضروریات ایک نازک موڑ پر پہنچ چکی ہیں۔ اگرچہ 2017 کے "Attention Is All You Need" پیپر نے موجودہ AI انقلاب کی بنیاد رکھی تھی، لیکن اب اسٹارٹ اپس کی ایک نئی نسل حقیقی کارکردگی حاصل کرنے کے لیے بنیادی آرکیٹیکچر کو تبدیل کرنے یا اسے نئے سرے سے تخلیق کرنے کی دوڑ میں ہے۔

ٹرانسفارمر کی رکاوٹ: ڈینس اٹینشن (Dense Attention) کیوں ناکام ہو رہی ہے

تقریباً ایک دہائی سے، ٹرانسفارمر AI انڈسٹری کا انجن رہا ہے، جو "dense attention" نامی میکانزم کے ذریعے چلتا ہے۔ یہ عمل ٹیکسٹ کے ایک بلاک میں موجود ہر ٹوکن کا بڑے پیمانے پر ضرب (multiplication) کے ذریعے دوسرے ہر ٹوکن کے ساتھ موازنہ کرتا ہے۔ اگرچہ یہ معنی (semantic meaning) کو سمجھنے میں انتہائی درست ہے، لیکن اس کی ریاضیاتی پیچیدگی بہت تیزی سے بڑھتی ہے۔

مثال کے طور پر، 10,000 الفاظ کے دستاویز کے لیے ٹرانسفارمر کو تقریباً 5 کروڑ (50 million) بار ضرب دینے کی ضرورت پڑ سکتی ہے۔ کمپیوٹیشن میں یہ کوڈریٹک اضافہ (quadratic growth) دو بڑے چیلنجز کا باعث بنتا ہے: توانائی کے استعمال میں بے پناہ اضافہ اور محدود کانٹیکسٹ ونڈوز (context windows)۔ رپورٹ کے مطابق OpenAI اس سال کمپیوٹنگ پر 50 ارب ڈالر خرچ کرنے والا ہے اور 2030 تک ڈیٹا سینٹرز کی بجلی کی طلب دوگنی ہونے کی توقع ہے، جس سے یہ انڈسٹری لاگت اور فزکس دونوں کی حدوں سے ٹکرا رہی ہے۔

اٹینشن پر نظرِ ثانی: اسپرس میکانزم (Sparse Mechanisms) کا عروج

کارکردگی کے بحران کو حل کرنے کے لیے، کئی اسٹارٹ اپس "dense attention" سے ہٹ کر "sparse attention" کی طرف بڑھنے کی کوشش کر رہے ہیں۔ ہر ممکنہ لفظی جوڑی کا حساب لگانے کے بجائے، sparse attention صرف سب سے زیادہ متعلقہ روابط پر توجہ مرکوز کرتا ہے، جس سے کمپیوٹیشنل بوجھ میں نمایاں کمی آتی ہے۔

میامی میں مقیم اسٹارٹ اپ Subquadratic اپنے SubQ ماڈل کے ساتھ اس شعبے میں پیش پیش ہے۔ پچھلے اسپرس میکانزم کے برعکس جو درستگی برقرار رکھنے میں جدوجہد کرتے تھے، Subquadratic کا دعویٰ ہے کہ اس کی ٹیکنالوجی کوڈنگ اور سرچ جیسے مخصوص کاموں میں عام LLMs کا مقابلہ کرتی ہے۔ ان کا طریقہ کار ایک ڈائنامک سسٹم پر مشتمل ہے جو غیر متعلقہ ٹوکنز پر وقت ضائع کرنے کے بجائے، فوری طور پر یہ شناخت کرتا ہے کہ متن کے کسی حصے کے لیے کون سے الفاظ حقیقت میں اہم ہیں۔

پاور ریٹینشن (Power Retention): رولنگ سمریز کی طرف پیش قدمی

ایک اور طریقہ اٹینشن میکانزم سے مکمل طور پر ہٹ جانا ہے۔ سان فرانسسکو میں مقیم Manifest AI "power retention" نامی ایک تکنیک کی بنیاد رکھ رہا ہے۔ اگرچہ SubQ جیسے sparse attention ماڈلز اب بھی پورے کانٹیکسٹ ونڈو کا ایک عمومی خاکہ برقرار رکھنے کی کوشش کرتے ہیں، لیکن power retention ماڈل کو اس کی یادداشت کا ایک "رولنگ خلاصہ" (rolling summary) فراہم کر کے کام کرتا ہے۔

جیسے ہی کانٹیکسٹ ونڈو میں نئی معلومات داخل ہوتی ہیں، ماڈل کم متعلقہ ڈیٹا کی شناخت کر کے اسے نکال دیتا ہے، جس سے ان پٹ کے سائز سے قطع نظر کمپیوٹیشنل بوجھ قابلِ انتظام رہتا ہے۔ Manifest AI پہلے ہی اس طریقے کی افادیت ثابت کر چکا ہے:

  • power retention کا استعمال کرتے ہوئے اوپن سورس StarCoder ماڈل کو PowerCoder میں تبدیل کرنا۔
  • Brumby کو ریلیز کرنا، جو ان کے بقول Alibaba کے مقبول Qwen اوپن سورس ماڈلز کا مقابلہ کرتا ہے۔

موجودہ ٹرانسفارمر ماڈلز کو کم سے کم ری ٹریننگ کے ساتھ power retention ماڈلز میں ڈھالنے کی صلاحیت یہ بتاتی ہے کہ "LLMs+" یعنی ماڈلز کی اگلی نسل کی طرف منتقلی توقع سے کہیں زیادہ تیزی سے ہو سکتی ہے۔

اہم نکات

  • ٹرانسفارمر کی حد: Dense attention کا کوڈریٹک اسکیلنگ (quadratic scaling) موجودہ LLMs کو چلانے کے لیے انتہائی مہنگا اور بڑے ڈیٹا سیٹس یا طویل استدلال (long-form reasoning) کے لیے مشکل بناتا ہے۔
  • اسپرس بمقابلہ ریٹینشن: اسٹارٹ اپس اس مسئلے کو دو رخوں سے حل کر رہے ہیں: Subquadratic اسپرس کیلکولیشنز (SubQ) کے ذریعے اٹینشن کو بہتر بنا رہا ہے، جبکہ Manifest AI اسے رولنگ سمریز (Power Retention) سے بدل رہا ہے۔
  • معاشی ضرورت: جیسے جیسے AI کمپیوٹنگ کی لاگت عشروں ارب ڈالر تک پہنچ رہی ہے، اگلے AI دور کا فاتح غالباً وہ ہوگا جو محض وسعت (scale) کے بجائے کارکردگی (efficiency) کا حل تلاش کرے گا۔