فراتر از ترنسفورمرها: استارتاپهایی که عصر بعدی LLMها را بازتعریف میکنند
عصر ترنسفورمرها با یک گلوگاه اساسی روبروست، زیرا تقاضای محاسباتی مدلهای زبانی بزرگ (LLMs) به نقطه بحرانی رسیده است. در حالی که مقاله «Attention Is All You Need» در سال ۲۰۱۷ زیربنای رونق فعلی هوش مصنوعی را بنا نهاد، نسل جدیدی از استارتاپها اکنون در رقابت برای جایگزینی یا بازآفرینی معماری اصلی هستند تا به کارایی واقعی دست یابند.
گلوگاه ترنسفورمر: چرا توجه متراکم (Dense Attention) در حال شکست است؟
برای نزدیک به یک دهه، ترنسفورمر موتور محرک صنعت هوش مصنوعی بوده است که توسط مکانیزمی موسوم به «attention متراکم» (dense attention) هدایت میشود. این فرآیند، هر توکن (token) را در یک بلوک متنی از طریق ضربهای بسیار گسترده با تمام توکنهای دیگر مقایسه میکند. اگرچه این روش در ثبت معنای معنایی (semantic) بسیار دقیق است، اما پیچیدگی ریاضی آن به شکلی نامناسب افزایش مییابد.
به عنوان مثال، یک سند ۱۰,۰۰۰ کلمهای میتواند مستلزم انجام حدود ۵۰ میلیون عملیات ضرب توسط ترنسفورمر باشد. این رشد درجه دوم (quadratic) در محاسبات، منجر به دو چالش بزرگ میشود: مصرف انرژی سرسامآور و پنجرههای بافت (context windows) محدود. با گزارشهایی مبنی بر اینکه OpenAI قرار است امسال ۵۰ میلیارد دلار صرف محاسبات کند و پیشبینی میشود تقاضای برق مراکز داده تا سال ۲۰۳۰ دو برابر شود، این صنعت با دیوار هزینهها و محدودیتهای فیزیکی روبرو شده است.
بازاندیشی در توجه: ظهور مکانیزمهای پراکنده (Sparse)
برای حل بحران کارایی، چندین استارتاپ در تلاشاند تا از توجه متراکم به سمت «توجه پراکنده» (sparse attention) حرکت کنند. توجه پراکنده به جای محاسبه تمام جفتکلمات ممکن، تنها بر مرتبطترین اتصالات تمرکز میکند و به این ترتیب بار محاسباتی را به میزان قابل توجهی کاهش میدهد.
استارتاپ Subquadratic مستقر در میامی، با مدل SubQ خود، پیشرو در این حوزه است. برخلاف مکانیزمهای پراکنده قبلی که در حفظ دقت با مشکل مواجه بودند، Subquadratic ادعا میکند که فناوری آن در وظایف تخصصی مانند کدنویسی و جستجو با LLMهای رایج رقابت میکند. رویکرد آنها شامل یک سیستم پویا است که به جای هدر دادن چرخههای پردازشی روی توکنهای بیربط، در لحظه شناسایی میکند که کدام کلمات واقعاً برای یک متن مشخص اهمیت دارند.
حفظ توان (Power Retention): حرکت به سمت خلاصهسازی چرخشی
رویکرد دیگر، فاصله گرفتن کامل از مکانیزم توجه است. شرکت Manifest AI مستقر در سانفرانسیسکو، در حال پیشگامی در تکنیکی به نام «حفظ توان» (power retention) است. در حالی که مدلهای توجه پراکنده مانند SubQ همچنان سعی میکنند تصویری کلی از کل پنجره بافت را حفظ کنند، روش حفظ توان با ارائه یک خلاصه چرخشی از حافظه به مدل عمل میکند.
با ورود اطلاعات جدید به پنجره بافت، مدل دادههای کماهمیتتر را شناسایی و حذف میکند تا اطمینان حاصل شود که بار محاسباتی بدون توجه به اندازه ورودی، قابل مدیریت باقی میماند. Manifest AI پیش از این قابلیت اجرایی این رویکرد را از طریق موارد زیر نشان داده است:
- تبدیل مدل متنباز StarCoder به PowerCoder با استفاده از روش حفظ توان.
- انتشار Brumby، مدلی که آنها ادعا میکنند با مدلهای متنباز محبوب Qwen از شرکت Alibaba رقابت میکند.
توانایی تطبیق مدلهای ترنسفورمر موجود به مدلهای حفظ توان با کمترین نیاز به بازآموزی، نشان میدهد که گذار به «LLMs+» — نسل بعدی مدلها — میتواند بسیار سریعتر از آنچه پیشبینی میشد، رخ دهد.
نکات کلیدی
- محدودیت ترنسفورمر: مقیاسپذیری درجه دوم در توجه متراکم، اجرای LLMهای فعلی را بسیار پرهزینه و مقیاسبندی آنها را برای مجموعهدادههای عظیم یا استدلالهای طولانی دشوار میکند.
- پراکنده در مقابل حفظ توان: استارتاپها از دو جهت به این مشکل حمله میکنند: Subquadratic از طریق محاسبات پراکنده (SubQ) در حال بهینهسازی توجه است، در حالی که Manifest AI آن را با خلاصهسازیهای چرخشی جایگزین میکند (Power Retention).
- ضرورت اقتصادی: با رسیدن هزینههای محاسباتی هوش مصنوعی به دهها میلیارد دلار، برنده عصر بعدی هوش مصنوعی احتمالاً کسی خواهد بود که به جای تمرکز صرف بر مقیاس، مسئله کارایی را حل کند.
