فراتر از ترنسفورمرها: استارتاپ‌هایی که عصر بعدی LLMها را بازتعریف می‌کنند

عصر ترنسفورمرها با یک گلوگاه اساسی روبروست، زیرا تقاضای محاسباتی مدل‌های زبانی بزرگ (LLMs) به نقطه بحرانی رسیده است. در حالی که مقاله «Attention Is All You Need» در سال ۲۰۱۷ زیربنای رونق فعلی هوش مصنوعی را بنا نهاد، نسل جدیدی از استارتاپ‌ها اکنون در رقابت برای جایگزینی یا بازآفرینی معماری اصلی هستند تا به کارایی واقعی دست یابند.

گلوگاه ترنسفورمر: چرا توجه متراکم (Dense Attention) در حال شکست است؟

برای نزدیک به یک دهه، ترنسفورمر موتور محرک صنعت هوش مصنوعی بوده است که توسط مکانیزمی موسوم به «attention متراکم» (dense attention) هدایت می‌شود. این فرآیند، هر توکن (token) را در یک بلوک متنی از طریق ضرب‌های بسیار گسترده با تمام توکن‌های دیگر مقایسه می‌کند. اگرچه این روش در ثبت معنای معنایی (semantic) بسیار دقیق است، اما پیچیدگی ریاضی آن به شکلی نامناسب افزایش می‌یابد.

به عنوان مثال، یک سند ۱۰,۰۰۰ کلمه‌ای می‌تواند مستلزم انجام حدود ۵۰ میلیون عملیات ضرب توسط ترنسفورمر باشد. این رشد درجه دوم (quadratic) در محاسبات، منجر به دو چالش بزرگ می‌شود: مصرف انرژی سرسام‌آور و پنجره‌های بافت (context windows) محدود. با گزارش‌هایی مبنی بر اینکه OpenAI قرار است امسال ۵۰ میلیارد دلار صرف محاسبات کند و پیش‌بینی می‌شود تقاضای برق مراکز داده تا سال ۲۰۳۰ دو برابر شود، این صنعت با دیوار هزینه‌ها و محدودیت‌های فیزیکی روبرو شده است.

بازاندیشی در توجه: ظهور مکانیزم‌های پراکنده (Sparse)

برای حل بحران کارایی، چندین استارتاپ در تلاش‌اند تا از توجه متراکم به سمت «توجه پراکنده» (sparse attention) حرکت کنند. توجه پراکنده به جای محاسبه تمام جفت‌کلمات ممکن، تنها بر مرتبط‌ترین اتصالات تمرکز می‌کند و به این ترتیب بار محاسباتی را به میزان قابل توجهی کاهش می‌دهد.

استارتاپ Subquadratic مستقر در میامی، با مدل SubQ خود، پیشرو در این حوزه است. برخلاف مکانیزم‌های پراکنده قبلی که در حفظ دقت با مشکل مواجه بودند، Subquadratic ادعا می‌کند که فناوری آن در وظایف تخصصی مانند کدنویسی و جستجو با LLMهای رایج رقابت می‌کند. رویکرد آن‌ها شامل یک سیستم پویا است که به جای هدر دادن چرخه‌های پردازشی روی توکن‌های بی‌ربط، در لحظه شناسایی می‌کند که کدام کلمات واقعاً برای یک متن مشخص اهمیت دارند.

حفظ توان (Power Retention): حرکت به سمت خلاصه‌سازی چرخشی

رویکرد دیگر، فاصله گرفتن کامل از مکانیزم توجه است. شرکت Manifest AI مستقر در سانفرانسیسکو، در حال پیشگامی در تکنیکی به نام «حفظ توان» (power retention) است. در حالی که مدل‌های توجه پراکنده مانند SubQ همچنان سعی می‌کنند تصویری کلی از کل پنجره بافت را حفظ کنند، روش حفظ توان با ارائه یک خلاصه چرخشی از حافظه به مدل عمل می‌کند.

با ورود اطلاعات جدید به پنجره بافت، مدل داده‌های کم‌اهمیت‌تر را شناسایی و حذف می‌کند تا اطمینان حاصل شود که بار محاسباتی بدون توجه به اندازه ورودی، قابل مدیریت باقی می‌ماند. Manifest AI پیش از این قابلیت اجرایی این رویکرد را از طریق موارد زیر نشان داده است:

  • تبدیل مدل متن‌باز StarCoder به PowerCoder با استفاده از روش حفظ توان.
  • انتشار Brumby، مدلی که آن‌ها ادعا می‌کنند با مدل‌های متن‌باز محبوب Qwen از شرکت Alibaba رقابت می‌کند.

توانایی تطبیق مدل‌های ترنسفورمر موجود به مدل‌های حفظ توان با کمترین نیاز به بازآموزی، نشان می‌دهد که گذار به «LLMs+» — نسل بعدی مدل‌ها — می‌تواند بسیار سریع‌تر از آنچه پیش‌بینی می‌شد، رخ دهد.

نکات کلیدی

  • محدودیت ترنسفورمر: مقیاس‌پذیری درجه دوم در توجه متراکم، اجرای LLMهای فعلی را بسیار پرهزینه و مقیاس‌بندی آن‌ها را برای مجموعه‌داده‌های عظیم یا استدلال‌های طولانی دشوار می‌کند.
  • پراکنده در مقابل حفظ توان: استارتاپ‌ها از دو جهت به این مشکل حمله می‌کنند: Subquadratic از طریق محاسبات پراکنده (SubQ) در حال بهینه‌سازی توجه است، در حالی که Manifest AI آن را با خلاصه‌سازی‌های چرخشی جایگزین می‌کند (Power Retention).
  • ضرورت اقتصادی: با رسیدن هزینه‌های محاسباتی هوش مصنوعی به ده‌ها میلیارد دلار، برنده عصر بعدی هوش مصنوعی احتمالاً کسی خواهد بود که به جای تمرکز صرف بر مقیاس، مسئله کارایی را حل کند.