محققان نشان داده‌اند که ترنسفورمرهای با بافتار طولانی (long-context transformers) با مقیاس‌پذیری خطی، می‌توانند مدل‌های زبانی ماسک‌شده (masked language models) را روی توالی‌های پروتئینی بدون انفجار حافظه‌ای که ترنسفورمرهای استاندارد را فلج می‌کند، آموزش دهند. این روش با تبدیل هزینه حافظه از حالت درجه دوم (quadratic) به خطی (linear)، به دانشمندان اجازه می‌دهد با پروتئین‌هایی بسیار طولانی‌تر از آنچه قبلاً امکان‌پذیر بود کار کنند؛ گامی که می‌تواند کشف دارو و تحقیقات بیوتکنولوژی را تسریع کند.

چرا ترنسفورمرهای استاندارد به بن‌بست می‌خورند

پایگاه‌های داده پروتئینی حاوی توالی‌هایی هستند که اغلب به هزاران اسید آمینه می‌رسند. مدل‌های ترنسفورمر متداول، توجه (attention) را بین هر جفت از موقعیت‌ها محاسبه می‌کنند؛ فرآیندی که با توان دوم طول توالی رشد می‌کند. با افزایش طول توالی، میزان استفاده از حافظه به شدت بالا می‌رود و متخصصان را مجبور می‌کند پروتئین‌ها را کوتاه کرده یا آن‌ها را به قطعات کوچک‌تر تقسیم کنند. از دست رفتن بافتار (context)، توانایی مدل را در یادگیری موتیف‌های ساختاری که بخش‌های بزرگی از یک زنجیره را در بر می‌گیرند، مختل می‌کند.

پیشرفت در مقیاس‌بندی خطی

رویکرد جدید، خود-توجهی (self-attention) کامل را با طراحی جدیدی جایگزین می‌کند که حافظه آن تنها به صورت خطی با طول توالی رشد می‌کند. در عمل، مدل می‌تواند یک پروتئین کامل را در یک مرحله پردازش کند و تعاملات دوربرد (long-range interactions) را که برای تاخوردگی (folding) و عملکرد پروتئین حیاتی هستند، حفظ کند. از آنجایی که این الگوریتم به منابع حافظه بسیار کمتری نیاز دارد، آموزش روی مجموعه‌داده‌های بزرگ پروتئینی ارزان‌تر و سریع‌تر می‌شود و راه را برای اهداف غنی‌تر مدل زبانی ماسک‌شده (MLM) باز می‌کند که اسیدهای آمینه را در کل زنجیره ماسک و پیش‌بینی می‌کنند.

این موضوع چه معنایی برای زیست‌شناسی دارد

بازنمایی‌های پروتئینی طولانی‌تر و یکپارچه، درک مدل از ساختار سه‌بعدی، سایت‌های فعال و الگوهای تکاملی را بهبود می‌بخشد. اکنون محققان می‌توانند روی مجموعه‌های عظیم و دست‌نخورده از توالی‌ها پیش‌آموزش (pre-train) انجام دهند و برای وظایف خاصی مانند پیش‌بینی اثر جهش یا طراحی آنتی‌بادی، آن‌ها را تنظیم دقیق (fine-tune) کنند. کاهش بار محاسباتی همچنین مانع ورود آزمایشگاه‌های کوچک‌تر را برای اجرای مدل‌های پیشرفته (state-of-the-art) روی سخت‌افزارهای معمولی کاهش می‌دهد.

ملاحظات و پرسش‌های بی‌پاسخ

توجه با مقیاس خطی اغلب بر تقریب‌هایی مانند پنجره‌های لغزان (sliding windows)، تجزیه‌های کم‌رتبه (low-rank factorizations) یا الگوهای پراکنده (sparse patterns) متکی است که ممکن است تعاملات ظریف بین رزیدوها (residues) دور از هم را از دست بدهند. آزمایش‌های اولیه نشان‌دهنده یک موازنه (trade-off) اندک بین صرفه‌جویی در حافظه و دقت پیش‌بینی است، به‌ویژه در وظایفی که نیازمند جفت‌شدگی‌های دقیق دوربرد هستند. معماری جدید همچنین پیچیدگی پیاده‌سازی را افزایش می‌دهد که می‌تواند تا زمان ظهور کتابخانه‌های قدرتمند، سرعت پذیرش آن را کاهش دهد.

آنچه باید در آینده زیر نظر داشت

جامعه علمی منتظر نتایج بنچمارک‌هایی خواهد بود که عملکرد protein-MLM ترنسفورمر با مقیاس خطی را در برابر مدل‌های سنتی روی مجموعه‌داده‌های استاندارد مقایسه می‌کنند. ادغام این روش در خط لوله‌های (pipelines) موجود بیوانفورماتیک و انتشار نسخه‌های متن‌باز، سرعت گسترش این تکنیک را تعیین خواهد کرد. اگر شکاف دقت کاهش یابد، این روش می‌تواند به روش پیش‌فرض برای مدل‌سازی زبانی پروتئین در مقیاس بزرگ تبدیل شود و نحوه مقابله زیست‌شناسی محاسباتی با مسئله تاخوردگی پروتئین را بازتعریف کند.

نکته کلیدی: با کاهش شدید نیاز به حافظه از حالت درجه دوم به خطی، ترنسفورمرهای با بافتار طولانی، توالی‌های کامل پروتئینی را برای مدل‌سازی زبانی ماسک‌شده قابل‌مدیریت می‌کنند و در عین حال که هزینه‌های محاسباتی را کنترل می‌کنند، نویدبخش بینش‌های بیولوژیکی غنی‌تری هستند.