محققان نشان دادهاند که ترنسفورمرهای با بافتار طولانی (long-context transformers) با مقیاسپذیری خطی، میتوانند مدلهای زبانی ماسکشده (masked language models) را روی توالیهای پروتئینی بدون انفجار حافظهای که ترنسفورمرهای استاندارد را فلج میکند، آموزش دهند. این روش با تبدیل هزینه حافظه از حالت درجه دوم (quadratic) به خطی (linear)، به دانشمندان اجازه میدهد با پروتئینهایی بسیار طولانیتر از آنچه قبلاً امکانپذیر بود کار کنند؛ گامی که میتواند کشف دارو و تحقیقات بیوتکنولوژی را تسریع کند.
چرا ترنسفورمرهای استاندارد به بنبست میخورند
پایگاههای داده پروتئینی حاوی توالیهایی هستند که اغلب به هزاران اسید آمینه میرسند. مدلهای ترنسفورمر متداول، توجه (attention) را بین هر جفت از موقعیتها محاسبه میکنند؛ فرآیندی که با توان دوم طول توالی رشد میکند. با افزایش طول توالی، میزان استفاده از حافظه به شدت بالا میرود و متخصصان را مجبور میکند پروتئینها را کوتاه کرده یا آنها را به قطعات کوچکتر تقسیم کنند. از دست رفتن بافتار (context)، توانایی مدل را در یادگیری موتیفهای ساختاری که بخشهای بزرگی از یک زنجیره را در بر میگیرند، مختل میکند.
پیشرفت در مقیاسبندی خطی
رویکرد جدید، خود-توجهی (self-attention) کامل را با طراحی جدیدی جایگزین میکند که حافظه آن تنها به صورت خطی با طول توالی رشد میکند. در عمل، مدل میتواند یک پروتئین کامل را در یک مرحله پردازش کند و تعاملات دوربرد (long-range interactions) را که برای تاخوردگی (folding) و عملکرد پروتئین حیاتی هستند، حفظ کند. از آنجایی که این الگوریتم به منابع حافظه بسیار کمتری نیاز دارد، آموزش روی مجموعهدادههای بزرگ پروتئینی ارزانتر و سریعتر میشود و راه را برای اهداف غنیتر مدل زبانی ماسکشده (MLM) باز میکند که اسیدهای آمینه را در کل زنجیره ماسک و پیشبینی میکنند.
این موضوع چه معنایی برای زیستشناسی دارد
بازنماییهای پروتئینی طولانیتر و یکپارچه، درک مدل از ساختار سهبعدی، سایتهای فعال و الگوهای تکاملی را بهبود میبخشد. اکنون محققان میتوانند روی مجموعههای عظیم و دستنخورده از توالیها پیشآموزش (pre-train) انجام دهند و برای وظایف خاصی مانند پیشبینی اثر جهش یا طراحی آنتیبادی، آنها را تنظیم دقیق (fine-tune) کنند. کاهش بار محاسباتی همچنین مانع ورود آزمایشگاههای کوچکتر را برای اجرای مدلهای پیشرفته (state-of-the-art) روی سختافزارهای معمولی کاهش میدهد.
ملاحظات و پرسشهای بیپاسخ
توجه با مقیاس خطی اغلب بر تقریبهایی مانند پنجرههای لغزان (sliding windows)، تجزیههای کمرتبه (low-rank factorizations) یا الگوهای پراکنده (sparse patterns) متکی است که ممکن است تعاملات ظریف بین رزیدوها (residues) دور از هم را از دست بدهند. آزمایشهای اولیه نشاندهنده یک موازنه (trade-off) اندک بین صرفهجویی در حافظه و دقت پیشبینی است، بهویژه در وظایفی که نیازمند جفتشدگیهای دقیق دوربرد هستند. معماری جدید همچنین پیچیدگی پیادهسازی را افزایش میدهد که میتواند تا زمان ظهور کتابخانههای قدرتمند، سرعت پذیرش آن را کاهش دهد.
آنچه باید در آینده زیر نظر داشت
جامعه علمی منتظر نتایج بنچمارکهایی خواهد بود که عملکرد protein-MLM ترنسفورمر با مقیاس خطی را در برابر مدلهای سنتی روی مجموعهدادههای استاندارد مقایسه میکنند. ادغام این روش در خط لولههای (pipelines) موجود بیوانفورماتیک و انتشار نسخههای متنباز، سرعت گسترش این تکنیک را تعیین خواهد کرد. اگر شکاف دقت کاهش یابد، این روش میتواند به روش پیشفرض برای مدلسازی زبانی پروتئین در مقیاس بزرگ تبدیل شود و نحوه مقابله زیستشناسی محاسباتی با مسئله تاخوردگی پروتئین را بازتعریف کند.
نکته کلیدی: با کاهش شدید نیاز به حافظه از حالت درجه دوم به خطی، ترنسفورمرهای با بافتار طولانی، توالیهای کامل پروتئینی را برای مدلسازی زبانی ماسکشده قابلمدیریت میکنند و در عین حال که هزینههای محاسباتی را کنترل میکنند، نویدبخش بینشهای بیولوژیکی غنیتری هستند.
