أظهر الباحثون أن محولات السياق الطويل (long-context transformers) القابلة للتوسع خطياً يمكنها تدريب نماذج اللغة المقنعة (masked language models) على تسلسلات البروتين دون تضخم الذاكرة الذي يعيق المحولات التقليدية. ومن خلال تحويل تكلفة الذاكرة من تربيعية إلى خطية، تتيح هذه الطريقة للعلماء العمل مع بروتينات أطول بكثير مما كان ممكناً في السابق، وهي خطوة قد تسرع من اكتشاف الأدوية وأبحاث التكنولوجيا الحيوية.

لماذا تصطدم المحولات التقليدية بحائط مسدود

تحتوي قواعد بيانات البروتين على تسلسلات تمتد غالباً إلى آلاف الأحماض الأمينية. تقوم نماذج المحولات التقليدية بحساب الانتباه (attention) بين كل زوج من المواقع، وهي عملية تنمو مع مربع طول التسلسل. ومع نمو التسلسل، يرتفع استهلاك الذاكرة بشكل هائل، مما يضطر الممارسين إلى تقصير البروتينات أو تقسيمها إلى أجزاء. ويؤدي فقدان السياق إلى إعاقة قدرة النموذج على تعلم الأنماط الهيكلية التي تمتد عبر أجزاء كبيرة من السلسلة.

الطفرة النوعية في القياس الخطي

يستبدل النهج الجديد آلية الانتباه الذاتي الكامل بتصميم تنمو ذاكرته خطياً فقط مع طول التسلسل. ومن الناحية العملية، يمكن للنموذج استيعاب بروتين كامل في تمريرة واحدة، مما يحافظ على التفاعلات بعيدة المدى الضرورية للطي والوظيفة. ولأن الخوارزمية تحتاج إلى موارد ذاكرة أقل بكثير، يصبح التدريب على مجموعات بيانات البروتين الضخمة أرخص وأسرع، مما يفتح الباب أمام أهداف نماذج اللغة المقنعة (MLM) الأكثر ثراءً، والتي تقوم بقناع والتنبؤ بالأحماض الأمينية عبر السلسلة بأكملها.

ماذا يعني هذا لعلم الأحياء

تؤدي تمثيلات البروتين الأطول وغير المنقطعة إلى تحسين فهم النموذج للبنية ثلاثية الأبعاد، والمواقع النشطة، والأنماط التطورية. يمكن للباحثين الآن إجراء التدريب المسبق على مجموعات تسلسل ضخمة وغير منقحة، ثم إجراء الضبط الدقيق لمهام محددة مثل التنبؤ بتأثير الطفرات أو تصميم الأجسام المضادة. كما يقلل العبء الحسابي المنخفض من العوائق أمام المختبرات الصغيرة لتشغيل أحدث النماذج المتطورة باستخدام أجهزة متواضعة.

تحذيرات وتساؤلات مفتوحة

غالباً ما يعتمد الانتباه ذو القياس الخطي على تقريبات — مثل النوافذ المنزلقة، أو التحليلات منخفضة الرتبة، أو الأنماط المتفرقة — والتي قد تغفل عن التفاعلات الدقيقة بين البقايا (residues) المتباعدة. وتشير التجارب الأولية إلى وجود مقايضة متواضعة بين توفير الذاكرة ودقة التنبؤ، خاصة في المهام التي تتطلب اقتراناً دقيقاً بعيد المدى. كما تضيف البنية الجديدة تعقيداً في التنفيذ، مما قد يبطئ الاعتماد عليها حتى تظهر مكتبات برمجية قوية.

ما الذي يجب مراقبته لاحقاً

سيتطلع المجتمع العلمي إلى نتائج الاختبارات المعيارية التي تقارن أداء نموذج البروتين-MLM الخاص بالمحول ذي القياس الخطي مقابل النماذج التقليدية على مجموعات البيانات القياسية. وسوف يحدد التكامل في مسارات المعلوماتية الحيوية الحالية والإصدارات مفتوحة المصدر مدى سرعة انتشار هذه التقنية. وإذا تقلصت فجوة الدقة، فقد تصبح هذه الطريقة هي الخيار الافتراضي لنمذجة لغة البروتين واسعة النطاق، مما يعيد تشكيل كيفية معالجة علم الأحياء الحسابي لمشكلة طي البروتين.

الخلاصة: من خلال تقليص متطلبات الذاكرة من تربيعية إلى خطية، تجعل محولات السياق الطويل تسلسلات البروتين كاملة الطول قابلة للمعالجة في نماذج اللغة المقنعة، مما يعد برؤى بيولوجية أغنى مع إبقاء التكاليف الحسابية تحت السيطرة.