Badacze wykazali, że liniowo skalowalne transformery z długim kontekstem mogą trenować modele maskowanego języka na sekwencjach białkowych bez gwałtownego wzrostu zapotrzebowania na pamięć, który paraliżuje standardowe transformery. Dzięki przekształceniu kosztu pamięci z kwadratowego na liniowy, metoda ta pozwala naukowcom pracować z białkami znacznie dłuższymi, niż było to wcześniej możliwe, co może przyspieszyć odkrywanie leków i badania biotechnologiczne.
Dlaczego standardowe transformery napotykają barierę
Bazy danych białek zawierają sekwencje, które często rozciągają się na tysiące aminokwasów. Konwencjonalne modele typu transformer obliczają mechanizm uwagi dla każdej pary pozycji, a proces ten rośnie wraz z kwadratem długości sekwencji. W miarę wydłużania się sekwencji, zużycie pamięci gwałtownie rośnie, co zmusza praktyków do skracania białek lub dzielenia ich na fragmenty. Utrata kontekstu utrudnia modelowi naukę motywów strukturalnych obejmujących duże części łańcucha.
Przełom w skali liniowej
Nowe podejście zastępuje pełny mechanizm self-attention konstrukcją, której zapotrzebowanie na pamięć rośnie jedynie liniowo wraz z długością sekwencji. W praktyce model może przetworzyć całe białko w jednym przebiegu, zachowując oddziaływania dalekosiężne, które są kluczowe dla zwijania i funkcji białka. Ponieważ algorytm wymaga znacznie mniej zasobów pamięci, trenowanie na dużych korpusach białkowych staje się tańsze i szybsze, co otwiera drogę do bogatszych celów modelowania maskowanego języka (MLM), które maskują i przewidują aminokwasy w całym łańcuchu.
Co to oznacza dla biologii
Dłuższe, nieprzerwane reprezentacje białek poprawiają zrozumienie przez model struktury trójwymiarowej, miejsc aktywnych i wzorców ewolucyjnych. Badacze mogą teraz przeprowadzać wstępne trenowanie na ogromnych, nieprzesiewanych zbiorach sekwencji i dostrajać modele do konkretnych zadań, takich jak przewidywanie skutków mutacji czy projektowanie przeciwciał. Zmniejszone obciążenie obliczeniowe obniża również próg wejścia dla mniejszych laboratoriów, umożliwiając uruchamianie najnowocześniejszych modeli na skromnym sprzęcie.
