ಸಂಶೋಧಕರು ತೋರಿಸಿದ್ದಾರೆಂದರೆ, ರೇಖೀಯವಾಗಿ ವಿಸ್ತರಿಸಬಹುದಾದ ದೀರ್ಘ-ಸಂದರ್ಭದ (long-context) ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳು, ಸಾಮಾನ್ಯ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳನ್ನು ಅಡಚಣೆಗೆ ಒಳಪಡಿಸುವ ಮೆಮೊರಿ ಅತಿಯಾಗಿ ಹೆಚ್ಚಾಗುವ (memory blow-up) ಸಮಸ್ಯೆಯಿಲ್ಲದೆ ಪ್ರೋಟೀನ್ ಸರಣಿಗಳ ಮೇಲೆ ಮಾಸ್ಕ್ಡ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ತರಬೇತುಗೊಳಿಸಬಹುದು. ಮೆಮೊರಿ ವೆಚ್ಚವನ್ನು ವರ್ಗಾತ್ಮಕದಿಂದ (quadratic) ರೇಖೀಯಕ್ಕೆ (linear) ಬದಲಾಯಿಸುವ ಮೂಲಕ, ಈ ವಿಧಾನವು ವಿಜ್ಞಾನಿಗಳು ಈ ಹಿಂದಿಗಿಂತಲೂ ಹೆಚ್ಚಿನ ಉದ್ದದ ಪ್ರೋಟೀನ್‌ಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ, ಇದು ಔಷಧ ಸಂಶೋಧನೆ ಮತ್ತು ಜೈವಿಕ ತಂತ್ರಜ್ಞಾನ ಸಂಶೋಧನೆಯನ್ನು ವೇಗಗೊಳಿಸುವ ಒಂದು ಹೆಜ್ಜೆಯಾಗಿದೆ.

ಸಾಮಾನ್ಯ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳು ಏಕೆ ಅಡೆತಡೆ ಎದುರಿಸುತ್ತವೆ

ಪ್ರೋಟೀನ್ ಡೇಟಾಬೇಸ್‌ಗಳು ಸಾವಿರಾರು ಅಮೈನೋ ಆಮ್ಲಗಳನ್ನು ಹೊಂದಿರುವ ಸರಣಿಗಳನ್ನು ಒಳಗೊಂಡಿರುತ್ತವೆ. ಸಾಂಪ್ರದಾಯಿಕ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್ ಮಾಡೆಲ್‌ಗಳು ಪ್ರತಿಯೊಂದು ಸ್ಥಾನಗಳ ಜೋಡಿಯ ನಡುವೆ ಅಟೆನ್ಷನ್ (attention) ಅನ್ನು ಲೆಕ್ಕಹಾಕುತ್ತವೆ, ಈ ಪ್ರಕ್ರಿಯೆಯು ಸರಣಿಯ ಉದ್ದದ ವರ್ಗಕ್ಕೆ (square) ಅನುಗುಣವಾಗಿ ಬೆಳೆಯುತ್ತದೆ. ಸರಣಿಯು ಬೆಳೆದಂತೆ, ಮೆಮೊರಿ ಬಳಕೆ ಗಗನಕ್ಕೇರುತ್ತದೆ, ಇದು ಬಳಕೆದಾರರು ಪ್ರೋಟೀನ್‌ಗಳನ್ನು ಕತ್ತರಿಸಲು ಅಥವಾ ಅವುಗಳನ್ನು ಸಣ್ಣ ಭಾಗಗಳಾಗಿ ವಿಭಜಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ. ಸಂದರ್ಭದ (context) ಈ ನಷ್ಟವು, ಸರಣಿಯ ದೊಡ್ಡ ಭಾಗಗಳನ್ನು ವ್ಯಾಪಿಸುವ ರಚನಾತ್ಮಕ ಮಾದರಿಗಳನ್ನು (structural motifs) ಕಲಿಯುವ ಮಾಡೆಲ್‌ನ ಸಾಮರ್ಥ್ಯಕ್ಕೆ ಅಡ್ಡಿಯಾಗುತ್ತದೆ.

ರೇಖೀಯ-ಅಳತೆಯ ಕ್ರಾಂತಿ

ಹೊಸ ವಿಧಾನವು ಪೂರ್ಣ ಸೆಲ್ಫ್-ಅಟೆನ್ಷನ್ ಅನ್ನು ಬದಲಾಯಿಸಿ, ಸರಣಿಯ ಉದ್ದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಮೆಮೊರಿ ಕೇವಲ ರೇಖೀಯವಾಗಿ ಬೆಳೆಯುವ ವಿನ್ಯಾಸವನ್ನು ಬಳಸುತ್ತದೆ. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಈ ಮಾಡೆಲ್ ಇಡೀ ಪ್ರೋಟೀನ್ ಅನ್ನು ಒಂದೇ ಹಂತದಲ್ಲಿ ಗ್ರಹಿಸಬಲ್ಲದು, ಇದು ಪ್ರೋಟೀನ್ ಮಡಚುವಿಕೆ (folding) ಮತ್ತು ಕಾರ್ಯನಿರ್ವಹಣೆಗೆ ನಿರ್ಣಾಯಕವಾದ ದೀರ್ಘ-ದೂರದ ಪರಸ್ಪರ ಕ್ರಿಯೆಗಳನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ. ಈ ಅಲ್ಗಾರಿದಮ್‌ಗೆ ಬಹಳ ಕಡಿಮೆ ಮೆಮೊರಿ ಸಂಪನ್ಮೂಲಗಳು ಬೇಕಾಗಿರುವುದರಿಂದ, ದೊಡ್ಡ ಪ್ರೋಟೀನ್ ಸಂಗ್ರಹಗಳ ಮೇಲೆ ತರಬೇತಿ ನೀಡುವುದು ಅಗ್ಗ ಮತ್ತು ವೇಗವಾಗುತ್ತದೆ, ಇದು ಇಡೀ ಸರಣಿಯಾದ್ಯಂತ ಅಮೈನೋ ಆಮ್ಲಗಳನ್ನು ಮಾಸ್ಕ್ ಮಾಡಿ ಮತ್ತು ಮುನ್ಸೂಚನೆ ನೀಡುವ ಸಮೃದ್ಧ ಮಾಸ್ಕ್ಡ್-ಲ್ಯಾಂಗ್ವೇಜ್-ಮಾಡಲ್ (MLM) ಉದ್ದೇಶಗಳಿಗೆ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತದೆ.

ಇದು ಜೀವವಿಜ್ಞಾನಕ್ಕೆ ಏನನ್ನು ಸೂಚಿಸುತ್ತದೆ

ದೀರ್ಘವಾದ, ಅವಿಚ್ಛಿನ್ನವಾದ ಪ್ರೋಟೀನ್ ಪ್ರತಿನಿಧಿಸುವಿಕೆಗಳು ಮಾಡೆಲ್‌ನ ತ್ರಿಮಿತಿ ರಚನೆ, ಸಕ್ರಿಯ ತಾಣಗಳು (active sites) ಮತ್ತು ವಿಕಾಸದ ಮಾದರಿಗಳ ಮೇಲಿನ ಹಿಡಿತವನ್ನು ಸುಧಾರಿಸುತ್ತವೆ. ಸಂಶೋಧಕರು ಈಗ ಬೃಹತ್, ಅಸಂಸ್ಕರಿಸಿದ ಸರಣಿ ಸಂಗ್ರಹಗಳ ಮೇಲೆ ಪ್ರೀ-ಟ್ರೇನ್ ಮಾಡಬಹುದು ಮತ್ತು ಮ್ಯುಟೇಶನ್-ಪರಿಣಾಮದ ಮುನ್ಸೂಚನೆ ಅಥವಾ ಆಂಟಿಬಾಡಿ ವಿನ್ಯಾಸದಂತಹ ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯಗಳಿಗಾಗಿ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಬಹುದು. ಕಡಿಮೆ ಮಾಡಲಾದ ಗಣಕೀಕರಣದ ಹೊರೆಯು ಸಣ್ಣ ಪ್ರಯೋಗಾಲಯಗಳು ಸಾಧಾರಣ ಹಾರ್ಡ್‌ವೇರ್‌ನಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಮಾಡೆಲ್‌ಗಳನ್ನು ನಡೆಸುವ ಅಡೆತಡೆಯನ್ನು ಸಹ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.

ಎಚ್ಚರಿಕೆಗಳು ಮತ್ತು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು

ರೇಖೀಯ-ಅಳತೆಯ ಅಟೆನ್ಷನ್ ಹೆಚ್ಚಾಗಿ ಅಂದಾಜುಗಳ ಮೇಲೆ (approximations)—ಸ್ಲೈಡಿಂಗ್ ವಿಂಡೋಗಳು, ಲೋ-ರ್ಯಾಂಕ್ ಫ್ಯಾಕ್ಟರೈಸೇಶನ್‌ಗಳು ಅಥವಾ ಸ್ಪಾರ್ಸ್ ಪ್ಯಾಟರ್ನ್‌ಗಳು—ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ, ಇದು ದೂರದ ರೆಸಿಡ್ಯೂಗಳ ನಡುವಿನ ಸೂಕ್ಷ್ಮ ಪರಸ್ಪರ ಕ್ರಿಯೆಗಳನ್ನು ತಪ್ಪಿಸಬಹುದು. ಆರಂಭಿಕ ಪ್ರಯೋಗಗಳು ಮೆಮೊರಿ ಉಳಿತಾಯ ಮತ್ತು ಮುನ್ಸೂಚನಾ ನಿಖರತೆಯ ನಡುವೆ ಒಂದು ಸಣ್ಣ ಸಮತೋಲನದ (trade-off) ಅಗತ್ಯತೆಯನ್ನು ಸೂಚಿಸುತ್ತವೆ, ವಿಶೇಷವಾಗಿ ನಿಖರವಾದ ದೀರ್ಘ-ದೂರದ ಜೋಡಣೆಯನ್ನು ಬಯಸುವ ಕಾರ್ಯಗಳಲ್ಲಿ ಇದು ಕಂಡುಬರುತ್ತದೆ. ಹೊಸ ಆರ್ಕಿಟೆಕ್ಚರ್ ಅಳವಡಿಕೆಯ ಸಂಕೀರ್ಣತೆಯನ್ನು ಕೂಡ ಹೆಚ್ಚಿಸುತ್ತದೆ, ಇದು ಬಲವಾದ ಲೈಬ್ರರಿಗಳು ಹೊರಬರುವವರೆಗೆ ಅದರ ಬಳಕೆಯನ್ನು ನಿಧಾನಗೊಳಿಸಬಹುದು.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಸಾಂಪ್ರದಾಯಿಕ ಮಾಡೆಲ್‌ಗಳಿಗೂ ಮತ್ತು ರೇಖೀಯ-ಅಳತೆಯ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ನ ಪ್ರೋಟೀನ್-MLM ಕಾರ್ಯಕ್ಷಮತೆಗೂ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ತಿಳಿಸುವ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಫಲಿತಾಂಶಗಳಿಗಾಗಿ ಸಮುದಾಯವು ಕಾಯುತ್ತಿರುತ್ತದೆ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಬಯೋ-ಇನ್ಫರ್ಮ್ಯಾಟಿಕ್ಸ್ ಪೈಪ್‌ಲೈನ್‌ಗಳಿಗೆ ಇದರ ಏಕೀಕರಣ ಮತ್ತು ಓಪನ್-ಸೋರ್ಸ್ ಬಿಡುಗಡೆಗಳು ಈ ತಂತ್ರಜ್ಞಾನವು ಎಷ್ಟು ವೇಗವಾಗಿ ಹರಡುತ್ತದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತವೆ. ನಿಖರತೆಯ ಅಂತರವು ಕಡಿಮೆಯಾದರೆ, ಈ ವಿಧಾನವು ದೊಡ್ಡ ಪ್ರಮಾಣದ ಪ್ರೋಟೀನ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲಿಂಗ್‌ಗೆ ಡಿಫಾಲ್ಟ್ ಆಗಿ ಬದಲಾಗಬಹುದು ಮತ್ತು ಕಂಪ್ಯೂಟೇಶನಲ್ ಬಯಾಲಜಿ ಪ್ರೋಟೀನ್ ಮಡಚುವಿಕೆಯ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸುವ ರೀತಿಯನ್ನು ಮರುರೂಪಿಸಬಹುದು.

ಸಾರಾಂಶ: ಮೆಮೊರಿ ಬೇಡಿಕೆಯನ್ನು ವರ್ಗಾತ್ಮಕದಿಂದ ರೇಖೀಯಕ್ಕೆ ಇಳಿಸುವ ಮೂಲಕ, ದೀರ್ಘ-ಸಂದರ್ಭದ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ಗಳು ಪೂರ್ಣ ಉದ್ದದ ಪ್ರೋಟೀನ್ ಸರಣಿಗಳನ್ನು ಮಾಸ್ಕ್ಡ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲಿಂಗ್‌ಗೆ ಸುಲಭವಾಗಿಸುತ್ತವೆ, ಇದು ಗಣಕೀಕರಣ ವೆಚ್ಚವನ್ನು ನಿಯಂತ್ರಣದಲ್ಲಿಡುತ್ತಲೇ ಸಮೃದ್ಧ ಜೈವಿಕ ಒಳನೋಟಗಳನ್ನು ನೀಡುವ ಭರವಸೆ ನೀಡುತ್ತದೆ.