டிரான்ஸ்பார்மர்களுக்கு அப்பால்: LLM-களின் அடுத்த யுகத்தை மறுவரையறை செய்யும் ஸ்டார்ட்அப்கள்
பெரிய மொழி மாதிரிகளின் (LLMs) கணக்கீட்டுத் தேவைகள் ஒரு இக்கட்டான நிலையை எட்டியுள்ளதால், டிரான்ஸ்பார்மர் (transformer) காலம் ஒரு அடிப்படைத் தடையை எதிர்கொண்டுள்ளது. 2017-ஆம் ஆண்டின் "Attention Is All You Need" ஆய்வறிக்கை தற்போதைய AI எழுச்சிக்கு அடித்தளமிட்டாலும், உண்மையான செயல்திறனைப் பெறுவதற்காக அதன் மையக் கட்டமைப்பை மாற்றியமைக்க அல்லது புதியதாக உருவாக்க ஒரு புதிய தலைமுறை ஸ்டார்ட்அப்கள் இப்போது போட்டியிட்டு வருகின்றன.
டிரான்ஸ்பார்மர் தடை: ஏன் டென்ஸ் அட்டென்ஷன் (Dense Attention) தோல்வியடைகிறது?
கிட்டத்தட்ட ஒரு தசாப்தமாக, "டென்ஸ் அட்டென்ஷன்" (dense attention) எனப்படும் வழிமுறையின் மூலம் இயங்கும் டிரான்ஸ்பார்மர், AI தொழில்துறையின் இயந்திரமாக இருந்து வருகிறது. இந்த செயல்முறை ஒரு உரைத் தொகுப்பில் உள்ள ஒவ்வொரு டோக்கனையும் (token) மற்ற அனைத்து டோக்கன்களுடனும் மிகப்பெரிய அளவிலான பெருக்கல் மூலம் ஒப்பிடுகிறது. இது பொருளின் கருத்தைப் புரிந்துகொள்வதில் வியக்கத்தக்க துல்லியத்தைக் கொண்டிருந்தாலும், இதன் கணிதச் சிக்கல் (mathematical complexity) மிக வேகமாக அதிகரிக்கிறது.
உதாரணமாக, 10,000 சொற்கள் கொண்ட ஒரு ஆவணத்தை கையாள டிரான்ஸ்பார்மர் சுமார் 50 மில்லியன் பெருக்கல்களைச் செய்ய வேண்டியிருக்கலாம். கணக்கீட்டில் ஏற்படும் இந்த வர்க்க வளர்ச்சி (quadratic growth) இரண்டு மிகப்பெரிய சவால்களுக்கு வழிவகுக்கிறது: விண்ணைத் தொடும் எரிசக்தி நுகர்வு மற்றும் வரையறுக்கப்பட்ட கான்டெக்ஸ்ட் விண்டோக்கள் (context windows). OpenAI இந்த ஆண்டு கணினித் தேவைகளுக்காக 50 பில்லியன் டாலர்களைச் செலவிடத் தயாராக உள்ளதாகவும், 2030-க்குள் தரவு மையங்களின் மின்சாரத் தேவை இரட்டிப்பாகும் என்றும் எதிர்பார்க்கப்படுவதால், இந்தத் துறை செலவு மற்றும் இயற்பியல் ஆகிய இரண்டிலும் ஒரு சுவரைத் தட்டி நிற்கிறது.
அட்டென்ஷனை மறுபரிசீலனை செய்தல்: ஸ்பார்ஸ் மெக்கானிசம்களின் (Sparse Mechanisms) எழுச்சி
செயல்திறன் நெருக்கடியைத் தீர்க்க, பல ஸ்டார்ட்அப்கள் டென்ஸ் அட்டென்ஷனில் இருந்து "ஸ்பார்ஸ் அட்டென்ஷன்" (sparse attention) நோக்கி நகர முயற்சிக்கின்றன. சாத்தியமான அனைத்து வார்த்தை இணைகளையும் கணக்கிடுவதற்குப் பதிலாக, ஸ்பார்ஸ் அட்டென்ஷன் மிகவும் தொடர்புடைய இணைப்புகளில் மட்டுமே கவனம் செலுத்துகிறது, இது கணக்கீட்டுச் சுமையைக் கணிசமாகக் குறைக்கிறது.
மியாமி-அடிப்படையிலான ஸ்டார்ட்அப் Subquadratic, தனது SubQ மாடல் மூலம் இந்தத் துறையில் முன்னணியில் உள்ளது. துல்லியத்தைப் பராமரிப்பதில் சிரமப்பட்ட முந்தைய ஸ்பார்ஸ் மெக்கானிசம்களைப் போலல்லாமல், கோடிங் (coding) மற்றும் தேடல் (search) போன்ற சிறப்புப் பணிகளில் தனது தொழில்நுட்பம் முக்கிய நீரோட்ட LLM-களுக்கு இணையாக இருக்கும் என்று Subquadratic கூறுகிறது. தேவையற்ற டோக்கன்களுக்காக நேரத்தைச் செலவிடுவதைத் தவிர்த்து, ஒரு குறிப்பிட்ட உரைக்கு எந்த வார்த்தைகள் உண்மையில் முக்கியம் என்பதை உடனுக்குடன் கண்டறியும் ஒரு டைனமிக் சிஸ்டத்தை இவர்களின் அணுகுமுறை கொண்டுள்ளது.
பவர் ரிடென்ஷன் (Power Retention): ரோலிங் சம்மரிகளை (Rolling Summaries) நோக்கி நகர்தல்
மற்றொரு அணுகுமுறை அட்டென்ஷன் மெக்கானிசத்திலிருந்து முற்றிலும் விலகிச் செல்வதாகும். சான் பிரான்சிஸ்கோ-அடிப்படையிலான Manifest AI, "பவர் ரிடென்ஷன்" (power retention) எனப்படும் ஒரு நுட்பத்தில் முன்னோடியாக உள்ளது. SubQ போன்ற ஸ்பார்ஸ் அட்டென்ஷன் மாடல்கள் முழு கான்டெக்ஸ்ட் விண்டோவின் ஒரு தோராயமான பிம்பத்தைத் தக்கவைக்க முயற்சிக்கும் நிலையில், பவர் ரிடென்ஷன் மாடலுக்கு அதன் நினைவகத்தின் ஒரு ரோலிங் சம்மரியை (rolling summary) வழங்குவதன் மூலம் செயல்படுகிறது.
புதிய தகவல்கள் கான்டெக்ஸ்ட் விண்டோவிற்குள் நுழையும் போது, மாடல் குறைவான தொடர்புடைய தரவைக் கண்டறிந்து நீக்குகிறது, இதனால் உள்ளீட்டின் அளவு எதுவாக இருந்தாலும் கணக்கீட்டுச் சுமை கட்டுப்படியாகக் கூடியதாக இருப்பதை உறுதி செய்கிறது. Manifest AI ஏற்கனவே இந்த அணுகுமுறையின் சாத்தியக்கூறுகளை நிரூபித்துள்ளது:
- பவர் ரிடென்ஷனைப் பயன்படுத்தி ஓப்பன் சோர்ஸ் StarCoder மாடலை PowerCoder ஆக மாற்றுவதன் மூலம்.
- அலிபாபாவின் பிரபலமான Qwen ஓப்பன் சோர்ஸ் மாடல்களுக்கு இணையாக இருக்கும் என்று அவர்கள் கூறும் Brumby மாடலை வெளியிடுவதன் மூலம்.
குறைந்தபட்ச மறுபயிற்சியுடன் (retraining) தற்போதுள்ள டிரான்ஸ்பார்மர் மாடல்களை பவர் ரிடென்ஷன் மாடல்களாக மாற்றும் திறன், "LLMs+" — அதாவது அடுத்த தலைமுறை மாடல்களுக்கான மாற்றம் — எதிர்பார்த்ததை விட மிக வேகமாக நடக்கக்கூடும் என்பதைக் காட்டுகிறது.
முக்கியக் குறிப்புகள்
- டிரான்ஸ்பார்மர் வரம்பு: டென்ஸ் அட்டென்ஷனின் வர்க்க வளர்ச்சி (quadratic scaling), தற்போதைய LLM-களை இயக்குவதற்கு மிகவும் செலவுமிக்கதாகவும், மிகப்பெரிய தரவுத் தொகுப்புகள் அல்லது நீண்ட வடிவிலான தர்க்கங்களுக்கு (long-form reasoning) பயன்படுத்துவதற்கு கடினமானதாகவும் மாற்றுகிறது.
- ஸ்பார்ஸ் vs ரிடென்ஷன்: ஸ்டார்ட்அப்கள் இந்தச் சிக்கலை இரு பக்கங்களிலிருந்தும் அணுகுகின்றன: Subquadratic ஸ்பார்ஸ் கணக்கீடுகள் (SubQ) மூலம் அட்டென்ஷனை மேம்படுத்துகிறது, அதே சமயம் Manifest AI அதை ரோலிங் சம்மரிகள் (Power Retention) மூலம் மாற்றுகிறது.
- பொருளாதாரத் தேவை: AI கணக்கீட்டுச் செலவுகள் பில்லியன் கணக்கான டாலர்களை எட்டும்போது, அடுத்த AI யுகத்தின் வெற்றியாளர் வெறும் அளவை (scale) மட்டும் பெரிதாக்காமல், செயல்திறனை (efficiency) மேம்படுத்துவதில் வெற்றி பெறுபவராகவே இருக்கக்கூடும்.
