LongStraw தனது branch-replay நுட்பத்தைப் பயன்படுத்தி, வெறும் எட்டு H20 GPU-களைக் கொண்டு reinforcement-learning (RL) பயிற்சிக்குப் பிந்தைய செயல்பாட்டிற்காக 2.1 மில்லியன் டோக்கன் நிலைகளைச் செயலாக்க முடியும் என்று அறிவித்துள்ளது; இது வன்பொருள் செலவை பன்மடங்கு குறைக்கிறது. நீண்ட சூழல் மாதிரிகளை (long-context models) பயிற்றுவிக்க பாரம்பரியமாகப் பல டஜன் உயர்தர GPU-கள் தேவைப்படுகின்றன, இது பெரும்பாலான ஆராய்ச்சி ஆய்வகங்கள் மற்றும் தொடக்க நிறுவனங்களுக்கு ஒரு தடையாக உள்ளது என்பதால் இந்த அறிவிப்பு முக்கியத்துவம் பெறுகிறது.
ஏன் நீண்ட சூழல் RL செலவுமிக்கது
பெரிய மொழி மாதிரிகளின் (large language models) RL அடிப்படையிலான fine-tuning என்பது பொதுவாக ஒரே prompt-க்கு பல மாற்று நிறைவுகளை உருவாக்கும் rollouts-களை இயக்குகிறது. ஒவ்வொரு rollout-ம் back-propagated செய்யப்பட வேண்டும், எனவே செயலாக்கப்படும் மொத்த டோக்கன் நிலைகளின் எண்ணிக்கைக்கு ஏற்ப கணக்கீட்டுச் செலவு அதிகரிக்கிறது. ஒரு மில்லியன் டோக்கன் சூழலை இலக்காகக் கொண்ட தற்போதைய pipelines, ஒரு நியாயமான கால அவகாசத்திற்குள் முடிக்க பெரும்பாலும் 64 முதல் 128 GPU-களைத் தேவைப்படுகின்றன. அந்த வன்பொருளின் செலவுடன், அதற்கான மின்சாரம் மற்றும் குளிர்விப்புத் தேவையும் சேர்ந்து, பயிற்சியாளர்கள் சூழல் நீளத்தை (context length) எவ்வளவு தூரம் அதிகரிக்க முடியும் என்பதைக் கட்டுப்படுத்துகிறது.
branch replay எவ்வாறு பணிச்சுமையைக் குறைக்கிறது
LongStraw-ன் அணுகுமுறை transformer உருவாக்கம் குறித்த இரண்டு அவதானிப்புகளை அடிப்படையாகக் கொண்டது:
- rollouts முழுவதும் prompt மற்றும் பதிலின் ஆரம்பப் பகுதி ஆகியவை ஒரே மாதிரியாக உள்ளன.
- ஒவ்வொரு பதிலின் மாறுபட்ட இறுதிப் பகுதி (divergent tail) மட்டுமே உண்மையில் புதிய கணக்கீட்டைத் தேவைப்படுத்துகிறது.
இந்த அமைப்பு பகிரப்பட்ட prefix-க்கான activations-களைப் பதிவு செய்யும் ஒரு architecture-aware execution stack-ஐ உருவாக்குகிறது. ஒரு புதிய கிளை (branch) ஆராயப்படும்போது, அது prefix-ஐ மீண்டும் கணக்கிடுவதற்குப் பதிலாக, சேமிக்கப்பட்ட (cached) prefix-ஐ மறுபதிவு (replay) செய்கிறது, பின்னர் புதிய பகுதியில் மட்டும் backward pass-ஐ இயக்குகிறது. நடைமுறையில், இதன் பொருள் backward pass மிகக் குறைவான டோக்கன் நிலைகளை மட்டுமே தொடுகிறது, இது மூலக் கணக்கீட்டில் (raw compute) 8 முதல் 16 மடங்கு குறைப்பைக் கொடுக்கிறது.
உடனடி தாக்கம்
- எட்டு H20 GPU-களில் 2.1 M டோக்கன் நிலைகள் செயலாக்கப்படுகின்றன; வழக்கமாக இவ்வளவு குறைந்த வன்பொருள் பட்ஜெட்டில் அதன் ஒரு சிறு பகுதியை மட்டுமே கையாள முடியும்.
- நீண்ட சூழல் RL-ல் உள்ள தடையை (bottleneck) நேரடியாகக் குறிவைக்கிறது; இதில் சூழல் வளர வளர நினைவகம் (memory) மற்றும் கணக்கீட்டுச் செலவுகள் வெடிக்கின்றன.
- ஆய்வகங்கள் GPU ஒதுக்கீட்டை மாற்றியமைக்கலாம்: முதன்மையாக ஒரு inference accelerator ஆக இருக்கும் அதே வன்பொருளை இப்போது பயிற்சியிற்கும் பயன்படுத்தலாம், இருப்பினும் மற்ற கார்டுகளில் முடிவுகள் மாறுபடலாம்.
திறந்த கேள்விகள் மற்றும் வரம்புகள்
இந்த அறிவிப்பில் பயிற்சி வேகம் குறித்த புள்ளிவிவரங்கள் மற்றும் convergence curves விடுபட்டுள்ளன, எனவே கணக்கீட்டு குறைப்பு என்பது வேகமான wall-clock நேரத்திற்கு வழிவகுக்குமா அல்லது குறைந்த GPU occupancy-க்கு மட்டுமே வழிவகுக்குமா என்பது நமக்குத் தெரியவில்லை. இந்த முறை autoregressive sampling-க்காக விவரிக்கப்பட்டுள்ளது; non-autoregressive அல்லது hybrid உத்திகளுடன் அதன் செயல்பாடு இன்னும் சோதிக்கப்படவில்லை. H20 என்பது முக்கியமாக ஒரு inference accelerator என்பதால், H100 அல்லது B200 போன்ற மிகவும் பொதுவான பயிற்சி கார்டுகளில் இதன் செயல்பாடு மாறுபடலாம்.
சுதந்திரமான பெஞ்ச்மார்க்குகள் (Independent benchmarks) இன்னும் LongStraw-ன் எண்களைச் சரிபார்க்கவில்லை. மூன்றாம் தரப்பு சரிபார்ப்பு இல்லாமல், சமூகம் இந்த முடிவுகளை நம்பிக்கைக்குரியவை ஆனால் தற்காலிகமானவை என்று கருத வேண்டும்.
இதில் உள்ள முக்கியத்துவம்
branch-replay யோசனை Direct Preference Optimization (DPO) அல்லது Proximal Policy Optimization (PPO) போன்ற பிற RL fine-tuning அல்காரிதம்களுக்கு விரிவுபடுத்தப்பட்டால், நீண்ட சூழல் மாதிரிகளுக்கான செலவுத் தடை நீங்கக்கூடும்.
கவனிக்க வேண்டியவை
- பல்வேறு GPU கட்டமைப்புகளில் மூன்றாம் தரப்பு மறுஉருவாக்க முயற்சிகள் (replication attempts).
- அடிப்படை pipelines உடன் ஒப்பிடும்போது, பயிற்சித் திறன் (training throughput) மற்றும் இறுதி மாதிரியின் தரம் குறித்த LongStraw-ன் அறிவிப்புகள்.
