LongStraw തങ്ങളുടെ branch-replay സാങ്കേതികവിദ്യ ഉപയോഗിച്ച് വെറും എട്ട് H20 GPU-കൾ കൊണ്ട് reinforcement-learning (RL) പോസ്റ്റ്-ട്രെയിനിംഗിനായി 2.1 മില്യൺ ടോക്കൺ പൊസിഷനുകൾ പ്രോസസ്സ് ചെയ്യാമെന്ന് പ്രഖ്യാപിച്ചു, ഇത് ഹാർഡ്വെയർ ചിലവ് പത്തിരട്ടി വരെ കുറയ്ക്കുന്നു. ലോംഗ്-കോൺടെക്സ്റ്റ് മോഡലുകൾ പരിശീലിപ്പിക്കാൻ സാധാരണയായി ഡസൻ കണക്കിന് ഹൈ-എൻഡ് GPU-കൾ ആവശ്യമാണ്, ഇത് ഗവേഷണ ലാബുകൾക്കും സ്റ്റാർട്ടപ്പുകൾക്കും ഒരു വലിയ തടസ്സമാണ് എന്നതിനാൽ ഈ പ്രഖ്യാപനം ഏറെ പ്രാധാന്യമർഹിക്കുന്നു.
എന്തുകൊണ്ടാണ് ലോംഗ്-കോൺടെക്സ്റ്റ് RL ചിലവേറിയതാകുന്നത്
ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ RL അധിഷ്ഠിത ഫൈൻ-ട്യൂണിംഗ് സാധാരണയായി ഒരേ പ്രോംപ്റ്റിനായി നിരവധി ബദൽ പൂർത്തീകരണങ്ങൾ (completions) സൃഷ്ടിക്കുന്ന റോളൗട്ടുകൾ (rollouts) നടത്തുന്നു. ഓരോ റോളൗട്ടും ബാക്ക്-പ്രൊപ്പഗേറ്റ് ചെയ്യേണ്ടതുണ്ട്, അതിനാൽ പ്രോസസ്സ് ചെയ്യുന്ന ആകെ ടോക്കൺ പൊസിഷനുകളുടെ എണ്ണത്തിനനുസരിച്ച് കമ്പ്യൂട്ട് ചിലവ് വർദ്ധിക്കുന്നു. ഒരു മില്യൺ ടോക്കൺ കോൺടെക്സ്റ്റ് ലക്ഷ്യമിടുന്ന നിലവിലെ പൈപ്പ്ലൈനുകൾക്ക് ന്യായമായ സമയത്തിനുള്ളിൽ പൂർത്തിയാക്കാൻ പലപ്പോഴും 64 മുതൽ 128 വരെ GPU-കൾ ആവശ്യമാണ്. ആ ഹാർഡ്വെയറിന്റെ ചിലവും, അതിന് ആവശ്യമായ വൈദ്യുതിയും കൂളിംഗും കോൺടെക്സ്റ്റ് നീളം എത്രത്തോളം വർദ്ധിപ്പിക്കാം എന്നതിനെ പരിമിതപ്പെടുത്തുന്നു.
ബ്രാഞ്ച് റീപ്ലേ എങ്ങനെ ജോലിഭാരം കുറയ്ക്കുന്നു
ട്രാൻസ്ഫോർമർ ജനറേഷനെക്കുറിച്ചുള്ള രണ്ട് നിരീക്ഷണങ്ങളെ അടിസ്ഥാനമാക്കിയാണ് LongStraw-ന്റെ സമീപനം:
- റോളൗട്ടുകളിലുടനീളം പ്രോംപ്റ്റും മറുപടിയുടെ ആദ്യ ഭാഗവും ഒന്നുതന്നെയാണ്.
- ഓരോ മറുപടിയുടെയും വ്യതിയാനം സംഭവിക്കുന്ന അവസാന ഭാഗത്തിന് (divergent tail) മാത്രമേ പുതിയ കമ്പ്യൂട്ടേഷൻ ആവശ്യമായിട്ടുള്ളൂ.
പങ്കിട്ട പ്രിഫിക്സിനായുള്ള (shared prefix) ആക്ടിവേഷനുകൾ രേഖപ്പെടുത്തുന്ന ഒരു ആർക്കിടെക്ചർ-അവയർ എക്സിക്യൂഷൻ സ്റ്റാക്ക് ഈ സിസ്റ്റം നിർമ്മിക്കുന്നു. ഒരു പുതിയ ബ്രാഞ്ച് പരിശോധിക്കുമ്പോൾ, അത് വീണ്ടും കമ്പ്യൂട്ട് ചെയ്യുന്നതിന് പകരം കാഷെ ചെയ്ത (cached) പ്രിഫിക്സ് റീപ്ലേ ചെയ്യുന്നു, തുടർന്ന് പുതിയ ഭാഗത്ത് (novel segment) മാത്രം ബാക്ക്വേർഡ് പാസ് നടത്തുന്നു. പ്രായോഗികമായി ഇതിനർത്ഥം ബാക്ക്വേർഡ് പാസ് വളരെ കുറഞ്ഞ ടോക്കൺ പൊസിഷനുകളിൽ മാത്രമേ സ്പർശിക്കുന്നുള്ളൂ എന്നാണ്, ഇത് കമ്പ്യൂട്ട് ചിലവിൽ 8 മുതൽ 16 മടങ്ങ് വരെ കുറവ് നൽകുന്നു.
ഉടനടിയുള്ള സ്വാധീനം
- എട്ട് H20 GPU-കളിൽ 2.1 മില്യൺ ടോക്കൺ പൊസിഷനുകൾ പ്രോസസ്സ് ചെയ്യുന്നു; സാധാരണഗതിയിൽ ഇത്രയും കുറഞ്ഞ ഹാർഡ്വെയർ ബജറ്റിൽ ഇതിന്റെ ഒരു ചെറിയ ഭാഗം മാത്രമേ ചെയ്യാൻ കഴിയൂ.
- ലോംഗ്-കോൺടെക്സ്റ്റ് RL-ലെ തടസ്സങ്ങളെ (bottleneck) നേരിട്ട് ലക്ഷ്യം വെക്കുന്നു; കോൺടെക്സ്റ്റ് വർദ്ധിക്കുമ്പോൾ മെമ്മറി, കമ്പ്യൂട്ട് ചിലവുകൾ കുതിച്ചുയരുന്ന സാഹചര്യത്തിൽ ഇത് ഗുണകരമാണ്.
- ലാബുകൾക്ക് GPU വിഹിതം മാറ്റിവയ്ക്കാം: പ്രധാനമായും ഒരു ഇൻഫറൻസ് ആക്സിലറേറ്ററായ ഇതേ ഹാർഡ്വെയർ ഇപ്പോൾ ട്രെയിനിംഗിനായി ഉപയോഗിച്ചേക്കാം, എങ്കിലും മറ്റ് കാർഡുകളിൽ ഫലങ്ങൾ വ്യത്യാസപ്പെട്ടേക്കാം.
തുറന്ന ചോദ്യങ്ങളും പരിമിതികളും
ട്രെയിനിംഗ് വേഗതയെക്കുറിച്ചുള്ള കണക്കുകളും കൺവേർജൻസ് കർവുകളും (convergence curves) ഈ പ്രഖ്യാപനത്തിൽ ഉൾപ്പെടുത്തിയിട്ടില്ല, അതിനാൽ കമ്പ്യൂട്ട് കുറഞ്ഞത് യഥാർത്ഥ സമയം ലാഭിക്കാൻ സഹായിക്കുന്നുണ്ടോ അതോ GPU ഉപയോഗം കുറയുക മാത്രമാണോ ചെയ്യുന്നത് എന്ന് നമുക്കറിയില്ല. ഈ രീതി വിവരിച്ചിരിക്കുന്നത് ഓട്ടോറഗ്രസീവ് സാമ്പിളിംഗിന് (autoregressive sampling) വേണ്ടിയാണ്; നോൺ-ഓട്ടോറഗ്രസീവ് അല്ലെങ്കിൽ ഹൈബ്രിഡ് തന്ത്രങ്ങളുമായുള്ള ഇതിന്റെ പ്രവർത്തനം ഇനിയും പരീക്ഷിക്കപ്പെട്ടിട്ടില്ല. H20 പ്രധാനമായും ഒരു ഇൻഫറൻസ് ആക്സിലറേറ്റർ ആയതിനാൽ, H100 അല്ലെങ്കിൽ B200 പോലുള്ള സാധാരണ ട്രെയിനിംഗ് കാർഡുകളിലെ പ്രകടനം വ്യത്യാസപ്പെട്ടേക്കാം.
സ്വതന്ത്ര ബെഞ്ച്മാർക്കുകൾ ഇതുവരെ LongStraw-ന്റെ കണക്കുകൾ സ്ഥിരീകരിച്ചിട്ടില്ല. മൂന്നാം കക്ഷി പരിശോധന (third-party validation) ഇല്ലാതെ, ഈ ഫലങ്ങളെ പ്രതീക്ഷാനിർഭരമാണെങ്കിലും താൽക്കാലികമായി മാത്രം കാണണം.
എന്താണ് ഇതിന്റെ പ്രസക്തി
ബ്രാഞ്ച്-റീപ്ലേ ആശയം Direct Preference Optimization (DPO) അല്ലെങ്കിൽ Proximal Policy Optimization (PPO) പോലുള്ള മറ്റ് RL ഫൈൻ-ട്യൂണിംഗ് അൽഗോരിതങ്ങളിലേക്ക് വ്യാപിപ്പിക്കുകയാണെങ്കിൽ, ലോംഗ്-കോൺടെക്സ്റ്റ് മോഡലുകളുടെ ചിലവ് സംബന്ധിച്ച തടസ്സങ്ങൾ നീങ്ങിക്കൊള്ളും.
ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- വിവിധ GPU ആർക്കിടെക്ചറുകളിൽ മൂന്നാം കക്ഷി നടത്തുന്ന പരീക്ഷണങ്ങൾ.
- ട്രെയിനിംഗ് ത്രൂപുട്ട് (throughput), ബേസ്ലൈൻ പൈപ്പ്ലൈനുകളുമായി താരതമ്യം ചെയ്യുമ്പോൾ മോഡലിന്റെ ഗുണനിലവാരം എന്നിവയെക്കുറിച്ചുള്ള LongStraw-ൽ നിന്നുള്ള പുതിയ വിവരങ്ങൾ.
