LongStraw imetangaza kuwa mbinu yake ya branch-replay inaweza kuchakata nafasi za token milioni 2.1 kwa ajili ya mafunzo ya baada ya reinforcement-learning (RL) kwa kutumia GPU nane tu za H20, ikipunguza gharama za vifaa kwa kiasi kikubwa. Dai hili ni muhimu kwa sababu mafunzo ya mifano yenye muktadha mrefu (long-context models) kwa kawaida yamehitaji mamia ya GPU za hali ya juu, jambo ambalo ni kikwazo kwa maabara nyingi za utafiti na kampuni changamoto (startups).
Kwa nini RL ya muktadha mrefu ni ghali
Urekebishaji (fine-tuning) wa mifano mikubwa ya lugha unaozingatia RL kwa kawaida hufanya rollouts zinazozalisha majibu mengi mbadala kwa ajili ya prompt moja. Kila rollout lazima ipitie back-propagation, hivyo gharama za compute huongezeka kulingana na jumla ya nafasi za token zinazochakatwa. Mifumo (pipelines) ya sasa inayolenga muktadha wa token milioni moja mara nyingi huhitaji GPU 64 hadi 128 ili kumaliza kwa muda unaokubalika. Gharama ya vifaa hivyo, pamoja na umeme na ubaridi unaohitajika, inazuia wataalamu kutanua urefu wa muktadha.
Jinsi branch replay inavyopunguza mzigo wa kazi
Mbinu ya LongStraw inategemea uchunguzi mikuu miwili kuhusu uundaji wa transformer:
- Prompt na sehemu ya awali ya jibu ni sawa katika rollouts zote.
- Ni sehemu ya mwisho inayotofautiana (divergent tail) ya kila jibu pekee inayohitaji hesabu mpya.
Mfumo huo unajenga stack ya utekelezaji inayozingatia usanifu (architecture-aware execution stack) ambayo inarekodi activations kwa ajili ya prefix inayoshirikiwa. Wakati tawi jipya linapochunguzwa, unarudia (replays) prefix iliyohifadhiwa badala ya kuifanyia hesabu upya, kisha unaendesha backward pass kwenye sehemu mpya pekee. Kiutendaji, hii inamaanisha kuwa backward pass inagusa nafasi chache sana za token, ikileta upungufu wa mara 8 hadi 16 katika compute ghafi.
Athari za haraka
- Nafasi 2.1 M za token zimechakatwa kwenye GPU nane za H20, bajeti ya vifaa ambayo kwa kawaida ingeweza kugharamia sehemu ndogo tu ya mzigo huo wa kazi.
- Kulenga moja kwa moja kizuizi (bottleneck) katika RL ya muktadha mrefu, ambapo gharama za kumbukumbu (memory) na compute huongezeka kwa kasi kadiri muktadha unavyokua.
- Maabara zinaweza kubadilisha ugawaji wa GPU: vifaa vilevile, ambavyo ni kasi ya utambuzi (inference accelerator) kimsingi, sasa vinaweza kutumika kwa mafunzo, ingawa matokeo yanaweza kutofautiana kwenye kadi nyingine.
Maswali ya wazi na mipaka
Tangazo hilo limeacha takwimu za kasi ya mafunzo na michoro ya convergence, hivyo hatujui ikiwa upungufu wa compute unatafsiriwa kuwa muda wa haraka zaidi (wall-clock time) au ni kupungua tu kwa matumizi ya GPU (GPU occupancy). Mbinu hiyo imeelezwa kwa ajili ya autoregressive sampling; tabia yake katika mikakati ya non-autoregressive au hybrid bado haijajaribiwa. Kwa sababu H20 ni kasi ya utambuzi (inference accelerator) kimsingi, utendaji kwenye kadi za mafunzo zinazotumiwa zaidi kama H100 au B200 unaweza kutofautiana.
Vipimo huru (independent benchmarks) bado havijathibitisha takwimu za LongStraw. Bila uthibitisho kutoka kwa upande wa tatu, jamii inapaswa kuchukulia matokeo hayo kama yenye matumaini lakini ya muda.
Nini kiko hatarini
Ikiwa wazo la branch-replay litapanuka hadi kwenye algoriti nyingine za RL fine-tuning kama Direct Preference Optimization (DPO) au Proximal Policy Optimization (PPO), kizuizi cha gharama kwa mifano ya muktadha mrefu kinaweza kuondolewa.
Cha kufuatilia
- Jaribio la kurudia (replication) kutoka kwa upande wa tatu kwenye aina mbalimbali za usanifu wa GPU.
- Taarifa mpya kutoka LongStraw kuhusu uwezo wa mafunzo (training throughput) na ubora wa mwisho wa modeli ikilinganishwa na mifumo ya msingi (baseline pipelines).
