Zaidi ya Transformers: Startups Zinazofafanua Enzi Inayofuata ya LLMs
Enzi ya transformer inakabiliwa na kikwazo cha msingi huku mahitaji ya kimahesabu ya mifumo mikubwa ya lugha (LLMs) yakifikia hatua ya hatari. Ingawa makala ya "Attention Is All You Need" ya mwaka 2017 iliweka msingi wa msisimko wa sasa wa AI, kizazi kipya cha startups sasa kinashindana kubadilisha au kugundua upya usanifu wa msingi ili kufikia ufanisi wa kweli.
Kikwazo cha Transformer: Kwa Nini Dense Attention Inafeli
Kwa karibu muongo mmoja, transformer imekuwa injini ya tasnia ya AI, ikiongozwa na mfumo unaojulikana kama "dense attention." Mchakato huu unalinganisha kila token katika kipande cha maandishi na kila token nyingine kupitia kuzidisha kwa kiwango kikubwa sana. Ingawa ni sahihi sana katika kunasa maana ya kimaana (semantic meaning), ugumu wa hisabati huongezeka kwa kasi isiyofaa.
Kwa mfano, hati yenye maneno 10,000 inaweza kuhitaji transformer kufanya takriban zidisho milioni 50. Ukuaji huu wa quadratic katika mahesabu husababisha changamoto mbili kubwa: matumizi ya nishati yanayoongezeka kwa kasi kubwa na madirisha ya muktadha (context windows) yenye ukomo. Kwa kuwa OpenAI inaripotiwa kutumia dola bilioni 50 kwenye kompyuta mwaka huu na mahitaji ya umeme ya vituo vya data yanatarajiwa kuongezeka mara mbili kufikia mwaka 2030, tasnia hii inakwama kutokana na gharama na sheria za fizikia.
Kufikiria Upya Attention: Kuibuka kwa Mifumo ya Sparse
Ili kutatua mgogoro wa ufanisi, startups kadhaa zinajaribu kuacha "dense attention" na kuelekea kwenye "sparse attention." Badala ya kukokotoa kila muunganisho wa maneno unaowezekana, sparse attention inajikita tu kwenye miunganisho muhimu zaidi, na kupunguza kwa kiasi kikubwa mzigo wa kimahesabu.
Startup ya Subquadratic inayotokea Miami ni kiongozi katika eneo hili ikiwa na modeli yake ya SubQ. Tofauti na mifumo ya sparse iliyopita ambayo ilihangaika kudumisha usahihi, Subquadratic inadai kuwa teknolojia yake inashindana na LLMs za kawaida katika kazi maalum kama vile uandishi wa kodi (coding) na utafutaji. Mbinu yao inahusisha mfumo wa kidinamiki unaotambua ni maneno gani muhimu kwa maandishi fulani papo hapo, badala ya kupoteza nguvu kwenye token zisizo na maana.
Power Retention: Kuelekea kwenye Rolling Summaries
Mbinu nyingine inahusisha kuacha kabisa mfumo wa attention. Manifest AI inayotokea San Francisco inatanguliza mbinu inayoitwa "power retention." Wakati mifano ya sparse attention kama SubQ bado inajaribu kuhifadhi picha ya jumla ya dirisha la muktadha (context window), power retention hufanya kazi kwa kuipa modeli muhtasari unaozunguka (rolling summary) wa kumbukumbu yake.
Wakati habari mpya inapoingia kwenye dirisha la muktadha, modeli hutambua na kuondoa data zisizo na umuhimu, na kuhakikisha kuwa mzigo wa kimahesabu unabaki katika kiwango kinachoweza kudhibitiwa bila kujali ukubwa wa ingizo. Manifest AI tayari imeonyesha uwezekano wa mbinu hii kwa:
- Kubadilisha modeli ya open-source ya StarCoder kuwa PowerCoder kwa kutumia power retention.
- Kutoa Brumby, modeli ambayo wanadai inashindana na modeli maarufu za open-source za Qwen za Alibaba.
Uwezo wa kubadilisha modeli za transformer zilizopo kuwa modeli za power retention kwa mafunzo madogo (minimal retraining) unaashiria kuwa mpito kuelekea "LLMs+"—kizazi kijacho cha modeli—unaweza kutokea haraka zaidi kuliko ilivyotarajiwa.
Mambo Muhimu ya Kuzingatia
- Ukomo wa Transformer: Ukuaji wa quadratic wa dense attention unafanya LLMs za sasa kuwa ghali sana kuendesha na ni vigumu kuzikuza kwa seti kubwa za data au ufikiri wa muda mrefu (long-form reasoning).
- Sparse dhidi ya Retention: Startups zinashambulia tatizo hili kutokea pande mbili: Subquadratic inaboresha attention kupitia mahesabu ya sparse (SubQ), wakati Manifest AI inaibadilisha kwa muhtasari unaozunguka (Power Retention).
- Umuhimu wa Kiuchumi: Wakati gharama za kishughulikiaji (compute) za AI zikifikia mabilioni ya dola, mshindi wa enzi inayofuata ya AI huenda akawa yule atakayetatua suala la ufanisi badala ya ukubwa wa kishughulikiaji pekee.
