Llama.cpp b10327 imerekebisha hitilafu muhimu ya CUDA quantization, ikistabilisha utendaji wa inference wa GPU wa ndani kwenye kadi za NVIDIA na kuongeza kasi zaidi kutoka kwa vifaa vilevile. Marekebisho haya ni muhimu kwa yeyote anayerunisha miundo ya aina ya LLaMA kwenye GPU ya daraja la watumiaji, ambapo hitilafu za kusimama ghafla (crashes) na upotevu mdogo wa usahihi vimekuwa tatizo la kudumu.

Hitilafu iliyozuia utendaji wa inference wa ndani

Llama.cpp ni injini maarufu ya chanzo huru kwa ajili ya kuendesha miundo mikubwa ya lugha (large language models) kwenye CPU na GPU bila kutumia huduma ya wingu (cloud). Kivutio chake kikubwa ni uwezo wa kuendesha miundo iliyofanyiwa quantization—uzito (weights) uliohifadhiwa katika mifumo ya bit za chini—kwenye GPU zenye ukubwa wa wastani. Toleo la b10327 linarekebisha mahesabu ya idadi ya thread na block yanayotumiwa wakati wa kuzindua hizo quantised kernels kwenye jukwaa la CUDA la NVIDIA.

Mahesabu ya awali yalionyesha uwezekano wa kutokuendana kwa kazi (work-items), jambo lililopelekea matatizo mawili ya kivitendo:

  • Usimamizi mbaya wa kumbukumbu – kernels wakati mwingine zilifikia kumbukumbu nje ya buffer iliyotengwa, na kusababisha hitilafu za kusimama ghafla (crashes) au uharibifu wa data usioonekana.
  • Ukosefu wa usahihi wa kihisabati – operesheni za floating-point zilifanya kazi kwa kiwango cha chini, na kudhoofisha ubora wa maandishi yanayozalishwa.

Matatizo yote mawili yalijitokeza tu chini ya vikwazo vikali vya kumbukumbu vya quantised inference, jambo lililofanya iwe vigumu kuyathibitisha kwenye utendaji mkubwa wa full-precision.

Kwa nini marekebisho haya ni ushindi kwa AI ya kwenye kifaa

Waendelezaji na wapenzi wa teknolojia wanategemea inference ya ndani ili kuweka data kuwa ya siri, kuepuka ucheleweshaji (latency) kutokana na mawasiliano ya mtandaoni, na kupunguza gharama za uendeshaji. Hitilafu hiyo ilimaanisha kuwa hata wakati modeli inatoshea kwenye kumbukumbu ya GPU, bado ingeweza kufeli bila kutabirika. Kwa kutumia vigezo sahihi vya uzinduzi, vifaa vilevile sasa vinatoa:

  • Utendaji wa kuaminika zaidi – hitilafu chache za kukosa kumbukumbu (out-of-memory crashes), na usindikaji wa batch uliotulia zaidi.
  • Kasi iliyoboreshwa – sasisho hili huongeza uaminifu na ufanisi wa kazi (throughput).

Kwa GPU ya daraja la watumiaji, tofauti hiyo inaweza kuwa mpaka kati ya chatbot inayoweza kutumika na demo inayofeli mara kwa mara.

Muhtasari wa maboresho mapana ya AI ya GPU

Ingawa marekebisho ya Llama.cpp ndiyo habari kuu, seti nyingine ya matoleo inasukuma mfumo wa AI wa ndani mbele:

  • NVIDIA NeMo Speech 3.0 inatoa seti mpya ya zana kwa ajili ya utambuzi wa sauti wa kiotomatiki, text-to-speech, na miundo mikubwa ya lugha ya sauti (speech-large language models). Mpangilio mpya unarahisisha uundaji wa wasaidizi wa sauti maalum.
  • AMD ROCm inaongeza uunganishaji wa SVDQuant kupitia maktaba ya Quark, ikiruhusu miundo ya diffusion kama Stable Diffusion kufanya kazi kwa kutumia kumbukumbu kidogo kwenye GPU za AMD. Moduli ya VSA (Video Sparse Attention) inayofuatana nayo inaahidi uzalishaji wa video wa haraka kwa kupunguza hesabu zinazohitajika kwa hatua za diffusion.
  • Linux kernel 7.3 itatambulisha mfumo wa TTM (Translation Table Maps) wenye nguvu zaidi kwa ajili ya kumbukumbu ya michoro (graphics memory). Mabadiliko haya yanalenga kuboresha urejesho wa kumbukumbu kwa kazi nzito za kompyuta, jambo ambalo linaweza kusaidia kwa njia isiyo ya moja kwa moja utendaji wa AI inference kwenye mashine zinazotumia Linux.

Nani anafaidika, nani anapaswa kuwa mwangalifu

Waendelezaji huru, kampuni changu, na timu zinazozingatia faragha ambazo tayari zimewekeza kwenye vifaa vya NVIDIA vya daraja la watumiaji wanapata faida za haraka. Mifumo yao inakuwa inayotabirika zaidi, na ongezeko la utendaji linapunguza vizuizi vya kufanya majaribio na miundo mikubwa ya quantised.

Mashirika ambayo tayari yanatumia inference kwenye wingu yanaweza kuona marekebisho haya kama uthibitisho wa mbinu mseto (hybrid strategies)—kuendesha sehemu za mbele zinazohitaji kasi (latency-critical front-ends) ndani ya kifaa huku zikihamishia kazi nzito za batch kwenye wingu. Hata hivyo, marekebisho haya hayafuti vizuizi vya ndani vya AI ya kwenye kifaa, kama vile ukomo wa VRAM au pengo la ubora kati ya miundo ya quantised na ile ya full-precision.

Nini cha kufuatilia baadaye

  • Maboresho zaidi ya Llama.cpp – matoleo yanayokuja yataimarisha kernel fusion na kuongeza uunganishaji wa mifumo mipya ya NVIDIA.
  • Viwango vya quantization vya watoa huduma mbalimbali – kadiri ROCm ya AMD inavyopata SVDQuant, jamii inaweza kuungana kwenye mfumo mmoja wa bit za chini, jambo linalorahisisha uhamishaji wa modeli.
  • Ujumuishaji wa vipengele vya NeMo Speech kwenye mifumo ya uendeshaji ya ndani unaweza kuleta uwezo wa sauti kwenye mfumo uleule wa inference wa ndani ambao sasa unatumia modeli za maandishi kwa uaminifu zaidi.

Marekebisho ya b10327 yanathibitisha kuwa marekebisho ya mstari mmoja tu katika mfumo wa uzinduzi (launch geometry) yanaweza kuwa na athari kubwa sana kwenye uwezo wa kutumia AI ya ndani. Ikiwa bado unakabiliana na hitilafu za kusimama ghafla (crashes) kwenye GPU ya daraja la watumiaji, sasisha llama.cpp sasa kwa uzoefu wa inference thabiti na wa haraka zaidi.