Qwen 3.6 inafikia throughput ileile ya token kama Qwen 3.5 kwenye RTX 4070—token 38.76 kwa sekunde dhidi ya 36.7 t/s—lakini inashughulikia mawakala huru (autonomous agents) na msaada wa uandishi wa kodi (coding assistance) kwa ufanisi mkubwa zaidi. Hili ni jambo muhimu kwa yeyote anayetengeneza zana zinazoendeshwa na AI kwenye vifaa vya kawaida vya watumiaji (consumer-grade hardware).
Kwa nini namba hizi ni muhimu
Modeli zote mbili zina idadi sawa ya parameter zinazofanya kazi (active-parameter count), hivyo kasi halisi inapaswa kuwa sawa. Jaribio la awali lilionyesha kupungua kwa kasi kwa kiasi kikubwa kwa 3.6, lakini mchakato usiohitajika ulikuwa unatumia GB 11 za VRAM na kulazimisha modeli kutumia RAM ya mfumo. Baada ya kusitisha mchakato huo, throughput ilirudi katika kiwango kinachotarajiwa, ikithibitisha kuwa matoleo yote mawili yanafanya kazi kwa kasi sawa kabisa kwa bajeti ya VRAM ya GB 12.
Ni nini hasa kinachotofautiana
Maboresho yako katika uwezo, si katika uzalishaji wa token. Vipimo vya watengenezaji (benchmarks) vinaonyesha:
- Kazi za uzalishaji za front-end zinaongezeka kwa 43 %
- Kazi za uendeshaji wa terminal zinaongezeka kwa 27 %
- Kazi zinazohusiana na uandishi wa kodi zinaongezeka kwa 11 %
Hizi zote tatu zinategemea uwezo wa modeli kuita zana (invoke tools), kudumisha madirisha marefu ya muktadha (long context windows), na kuunganisha hatua nyingi za mantiki (reasoning steps). Kiutendaji, 3.6 inarekebisha makosa kwa uaminifu zaidi, inafuata maelekezo tata, na inashughulikia mchakato wa kazi wa hatua nyingi (multi-step workflows) unaohusisha shell au IDE.
Nani anafaidika
- Watengenezaji wanaounda mawakala – Wakati AI inapotekeleza amri, kuhariri faili, au kuratibu huduma, modeli mpya inapunguza majaribio yanayofeli na kupunguza marekebisho ya mikono.
- Wasaidizi wa uandishi wa kodi – Ongezeko dogo katika kazi za uandishi wa kodi linamaanisha vipande vya kodi vya uongo (hallucinated snippets) vichache zaidi na mapendekezo bora zaidi ya uboreshaji wa kodi (refactoring).
- Watafiti wenye bajeti ndogo – Kuendesha modeli mpya kwa kasi ileile kwenye RTX 4070 moja kunaruhusu timu kuboresha bila kununua GPU za ziada.
Nani hahitaji kujisumbua
Ikiwa kazi yako inahusisha zaidi kujibu maswali rahisi au uzalishaji wa maandishi mafupi, pengo la utendaji linatoweka. Idadi ya token kwa sekunde inabaki vilevile, na matumizi ya VRAM hayoongezeki, hivyo kubadilisha hakugharimu chochote.
Hitimisho: Qwen 3.6 siyo maboresho ya kasi; ni maboresho ya uwezo. Kwenye GPU ileile ya watumiaji, inawapa watengenezaji mshirika wa AI anayeaminika zaidi na anayejitegemea zaidi huku ikibaki na gharama sawa za vifaa.
