Meta యొక్క కొత్త 30-బిలియన్-పారామీటర్ Muse Glimmer, MacBook Pro M2 Pro పై 3-బిలియన్-పారామీటర్ Llama 3.2 కంటే 56 రెట్లు నెమ్మదిగా పనిచేస్తుంది, ఇది మెజారిటీ లోకల్-ఏజెంట్ వర్క్‌ఫ్లోలను నడిపించే వేగవంతమైన, పునరావృత కాల్స్ (repetitive calls) కోసం ఈ మోడల్‌ను అన్వయించలేనిదిగా (impractical) చేస్తుంది.

లోకల్ ఏజెంట్లకు వేగం ఎందుకు ముఖ్యం

లోకల్-ఏజెంట్ లూప్‌లు ప్రతి నిమిషానికి డజన్ల కొద్దీ, కొన్నిసార్లు వందల కొద్దీ మోడల్ కాల్స్‌ను ప్రారంభిస్తాయి. ప్రతి కాల్ వల్ల లేటెన్సీ (latency) పెరుగుతుంది; ఈ మొత్తం ఆలస్యం రెస్పాన్సివ్‌నెస్‌ను దెబ్బతీస్తుంది. అందువల్ల, డెవలపర్లు ఖచ్చితత్వాన్ని ఇచ్చే అతి చిన్న మోడల్‌నే ఉపయోగిస్తారు, సమస్యకు నిజంగా లోతైన రీజనింగ్ అవసరమైనప్పుడు మాత్రమే పెద్ద మోడళ్లను మారుస్తారు. Meta, Muse Glimmerను ఈ లూప్‌ల కోసం రూపొందించిన ఒక “thinking” మోడల్‌గా మార్కెట్ చేసింది, ఇది ఆన్-డివైస్ ప్రయోజనాన్ని కోల్పోకుండా మరింత మెరుగైన ఇన్ఫరెన్స్‌ను (inference) అందిస్తుందని వాగ్దానం చేసింది.

బెంచ్‌మార్క్ సెటప్

మేము 32 GB RAM ఉన్న MacBook Pro M2 Pro పై ఈ పరీక్షను నిర్వహించాము, ఇందులో మూడు ప్రాతినిధ్య టాస్క్‌లను కొలవగా:

  • Context re-read speed – మోడల్ ఇప్పటికే చూసిన ప్రాంప్ట్‌ను ఎంత వేగంగా ప్రాసెస్ చేస్తుంది.
  • Constrained JSON extraction – ఫ్రీ-ఫామ్ టెక్స్ట్ నుండి స్ట్రక్చర్డ్ డేటాను సేకరించడం, ఇది టూల్స్‌ను పిలవడానికి ముందు చేసే సాధారణ దశ.
  • Tool calling – సరిగ్గా ఫార్మాట్ చేయబడిన ఫంక్షన్ కాల్‌ను రూపొందించడం.

మూడు మోడళ్లను పోల్చాము:

మోడల్ (Model) ప్రాంప్ట్ స్పీడ్ (tok/s) జనరేషన్ స్పీడ్ (tok/s) JSON సక్సెస్ (5-ట్రయల్) కాల్‌కు పట్టే సమయం
Llama 3.2 3B 702.9 56.7 5/5 0.6 s
Qwen 3 14B 161.8 14.6 5/5 16.1 s
Muse Glimmer 30B 56.7 7.1 5/5 33.4 s

మూడు మోడళ్లు కూడా ఖచ్చితత్వ లక్ష్యాన్ని చేరుకున్నాయి, ప్రతి ట్రయల్‌లో ఒకే రకమైన JSON అవుట్‌పుట్‌ను అందించాయి. 3 B మోడల్ పూర్తి పైప్‌లైన్‌ను ఒక సెకను కంటే తక్కువ సమయంలో పూర్తి చేసింది; 30 B మోడల్‌కు అర నిమిషం కంటే ఎక్కువ సమయం పట్టింది.

ఈ సంఖ్యల అర్థం ఏమిటి

56 రెట్ల స్లోడౌన్ (slowdown) నేరుగా CPU వినియోగాన్ని మరియు వాక్-క్లాక్ సమయాన్ని (wall-clock time) పెంచుతుంది, ఇది తద్వారా శక్తి వినియోగాన్ని పెంచుతుంది మరియు ఒకే మెషిన్ ఎన్ని కన్కరెంట్ ఏజెంట్లను (concurrent agents) నిర్వహించగలదనే దానిని పరిమితం చేస్తుంది. “Thinking” మోడ్ ఆఫ్ చేసినప్పటికీ, Muse Glimmer ఆలోచించడానికి అదనపు టోకెన్లను ఖర్చు చేస్తూనే ఉంది, దీనివల్ల ఈ లేటెన్సీ అనేది ఏదో ఒక ఆప్షనల్ ఫీచర్ కాదు, అది ఆర్కిటెక్చర్‌లోనే అంతర్భాగమై ఉందని అర్థమవుతోంది.

చాట్-బాట్‌లు, పర్సనల్ అసిస్టెంట్‌లు లేదా తక్షణమే స్పందించాల్సిన ఆటోనమస్ స్క్రిప్ట్‌లను (ఉదాహరణకు: “నా క్యాలెండర్ ఈవెంట్‌లను తీసుకురా” లేదా “కొత్త ఈమెయిల్‌ను సారాంశం చేయి”) రూపొందించే డెవలపర్‌లకు, Llama 3.2 యొక్క 0.6-సెకన్ల లేటెన్సీ మానవ స్వీకృత పరిధిలో (human-acceptable bounds) సౌకర్యవంతంగా ఉంటుంది. Muse Glimmer నుండి వచ్చే 33-సెకన్ల విరామం స్పష్టంగా కనిపిస్తుంది మరియు ప్రొడక్షన్‌లో బహుశా అంగీకరించలేనిదిగా ఉంటుంది.

Muse Glimmer ఇంకా ఎక్కడ ఉపయోగపడుతుంది

ఈ బెంచ్‌మార్క్ చిన్న, డిటర్మినిస్టిక్ (deterministic) టాస్క్‌లపై దృష్టి సారించింది. Muse Glimmer ఓపెన్-ఎండెడ్ రీజనింగ్‌లో మెరుగ్గా పనిచేస్తుంది, అక్కడ అది జనరేట్ చేసే అదనపు టోకెన్లు ఒక సమాధానంపై దృష్టి పెట్టే ముందు బహుళ పరిష్కార మార్గాలను అన్వేషించగలవు. సంక్లిష్టమైన కోడ్ సింథసిస్, మల్టీ-స్టెప్ ప్లానింగ్ లేదా అస్పష్టమైన యూజర్ ఉద్దేశ్యాన్ని అర్థం చేసుకోవడం వంటి సూక్ష్మమైన తీర్పు (nuanced judgment) అవసరమయ్యే సందర్భాలలో, ఈ లోతైన మోడల్ అధిక నాణ్యత కలిగిన అవుట్‌పుట్‌లను అందించవచ్చు, ఇది ఆ వేచి ఉండే సమయానికి తగిన ఫలితాన్ని ఇస్తుంది.

ఖర్చు పరమైన అంశాలు

30 B మోడల్‌ను లోకల్‌గా రన్ చేయడం వల్ల 3 B మోడల్ కంటే ఎక్కువ GPU మెమరీ మరియు పవర్ ఖర్చవుతుంది. లాప్‌టాప్ తరహా మెషిన్‌లో, నెమ్మదైన త్రూపుట్ (throughput) వల్ల CPU ఎక్కువ సమయం ఖాళీగా ఉంటుంది, దీనివల్ల రిక్వెస్ట్‌ల బ్యాచ్ యొక్క మొత్తం రన్-టైమ్ పెరుగుతుంది. క్లౌడ్-సమానమైన ఖర్చులను గమనించే టీమ్‌లకు, ఈ లాభనష్టాల మధ్య తేడా స్పష్టంగా ఉంటుంది: ఒక పెద్ద, హోస్ట్ చేయబడిన మోడల్‌కు వేగవంతమైన API కాల్ చేయడం కంటే, నెమ్మదైన లోకల్ మోడల్ ప్రతి ఇన్ఫరెన్స్‌కు ఎక్కువ ఖర్చు చేయవచ్చు.

తదుపరి ఏమి గమనించాలి

Meta, Muse Glimmer కోసం వివరణాత్మక పెర్ఫార్మెన్స్-ట్యూనింగ్ గైడ్‌లైన్స్‌ను విడుదల చేయలేదు. భవిష్యత్తులో ఫర్మ్‌వేర్ లేదా డ్రైవర్ అప్‌డేట్‌లు వేగ వ్యత్యాసాన్ని తగ్గించవచ్చు, ముఖ్యంగా మోడల్ యొక్క రీజనింగ్ సామర్థ్యాన్ని కోల్పోకుండా దానిని క్వాంటైజ్ (quantized) లేదా ప్రూన్ (pruned) చేయగలిగితే. మల్టిపుల్ కాల్స్‌ను బ్యాచ్‌గా చేసే లేదా ఇంటర్మీడియట్ ప్రాంప్ట్‌లను క్యాష్ చేసే కమ్యూనిటీ-డ్రివెన్ టూల్‌కిట్‌లు కూడా నిర్దిష్ట వర్క్‌లోడ్‌ల కోసం లేటెన్సీని తగ్గించవచ్చు.

డెవలపర్లు వీటిని గమనించాలి:

  • Quantization breakthroughs – తక్కువ-ప్రిసిషన్ అరిథ్మెటిక్ (lower-precision arithmetic) టోకెన్-పర్-సెకండ్ రేట్లను పెంచవచ్చు.
  • Hybrid pipelines – సాధారణ ఎక్స్‌ట్రాక్షన్ కోసం చిన్న మోడల్‌ను ఉపయోగించండి మరియు కాన్ఫిడెన్స్ త్రెషోల్డ్ (confidence threshold) విఫలమైనప్పుడు మాత్రమే Muse Glimmerను ఉపయోగించండి.
  • Hardware shifts – కొత్త Apple సిలికాన్ 30 B వెయిట్ మ్యాట్రిక్స్‌ను మరింత సమర్థవంతంగా నిర్వహించవచ్చు.

Takeaway

Muse Glimmer ఒక 30 B మోడల్ వాగ్దానం చేసే లోతును అందిస్తుంది, కానీ ప్రస్తుత వినియోగదారుల హార్డ్‌వేర్‌పై, చాలా లోకల్ ఏజెంట్లను నడిపించే హై-ఫ్రీక్వెన్సీ లూప్‌ల కోసం ఇది చాలా నెమ్మదిగా ఉంది. ఆన్-డివైస్ మోడల్స్‌ను ఎక్స్‌టర్నల్ APIల వలె పరిగణించండి: ఖచ్చితత్వ అవసరాలను తీర్చే అతి చిన్న మోడల్‌తో ప్రారంభించండి, మరియు అదనపు రీజనింగ్ సామర్థ్యం నిజంగా అవసరమయ్యే పనుల కోసం మాత్రమే భారీ మోడల్‌ను ఉంచుకోండి. Meta ఈ వేగ వ్యత్యాసాన్ని తగ్గించే వరకు, రోజువారీ ఎక్స్‌ట్రాక్షన్, ఫార్మాటింగ్ మరియు సింపుల్ టూల్ డిస్పాచ్ కోసం 3 B Llama 3.2 ఒక ఆచరణాత్మక ఎంపికగా ఉంటుంది, అదే సమయంలో Muse Glimmer అప్పుడప్పుడు ఎదురయ్యే లోతైన ఆలోచన అవసరమయ్యే సవాళ్ల కోసం ఒక ఎస్కలేషన్ స్థాయిలో ఉంటుంది.

మూలం: Frank Chu రాసిన dev.to ఆర్టికల్