Meta యొక్క కొత్త ఓపెన్ మోడల్ లోకల్గా రన్ అవుతుంది
Meta ఆగస్టు 10న 30-బిలియన్ పారామీటర్ల భాషా నమూనా (language model) అయిన Muse Glimmerని విడుదల చేసింది. ఇది ఒకే ఒక కన్స్యూమర్-గ్రేడ్ GPUపై ఏజెంటిక్ కోడింగ్ మరియు పర్సనల్-అసిస్టెంట్ పనులను చేయగలదని పేర్కొంది. ఈ ప్రకటన ఎందుకు ముఖ్యమైనదంటే, డేటాను క్లౌడ్కు పంపకుండా డెవలపర్లు లోకల్గా ఏమి చేయగలరో దాని పరిమితులను ఇది పెంచుతుంది, ఇది గోప్యతపై దృష్టి సారించే AI అప్లికేషన్లను కొత్త రూపంలోకి మారుస్తుంది.
ఈ విడుదల ఎందుకు ముఖ్యమైనది
ఓపెన్-సోర్స్ లార్జ్ లాంగ్వేజ్ మోడల్స్ (LLMs) ఇప్పుడు కోడ్ అసిస్టెంట్ల నుండి పర్సనల్ నాలెడ్జ్ బేస్ల వరకు, డిజైన్ పరంగానే ప్రైవేట్గా ఉండే ఏజెంట్లకు శక్తిని అందిస్తున్నాయి. ఇప్పటి వరకు, ఏజెంట్ బెంచ్మార్క్లలో బాగా పనిచేసే చాలా మోడల్లకు సర్వర్-గ్రేడ్ హార్డ్వేర్ అవసరమయ్యేది లేదా ప్రొప్రైటరీ APIలపై ఆధారపడేవి. Muse Glimmer యొక్క "ఎక్కడైనా రన్ చేయండి" అనే వాగ్దానం, 24 GB గ్రాఫిక్స్ కార్డ్ లేదా ఇటీవలి Apple Silicon Mac ఉన్న హాబీయిస్టులు మరియు చిన్న బృందాలకు 30B మోడల్ను అందుబాటులోకి తెస్తుంది. ఈ మోడల్ తన వాగ్దానాలను నెరవేర్చితే, డెవలపర్లు అన్ని ప్రాంప్ట్లు మరియు అవుట్పుట్లను డివైజ్లోనే ఉంచుకోవచ్చు, తద్వారా హోస్టెడ్ సర్వీసులతో వచ్చే డేటా-ఎక్స్ఫిల్ట్రేషన్ (data-exfiltration) ప్రమాదాలను నివారించవచ్చు.
Muse Glimmer అసలు ఏమిటి
Glimmer అనేది Meta యొక్క క్లోజ్డ్-సోర్స్ Muse Spark లైన్ యొక్క సంక్షిప్త వెర్షన్. అత్యంత సామర్థ్యం కలిగిన Spark వేరియంట్, Muse Spark 1.2, ఇంకా ప్రజలకు అందుబాటులో లేదు, అయితే Meta "కొన్ని వారాల్లో" ఓపెన్ రిలీజ్ చేస్తామని సూచించింది. ఈ సందర్భం ముఖ్యం: విడుదల కాని మోడల్కు ప్రివ్యూగా కాకుండా, Glimmer యొక్క స్వంత సామర్థ్యాల ఆధారంగా దానిని అంచనా వేయండి.
దీని ఆర్కిటెక్చర్ ఒక డెన్స్ కాజల్ ట్రాన్స్ఫార్మర్ (dense causal transformer), ఇది ప్రతి టోకెన్ సింగిల్ ఫార్వర్డ్ పాస్లో తదుపరి టోకెన్ను అంచనా వేసే క్లాసిక్ డిజైన్. ఆ సరళత వల్ల ల్యాప్టాప్లపై సులభంగా డిప్లాయ్ చేయవచ్చు; కొన్ని పోటీ మోడల్లు ఉపయోగించే మిక్చర్-ఆఫ్-ఎక్స్పర్ట్స్ రూటింగ్ (mixture-of-experts routing) లేదా ఇతర భారీ ట్రిక్స్ ఇందులో లేవు.
ఇందులో ఒక ముఖ్యమైన అంశం DFlash, ఇది భవిష్యత్తు టోకెన్లను ఊహించి, వాటిని సమాంతరంగా (in parallel) ధృవీకరించే ఒక స్పెక్యులేటివ్ డీకోడింగ్ టెక్నిక్. వాస్తవానికి, DFlash టెక్స్ట్ నాణ్యతను తగ్గించకుండా లాటెన్సీని (latency) తగ్గిస్తుంది, ఇది ఇంటరాక్టివ్ ఏజెంట్లకు ఒక ఉపయోగకరమైన ఫీచర్.
క్వాంటైజ్డ్ వెయిట్స్ (Quantized weights) మెమరీ వినియోగాన్ని సుమారు 17 GBకి తగ్గిస్తాయి, దీనివల్ల 24 GB VRAM ఉన్న GPUలపై ఈ మోడల్ సరిపోతుంది. ఇదే క్వాంటైజ్డ్ వెర్షన్ llama.cpp రన్టైమ్ ద్వారా Apple Siliconపై కూడా రన్ అవుతుంది, ఇది macOS వినియోగదారులకు మోడల్ను ఉపయోగించుకోవడానికి ఒక నేటివ్ మార్గాన్ని అందిస్తుంది.
పోటీదారులతో పోలిస్తే ఇది ఎలా ఉంది
Meta, Glimmerను Google యొక్క Gemma మరియు Alibaba యొక్క Qwenతో బెంచ్మార్క్ చేసింది. ఫలితాలు మిశ్రమంగా ఉన్నాయి:
- ఏజెంట్-ఓరియంటెడ్ పనులు (Agent-oriented tasks) – ప్లానింగ్ మరియు టూల్ యూస్ను పరీక్షించే కొన్ని బెంచ్మార్క్లలో Glimmer తన ఇద్దరు ప్రత్యర్థుల కంటే కొంచెం మెరుగ్గా ఉంది.
- కోడింగ్ మరియు విస్తృతమైన రీజనింగ్ (Coding and broad reasoning) – కోడ్ జనరేషన్ మరియు అనేక లాజికల్ పజిల్స్లో Qwen నిరంతరం Glimmer కంటే మెరుగైన పనితీరును కనబరుస్తుంది.
- సేఫ్టీ మెట్రిక్స్ (Safety metrics) – Gemma తక్కువ ఉల్లంఘన రేట్లను (violation rates) నమోదు చేసింది, అంటే ఒకే రకమైన పరీక్షా పరిస్థితులలో అనుమతించబడని కంటెంట్ను ఉత్పత్తి చేసే అవకాశం దీనికి తక్కువ.
క్లుప్తంగా చెప్పాలంటే, Glimmer కొన్ని నిర్దిష్ట ఏజెంట్ వర్క్లోడ్లకు పోటీగా ఉంది, కానీ విస్తృతమైన కోడింగ్ లేదా రీజనింగ్ రంగంలో ఆధిపత్యం చెలాయించలేదు.
సేఫ్టీ సిగ్నల్స్ మరియు వాటి అర్థం
ఫైల్లను చదవడం, సందేశాలను పంపడం మరియు వినియోగదారు తరపున ఇతర పనులు చేయగల పర్సనల్ ఏజెంట్లకు పునాదిగా Glimmerని Meta మార్కెట్ చేస్తోంది. ఇటువంటి సామర్థ్యాలు భద్రత (safety) విషయంలో సవాళ్లను పెంచుతాయి. మోడల్ యొక్క రిస్క్ ప్రొఫైల్పై రెండు అంతర్గత మూల్యాంకనాలు వెలుగునిచ్చాయి:
- CI Memories టెస్ట్ – Gemma కంటే Glimmer ఎక్కువ ఉల్లంఘన రేటును చూపుతుంది, అంటే ఇది ముందుగా నిర్ణయించిన సేఫ్టీ రూల్స్ను ఉల్లంఘించే అవుట్పుట్లను తరచుగా ఉత్పత్తి చేస్తుంది.
- Siren AgentDojo అటాక్ సూట్ – అన్సేఫ్ ప్రవర్తనను ప్రేరేపించడానికి రూపొందించిన అడ్వర్సరియల్ ప్రాంప్ట్ల (adversarial prompts) విషయంలో ఈ మోడల్ ఎక్కువ సక్సెస్ రేట్ను సాధించింది.
ఈ ఫలితాల ప్రకారం, నేరుగా వాడితే (out of the box), Glimmer తన తోటి మోడల్లలో కనీసం ఒకదాని కంటే సేఫ్టీ లోపాలకు ఎక్కువ అవకాశం ఉన్నట్లు కనిపిస్తోంది. కాబట్టి, మోడల్కు ప్రైవేట్ ఫైల్లు లేదా కమ్యూనికేషన్ ఛానెల్లకు యాక్సెస్ ఇవ్వాలని ప్లాన్ చేస్తున్న డెవలపర్లు, బాహ్య కంటెంట్ ఫిల్టర్లు మరియు సాండ్బాక్స్డ్ ఎగ్జిక్యూషన్ ఎన్విరాన్మెంట్లను (sandboxed execution environments) జోడించాలి.
ఎవరు దీనిని రన్ చేయడం గురించి ఆలోచించాలి
సరైన ఎంపికలు (Good fits)
- నెట్వర్క్ నుండి విడివడి ఉంటూనే, మొత్తం రిపోజిటరీని (repository) చదవగలిగే లోకల్ కోడ్-అసిస్టెంట్ అవసరమయ్యే బృందాలు.
- డేటా రెసిడెన్సీకి (data residency) ప్రాధాన్యత ఇచ్చే మరియు తమ డివైజ్ని ఎప్పుడూ వదిలి వెళ్ళని LLM కావాలనుకునే వినియోగదారులు.
- వేగం మరియు ఆన్-డివైస్ ఎగ్జిక్యూషన్ ముఖ్యం అనుకునే, అవుట్పుట్లను బ్యాచ్-ఎవాల్యుయేట్ చేయడానికి LLM-as-a-judge కోసం వెతుకుతున్న పరిశోధకులు లేదా ఇంజనీర్లు.
- 24 GB+ GPU లేదా llama.cpp రన్ చేయగల Apple Silicon Mac ఉన్న ఎవరైనా.
ఇతర అవసరాల కోసం మెరుగైన ప్రత్యామ్నాయాలు
- ఒకవేళ కోడింగ్ పనితీరు అత్యంత ప్రాధాన్యత అయితే, ప్రస్తుతం Qwen అధిక ఖచ్చితత్వాన్ని అందిస్తుంది.
- అత్యంత సున్నితమైన వ్యక్తిగత డేటాను హ్యాండిల్ చేసేటప్పుడు, Gemma యొక్క తక్కువ ఉల్లంఘన రేటు దానిని సురక్షితమైన ఎంపికగా మారుస్తుంది.
- అవసరమైన హార్డ్వేర్ లేని డెవలపర్లు, 24 GB కంటే తక్కువ మెమరీ ఉన్న GPUలపై నడిచే చిన్న మరియు విస్తృతంగా మద్దతు ఉన్న మోడల్లను చూడాలి.
తదుపరి ఏమి గమనించాలి
రాబోయే వారాల్లో Meta ఒక ఓపెన్ Muse Spark 1.2ని విడుదల చేయబోతున్నట్లు సూచించడం వల్ల సమతుల్యత గణనీయంగా మారవచ్చు. ఒకవేళ Spark అదే హార్డ్వేర్ సామర్థ్యాన్ని కలిగి ఉండి, Glimmer పనితీరుకు సమానంగా లేదా అంతకంటే మెరుగ్గా ఉంటే, ప్రస్తుత మోడల్ దీర్ఘకాలిక పరిష్కారం కంటే ఒక తాత్కాలిక మార్గం మాత్రమే కావచ్చు. థర్డ్-పార్టీ ఫిల్టర్లు, ఫైన్-ట్యూనింగ్ లేదా ప్రాంప్ట్ ఇంజనీరింగ్ ద్వారా Glimmer యొక్క భద్రతా లోపాలకు కమ్యూనిటీ ఇచ్చే స్పందన కూడా దాని వినియోగంపై ప్రభావం చూపుతుంది.
llama.cpp ద్వారా ఈ మోడల్ వెంటనే అందుబాటులోకి రావడం వల్ల డెవలపర్లు ఈరోజే ప్రయోగాలు చేయడం ప్రారంభించవచ్చు, కానీ ప్రైవేట్ డేటాను దీనికి నమ్మకంతో అప్పగించే నిర్ణయం Meta వెల్లడించిన భద్రతా గణాంకాలు మరియు స్వతంత్ర ఆడిట్ల ఆధారంగా ఉండాలి.
ముఖ్య అంశం: Muse Glimmer డెస్క్టాప్లోకి 30B LLMని తీసుకువస్తుంది, ఇది ఆన్-డివైస్ ఏజెంట్ల కోసం అవకాశాలను తెరుస్తుంది, అయినప్పటికీ దాని పనితీరు మరియు భద్రత ప్రముఖ పోటీదారుల కంటే వెనుకబడి ఉన్నాయి. ఒకవేళ లోకల్ ఎగ్జిక్యూషన్ తప్పనిసరి మరియు మీరు హార్డ్వేర్ను భరించగలిగితే దానిని ఉపయోగించండి; లేనిపక్షంలో, ఇప్పటికే కోడింగ్ ఖచ్చితత్వంలో రాణించిన లేదా బలమైన భద్రతా రికార్డు ఉన్న మోడల్ను ఎంచుకోండి.
