മെറ്റയുടെ പുതിയ ഓപ്പൺ മോഡൽ ലോക്കലായി പ്രവർത്തിക്കുന്നു
ഓഗസ്റ്റ് 10-ന് മെറ്റ (Meta) 30 ബില്യൺ പാരാമീറ്ററുകളുള്ള Muse Glimmer എന്ന ലാംഗ്വേജ് മോഡൽ പുറത്തിറക്കി. ഒരു സാധാരണ കൺസ്യൂമർ ഗ്രേഡ് GPU-വിൽ തന്നെ ഏജന്റിക് കോഡിംഗ് (agentic coding), പേഴ്സണൽ അസിസ്റ്റന്റ് ജോലികൾ എന്നിവ ചെയ്യാൻ ഇതിന് സാധിക്കുമെന്ന് കമ്പനി അവകാശപ്പെടുന്നു. ഡാറ്റ ക്ലൗഡിലേക്ക് അയക്കാതെ തന്നെ ഡെവലപ്പർമാർക്ക് ലോക്കലായി എന്തൊക്കെ പ്രവർത്തിപ്പിക്കാൻ കഴിയുമെന്നതിന്റെ പരിധി ഇത് വർദ്ധിപ്പിക്കുന്നു എന്നതുകൊണ്ട് ഈ അവകാശവാദം പ്രധാനമാണ്. സ്വകാര്യതയ്ക്ക് മുൻഗണന നൽകുന്ന AI ആപ്ലിക്കേഷനുകളുടെ രീതിയെ ഇത് മാറ്റിമറിച്ചേക്കാം.
ഈ റിലീസ് പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
കോഡ് അസിസ്റ്റന്റുകൾ മുതൽ പേഴ്സണൽ നോളജ് ബേസുകൾ വരെയുള്ള 'പ്രൈവറ്റ്-ബൈ-ഡിസൈൻ' ഏജന്റുകൾക്ക് ഇപ്പോൾ ഓപ്പൺ സോഴ്സ് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) കരുത്ത് പകരുന്നു. ഇതുവരെ, ഏജന്റ് ബെഞ്ച്മാർക്കുകളിൽ മികച്ച പ്രകടനം കാഴ്ചവെച്ച മിക്ക മോഡലുകൾക്കും സെർവർ ഗ്രേഡ് ഹാർഡ്വെയറോ അല്ലെങ്കിൽ പ്രൊപ്രൈറ്ററി API-കളോ ആവശ്യമായിരുന്നു. എന്നാൽ Muse Glimmer-ന്റെ "എവിടെയും പ്രവർത്തിപ്പിക്കാം" എന്ന വാഗ്ദാനം, 24 GB ഗ്രാഫിക്സ് കാർഡോ അല്ലെങ്കിൽ പുതിയ ആപ്പിൾ സിലിക്കൺ മാക്കോ (Apple Silicon Mac) ഉള്ളവരോ ആയ ഹോബിസ്റ്റുകൾക്കും ചെറിയ ടീമുകൾക്കും ഒരു 30B മോഡൽ ഉപയോഗിക്കാൻ അവസരം നൽകുന്നു. ഈ മോഡൽ അവകാശപ്പെടുന്നതുപോലെ പ്രവർത്തിക്കുകയാണെങ്കിൽ, ഡെവലപ്പർമാർക്ക് അവരുടെ പ്രോംപ്റ്റുകളും ഔട്ട്പുട്ടുകളും ഉപകരണത്തിൽ തന്നെ സൂക്ഷിക്കാം; ഇത് ഹോസ്റ്റഡ് സർവീസുകൾക്കൊപ്പം വരുന്ന ഡാറ്റ ചോർച്ചാ (data-exfiltration) ഭീഷണികളെ ഒഴിവാക്കാൻ സഹായിക്കും.
എന്താണ് യഥാർത്ഥത്തിൽ Muse Glimmer?
മെറ്റയുടെ ക്ലോസ്ഡ് സോഴ്സ് ആയ Muse Spark പരമ്പരയുടെ ലഘൂകരിച്ച പതിപ്പാണ് Glimmer. ഏറ്റവും മികച്ച സ്പാർക്ക് വേരിയന്റായ Muse Spark 1.2 പൊതുജനങ്ങൾക്ക് ലഭ്യമായിട്ടില്ലെങ്കിലും, "കുറച്ച് ആഴ്ചകൾക്കുള്ളിൽ" അത് ഓപ്പൺ ആയി പുറത്തിറക്കുമെന്ന് മെറ്റ സൂചിപ്പിച്ചിട്ടുണ്ട്. ഈ സാഹചര്യം ശ്രദ്ധിക്കേണ്ടതാണ്: പുറത്തിറങ്ങാത്ത ഒരു മോഡലിന്റെ പ്രിവ്യൂ എന്ന നിലയിലല്ല, മറിച്ച് Glimmer-നെ അതിന്റെ സ്വന്തം ഗുണമേന്മയുടെ അടിസ്ഥാനത്തിൽ വിലയിരുത്തുക.
ഇതിന്റെ ആർക്കിടെക്ചർ ഒരു 'ഡെൻസ് കോസൽ ട്രാൻസ്ഫോർമർ' (dense causal transformer) ആണ്; അതായത് ഓരോ ടോക്കണും അടുത്ത ടോക്കണിനെ പ്രവചിക്കുന്ന ക്ലാസിക് ഡിസൈൻ. ഈ ലാളിത്യം ലാപ്ടോപ്പുകളിൽ എളുപ്പത്തിൽ ഉപയോഗിക്കാൻ സഹായിക്കുന്നു; മറ്റ് ചില മോഡലുകൾ ഉപയോഗിക്കുന്ന 'മിക്സ്ചർ-ഓഫ്-എക്സ്പെർട്ട്സ് റൂട്ടിംഗ്' (mixture-of-experts routing) പോലെയുള്ള ഭാരമേറിയ സാങ്കേതിക വിദ്യകൾ ഇതിലില്ല.
ഇതിലെ ശ്രദ്ധേയമായ ഒരു കൂട്ടിച്ചേർക്കൽ ആണ് DFlash. ഭാവിയിലെ ടോക്കണുകൾ മുൻകൂട്ടി പ്രവചിക്കുകയും അവ സമാന്തരമായി പരിശോധിക്കുകയും ചെയ്യുന്ന ഒരു 'സ്പെക്കുലേറ്റീവ് ഡീകോഡിംഗ്' (speculative decoding) സാങ്കേതികവിദ്യയാണിത്. പ്രായോഗികമായി പറഞ്ഞാൽ, ടെക്സ്റ്റ് ഗുണനിലവാരത്തിൽ വിട്ടുവീഴ്ച ചെയ്യാതെ തന്നെ DFlash ലേറ്റൻസി (latency) കുറയ്ക്കുന്നു, ഇത് ഇന്ററാക്ടീവ് ഏജന്റുകൾക്ക് വളരെ ഉപകാരപ്രദമാണ്.
ക്വാണ്ടൈസ്ഡ് വെയ്റ്റുകൾ (Quantized weights) ഉപയോഗിക്കുന്നതിലൂടെ മെമ്മറി ഉപയോഗം ഏകദേശം 17 GB ആയി കുറയ്ക്കാൻ സാധിക്കുന്നു, ഇത് 24 GB VRAM ഉള്ള GPU-കളിൽ മോഡൽ പ്രവർത്തിപ്പിക്കാൻ സഹായിക്കുന്നു. ഇതേ ക്വാണ്ടൈസ്ഡ് പതിപ്പ് llama.cpp റൺടൈം വഴി ആപ്പിൾ സിലിക്കണിലും പ്രവർത്തിപ്പിക്കാം, ഇത് macOS ഉപയോക്താക്കൾക്ക് മോഡൽ നേരിട്ട് ഉപയോഗിക്കാനുള്ള സൗകര്യം നൽകുന്നു.
മത്സരരംഗത്തെ പ്രകടനം എങ്ങനെയാണ്?
ഗൂഗിളിന്റെ Gemma, അലിബാബയുടെ Qwen എന്നിവയുമായി താരതമ്യം ചെയ്താണ് മെറ്റ Glimmer-നെ ബെഞ്ച്മാർക്ക് ചെയ്തത്. ഫലങ്ങൾ വൈവിധ്യമാർന്നതാണ്:
- ഏജന്റ് അധിഷ്ഠിത ജോലികൾ (Agent-oriented tasks) – പ്ലാനിംഗും ടൂൾ ഉപയോഗവും പരിശോധിക്കുന്ന ചില ബെഞ്ച്മാർക്കുകളിൽ Glimmer രണ്ട് എതിരാളികളെക്കാളും നേരിയ മുന്നിട്ടുനിൽക്കുന്നു.
- കോഡിംഗും വിശാലമായ യുക്തിചിന്തയും (Coding and broad reasoning) – കോഡ് ജനറേഷനിലും പല ലോജിക്കൽ പസിലുകളിലും Qwen സ്ഥിരമായി Glimmer-നേക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു.
- സുരക്ഷാ മാനദണ്ഡങ്ങൾ (Safety metrics) – Gemma കുറഞ്ഞ ലംഘന നിരക്ക് രേഖപ്പെടുത്തുന്നു, അതായത് ഒരേ പരീക്ഷണ സാഹചര്യങ്ങളിൽ തന്നെ അനുമതിയില്ലാത്ത ഉള്ളടക്കം നിർമ്മിക്കാൻ Gemma സാധ്യത കുറവാണ്.
ചുരുക്കത്തിൽ, പ്രത്യേക ഏജന്റ് ജോലികൾക്ക് Glimmer മികച്ചതാണ്, എന്നാൽ കോഡിംഗ് അല്ലെങ്കിൽ യുക്തിചിന്താപരമായ മേഖലകളിൽ ഇത് പൂർണ്ണമായും ആധിപത്യം സ്ഥാപിക്കുന്നില്ല.
സുരക്ഷാ സൂചനകളും അവയുടെ അർത്ഥവും
ഫയലുകൾ വായിക്കാനും സന്ദേശങ്ങൾ അയക്കാനും ഉപയോക്താവിന് വേണ്ടി മറ്റ് കാര്യങ്ങൾ ചെയ്യാനും കഴിയുന്ന പേഴ്സണൽ ഏജന്റുകൾക്കായുള്ള ഒരു അടിസ്ഥാനമായി മെറ്റ Glimmer-നെ അവതരിപ്പിക്കുന്നു. ഇത്തരത്തിലുള്ള കഴിവുകൾ സുരക്ഷാ കാര്യങ്ങളിൽ കൂടുതൽ ശ്രദ്ധ ആവശ്യപ്പെടുന്നു. മോഡലിന്റെ റിസ്ക് പ്രൊഫൈലിനെക്കുറിച്ച് രണ്ട് ആന്തരിക മൂല്യനിർണ്ണയങ്ങൾ വ്യക്തമാക്കുന്നു:
- CI Memories ടെസ്റ്റ് – Gemma-യേക്കാൾ ഉയർന്ന ലംഘന നിരക്ക് Glimmer കാണിക്കുന്നു, അതായത് മുൻകൂട്ടി നിശ്ചയിച്ച സുരക്ഷാ നിയമങ്ങൾ ലംഘിക്കുന്ന ഔട്ട്പുട്ടുകൾ Glimmer കൂടുതൽ തവണ നൽകുന്നു.
- Siren AgentDojo അറ്റാക്ക് സ്യൂട്ട് – സുരക്ഷിതമല്ലാത്ത പെരുമാറ്റം പ്രേരിപ്പിക്കുന്ന രീതിയിൽ രൂപകൽപ്പന ചെയ്ത അഡ്വേഴ്സേറിയൽ പ്രോംപ്റ്റുകളിൽ (adversarial prompts) ഈ മോഡൽ ഉയർന്ന വിജയശതമാനം കൈവരിക്കുന്നു.
ഈ കണ്ടെത്തലുകൾ സൂചിപ്പിക്കുന്നത്, നേരിട്ട് ഉപയോഗിക്കുമ്പോൾ (out of the box), മറ്റ് മോഡലുകളേക്കാൾ സുരക്ഷാ വീഴ്ചകൾ സംഭവിക്കാൻ Glimmer-ന് സാധ്യതയുണ്ടെന്നാണ്. അതിനാൽ, സ്വകാര്യ ഫയലുകളോ കമ്മ്യൂണിക്കേഷൻ ചാനലുകളോ ഉപയോഗിക്കാൻ ഈ മോഡലിന് അനുമതി നൽകാൻ ഉദ്ദേശിക്കുന്ന ഡെവലപ്പർമാർ പുറമെ നിന്ന് കണ്ടന്റ് ഫിൽട്ടറുകളും (content filters) സാൻഡ്ബോക്സ് എക്സിക്യൂഷൻ എൻവയോൺമെന്റുകളും (sandboxed execution environments) ചേർക്കേണ്ടതുണ്ട്.
ആർക്കൊക്കെ ഇത് ഉപയോഗിക്കാം
അനുയോജ്യമായവർ
- നെറ്റ്വർക്ക് ഉപയോഗിക്കാതെ തന്നെ ഒരു മുഴുവൻ റിപ്പോസിറ്ററിയും (repository) വിശകലനം ചെയ്യാൻ കഴിയുന്ന ലോക്കൽ കോഡ് അസിസ്റ്റന്റ് ആവശ്യമുള്ള ടീമുകൾ.
- ഡാറ്റയുടെ സുരക്ഷയ്ക്ക് മുൻഗണന നൽകുന്നവരും, തങ്ങളുടെ ഉപകരണത്തിൽ നിന്ന് പുറത്തുപോകാത്ത ഒരു LLM ആഗ്രഹിക്കുന്നവരും.
- വേഗതയ്ക്കും ഉപകരണത്തിലെ പ്രവർത്തനത്തിനും പ്രാധാന്യമുള്ള സാഹചര്യങ്ങളിൽ, ഔട്ട്പുട്ടുകൾ ബച്ച് ആയി വിലയിരുത്താൻ (batch-evaluate) 'LLM-as-a-judge' തിരയുന്ന ഗവേഷകരോ എഞ്ചിനീയർമാരോ.
- 24 GB+ GPU അല്ലെങ്കിൽ llama.cpp പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്ന ആപ്പിൾ സിലിക്കൺ മാക് ഉള്ള ആർക്കും.
മറ്റ് ആവശ്യങ്ങൾക്കായി മികച്ച ബദലുകൾ
- കോഡിംഗ് പ്രകടനം ആണ് ഏറ്റവും വലിയ മുൻഗണനയെങ്കിൽ, നിലവിൽ Qwen കൂടുതൽ കൃത്യത നൽകുന്നു.
- അതീവ സെൻസിറ്റീവ് ആയ വ്യക്തിഗത വിവരങ്ങൾ കൈകാര്യം ചെയ്യുമ്പോൾ, Gemma-യുടെ കുറഞ്ഞ ലംഘന നിരക്ക് അതിനെ കൂടുതൽ സുരക്ഷിതമായ ഒരു ഓപ്ഷനാക്കുന്നു.
- ആവശ്യമായ ഹാർഡ്വെയർ ഇല്ലാത്ത ഡെവലപ്പർമാർ, 24 GB-യിൽ താഴെ മെമ്മറിയുള്ള GPU-കളിൽ പ്രവർത്തിക്കുന്ന, കൂടുതൽ വ്യാപകമായി പിന്തുണയുള്ള ചെറിയ മോഡലുകളെ പരിഗണിക്കണം.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
വരും ആഴ്ചകളിൽ ഒരു ഓപ്പൺ Muse Spark 1.2 വരുമെന്ന Meta-യുടെ സൂചന ഈ സന്തുലിതാവസ്ഥയെ നാടകീയമായി മാറ്റിയേക്കാം. Spark, ഒരേ ഹാർഡ്വെയർ ആവശ്യകത നിലനിർത്തിക്കൊണ്ട് തന്നെ Glimmer-ന്റെ പ്രകടനത്തിന് തുല്യമായോ അതിനേക്കാളോ മികച്ച രീതിയിൽ പ്രവർത്തിച്ചാൽ, നിലവിലെ മോഡൽ ഒരു ദീർഘകാല പരിഹാരത്തേക്കാൾ ഒരു ഇടക്കാല മാർഗ്ഗമായി മാറിയേക്കാം. തേർഡ് പാർട്ടി ഫിൽട്ടറുകൾ, ഫൈൻ ട്യൂണിംഗ്, അല്ലെങ്കിൽ പ്രോംപ്റ്റ് എൻജിനീയറിംഗ് എന്നിവയിലൂടെ Glimmer-ന്റെ സുരക്ഷാ പോരായ്മകളോട് സമൂഹം എങ്ങനെ പ്രതികരിക്കുന്നു എന്നതും അതിന്റെ ഉപയോഗത്തെ സ്വാധീനിക്കും.
llama.cpp വഴി ഈ മോഡൽ ഉടൻ ലഭ്യമാകുന്നത് കൊണ്ട് ഡെവലപ്പർമാർക്ക് ഇന്ന് തന്നെ പരീക്ഷണങ്ങൾ തുടങ്ങാം, എന്നാൽ സ്വകാര്യ വിവരങ്ങൾ ഇതിനെ ഏൽപ്പിക്കാനുള്ള തീരുമാനം Meta വെളിപ്പെടുത്തിയ സുരക്ഷാ കണക്കുകളെയും സ്വതന്ത്ര ഓഡിറ്റുകളെയും അടിസ്ഥാനമാക്കിയുള്ളതായിരിക്കണം.
ചുരുക്കത്തിൽ: Muse Glimmer ഒരു 30B LLM ഡെസ്ക്ടോപ്പിലേക്ക് എത്തിക്കുന്നു, ഇത് ഓൺ-ഡിവൈസ് ഏജന്റുകൾക്ക് പുതിയ വാതിലുകൾ തുറക്കുന്നു; എങ്കിലും ഇതിന്റെ പ്രകടനവും സുരക്ഷയും മുൻനിര എതിരാളികളേക്കാൾ പിന്നിലാണ്. ലോക്കൽ എക്സിക്യൂഷൻ അത്യാവശ്യമാണെങ്കിൽ കൂടാതെ നിങ്ങൾക്ക് ആവശ്യമായ ഹാർഡ്വെയർ താങ്ങാൻ കഴിയുമെങ്കിൽ മാത്രം ഇത് ഉപയോഗിക്കുക; അല്ലാത്തപക്ഷം, കോഡിംഗ് കൃത്യതയിൽ മികച്ചതോ അല്ലെങ്കിൽ കൂടുതൽ ശക്തമായ സുരക്ഷാ റെക്കോർഡുള്ളതോ ആയ ഒരു മോഡൽ തിരഞ്ഞെടുക്കുക.
