GyaanSetu AI

AI, machine learning en LLM-inzichten.

1317 articlesDeep, practical knowledge

Meta's 30B Muse Glimmer is 56x langzamer dan Llama 3B op een MacBook M2 Pro

De benchmark op een 32 GB M2 Pro MacBook mat de token-per-seconde-snelheden, het JSON-succes en de totale oproeptijd. Hieruit bleek dat Muse Glimmer een latentie van 33 seconden per oproep heeft, tegenover een snelheid van minder dan een seconde voor Llama 3.2, ondanks dat de nauwkeurigheid identiek was.

AI · 4 min read

On-device AI krijgt een boost nu Muse Glimmer hobbyisten in staat stelt om een 30B-model lokaal te draaien

Het model van Muse Glimmer met 30 miljard parameters is gekwantiseerd naar ongeveer 17 GB, waardoor het past op GPU's met 24 GB VRAM of op Apple Silicon Macs via de llama.cpp-runtime. Hoewel het uitblinkt bij on-device agents, tonen de veiligheidstesten hogere schendingspercentages dan die van concurrenten, dus ontwikkelaars zouden extra beveiligingsmaatregelen moeten toevoegen.

AI · 4 min read

Gratis bèta bespaart ongeveer 3% op je Claude Agent-facturen, niet 14%

De bèta-header comprimeert de tool-call output van Claude, waardoor er ongeveer 14% aan tokens wordt bespaard. Omdat output-tokens echter slechts een fractie van het totaal vormen, zien de meeste gebruikers slechts een reductie van ongeveer 3% op hun totale API-factuur, plus een lichte verbetering in latentie.

AI · 3 min read