150 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു Mixture-of-Experts (MoE) മോഡലിന് ഒരു സാധാരണ ഡെവലപ്പർ ലാപ്ടോപ്പിൽ ടെക്സ്റ്റ് ജനറേറ്റ് ചെയ്യാൻ കഴിയും. SSD വേഗതയല്ല, മറിച്ച് RAM ആണ് യഥാർത്ഥ പെർഫോമൻസ് പരിമിതപ്പെടുത്തുന്നത് എന്ന് ഈ പരീക്ഷണം കാണിക്കുന്നു. ക്ലൗഡ് കമ്പ്യൂട്ടിംഗിനായി പണം ചിലവാക്കാതെ തന്നെ frontier-scale മോഡലുകൾ പ്രാദേശികമായി (locally) പരീക്ഷിക്കാമെന്ന് ഇത് തെളിയിക്കുന്നു എന്നതിനാൽ ഇത് പ്രധാനമാണ്.

പരീക്ഷണം

ഞങ്ങൾ DeepSeek V4 Flash മോഡൽ—ഒരു REAP-pruned 150 B-parameter MoE—ഓപ്പൺ സോഴ്‌സ് Colibrì inference engine ഉപയോഗിച്ച് പ്രവർത്തിപ്പിച്ചു. 61 GB RAM-ഉം 1 TB NVMe SSD-യുമുള്ള ഒരു AMD Ryzen AI 9 365 ലാപ്ടോപ്പായിരുന്നു ഇതിനായി ഉപയോഗിച്ച ഹാർഡ്‌വെയർ. മൂന്ന് മിനിറ്റ് നീണ്ടുനിന്ന ഒരു ജനറേഷൻ റൺ ഞങ്ങൾ ടൈം ചെയ്തതിനൊപ്പം ഓരോ ഡിസ്ക് ആക്സസ്സും രേഖപ്പെടുത്തിയിട്ടുണ്ട്.

കണക്കുകൾ എന്ത് വെളിപ്പെടുത്തുന്നു

  • ഡിസ്ക് ആക്റ്റിവിറ്റി വളരെ കുറവായിരുന്നു. മൂന്ന് മിനിറ്റ് നീണ്ടുനിന്ന ജനറേഷൻ സമയത്ത് SSD 11 സെക്കൻഡിൽ താഴെ മാത്രം റീഡ് (read) പ്രവർത്തനങ്ങൾ നടത്തി. ഡ്രൈവിന് ഡാറ്റ ഉടനടി വായിക്കാൻ കഴിഞ്ഞാൽ പോലും, മൊത്തത്തിലുള്ള ത്രൂപുട്ട് (throughput) ഏകദേശം 6 ശതമാനം മാത്രമേ വർദ്ധിക്കുകയുള്ളൂ.
  • RAM-ന്റെ വലിപ്പം വേഗതയെ നേരിട്ട് ബാധിച്ചു. RAM കാഷെ പകുതിയായി കുറച്ചപ്പോൾ ത്രൂപുട്ട് ഏകദേശം 15 ശതമാനം കുറഞ്ഞു. ഡിസ്കിനായി കാത്തുനിൽക്കുന്നതിനോളം തന്നെ സമയം CPU കാഷെ മിസ്സുകൾ (cache misses) കൈകാര്യം ചെയ്യുന്നതിനും—അതായത് ഡാറ്റ ഡിക്വാന്റൈസ് (de-quantising) ചെയ്യുന്നതിനും, കോപ്പി ചെയ്യുന്നതിനും, മാനേജ് ചെയ്യുന്നതിനും—ചെലവഴിച്ചു.

ലാപ്ടോപ്പുകളിൽ വലിയ മോഡലുകൾ ഇൻഫറൻസ് (inference) ചെയ്യുന്നതിൽ സ്റ്റോറേജ് ബാൻഡ്‌വിഡ്ത്ത് ആണ് പ്രധാന തടസ്സം എന്ന പൊതുവായ വിശ്വാസത്തെ ഈ കണക്കുകൾ തിരുത്തുന്നു.

എന്തുകൊണ്ട് RAM, SSD-യെക്കാൾ മികച്ചതാകുന്നു

ഒരു മോഡൽ പാരാമീറ്റർ നിലവിൽ RAM-ൽ ഇല്ലാത്തപ്പോൾ, സിസ്റ്റം ഇവ ചെയ്യേണ്ടതുണ്ട്:

  1. SSD-യിൽ നിന്ന് ഡാറ്റ എടുക്കുക.
  2. അത് ഡീകോഡ് ചെയ്ത് കമ്പ്യൂട്ടേഷനായി CPU രജിസ്റ്ററുകളിലേക്ക് മാറ്റുക.

ഈ രണ്ട് ഘട്ടങ്ങളും സൈക്കിളുകൾ (cycles) ഉപയോഗിക്കുന്നു. ആദ്യ ഘട്ടം SSD-യുടെ ബാൻഡ്‌വിഡ്ത്ത് കൊണ്ട് പരിമിതമാണ്; രണ്ടാമത്തെ ഘട്ടം ഏകദേശം ഒരേ അളവിൽ കാലതാമസം വരുത്തുന്നു, കാരണം ഡാറ്റ എത്ര വേഗത്തിൽ വന്നാലും CPU അതിനെ ഡിക്വാന്റൈസ് ചെയ്യേണ്ടതുണ്ട്. അതിനാൽ വേഗതയേറിയ ഒരു SSD ഉപയോഗിക്കുന്നത് വലിയ ഗുണങ്ങൾ നൽകുന്നില്ല, എന്നാൽ കൂടുതൽ RAM ഉപയോഗിക്കുന്നത് മോഡലിന്റെ കൂടുതൽ ഭാഗങ്ങൾ RAM-ൽ തന്നെ നിലനിർത്താനും ഡാറ്റ കൈമാറ്റത്തിനുള്ള സമയനഷ്ടം ഒഴിവാക്കാനും സഹായിക്കുന്നു.

ഡെവലപ്പർമാർക്കുള്ള സൂചനകൾ

  • സ്റ്റോറേജിലല്ല, മെമ്മറിയിൽ നിക്ഷേപിക്കുക.
  • പ്രാദേശിക പരിശോധനകൾ പ്രായോഗികമാകുന്നു. ഡെവലപ്പർമാർക്ക് ക്ലൗഡ് ക്രെഡിറ്റുകൾക്കായി പണം ചിലവാക്കാതെ തന്നെ നിലവിലുള്ള മെഷീനുകളിൽ ഓപ്പൺ-വെയ്റ്റ് (open-weight) MoE മോഡലുകൾ പ്രവർത്തിപ്പിക്കാനും സ്റ്റൈൽ, ടൂൾ-കോളിംഗ് ബിഹേവിയർ, ഔട്ട്പുട്ട് ക്വാളിറ്റി എന്നിവ പരിശോധിക്കാനും കഴിയും.
  • ബാച്ച് ഇവാലുവേഷൻ (Batch evaluation) യാഥാർത്ഥ്യമാകുന്നു. റിയൽ-ടൈം ചാറ്റ് ഇപ്പോഴും സാവധാനത്തിലായിരിക്കാം, എന്നാൽ ക്യൂ ചെയ്ത ജോലികൾ—ഗവേഷണത്തിനായി ഡസൻ കണക്കിന് പ്രോംപ്റ്റുകൾ ജനറേറ്റ് ചെയ്യുന്നത് പോലെ—ഒരു ലാപ്ടോപ്പിൽ സുഗമമായി പ്രവർത്തിപ്പിക്കാം.

സാധ്യമായ എതിർവാദങ്ങൾ

പുതിയ എക്സ്പെർട്ട് വെയ്റ്റുകൾ (expert weights) ആവർത്തിച്ച് ലോഡ് ചെയ്യേണ്ടി വരുന്ന വർക്ക്ലോഡുകൾക്ക് SSD ലേറ്റൻസി (latency) ഇപ്പോഴും പ്രസക്തമാണെന്ന് ചിലർ വാദിച്ചേക്കാം.

ഇനി ശ്രദ്ധിക്കേണ്ടവ

  • മെമ്മറി-എഫിഷ്യന്റ് മോഡൽ വേരിയന്റുകൾ.
  • വലിയ ഓൺ-ചിപ്പ് കാഷെകളുള്ള ഹാർഡ്‌വെയറുകൾ.
  • സോഫ്റ്റ്‌വെയർ തലത്തിലുള്ള കാഷിംഗ് സ്ട്രാറ്റജികൾ.

ഇതിന്റെ സാരം വ്യക്തമാണ്: ലാപ്ടോപ്പിൽ വലിയ MoE മോഡലുകൾ പരീക്ഷിക്കാൻ ആഗ്രഹിക്കുന്ന ഡെവലപ്പർമാർ കൂടുതൽ RAM വാങ്ങണം. SSD അപ്‌ഗ്രേഡുകൾ ഏതാനും ശതമാനം മാത്രമേ ലാഭിക്കൂ, എന്നാൽ അധിക മെമ്മറി ഇൻഫറൻസ് സമയം ഇരട്ട അക്ക ശതമാനത്തിൽ കുറയ്ക്കാൻ സഹായിക്കും. ഇത് AI പ്രോട്ടോടൈപ്പിംഗിനായുള്ള ചിലവ് കണക്കുകൂട്ടലുകളെ മാറ്റുന്നു, കൂടാതെ മുമ്പ് ഡെഡിക്കേറ്റഡ് ക്ലൗഡ് ക്ലസ്റ്ററുകൾ ആവശ്യമാണെന്ന് കരുതിയിരുന്ന മോഡലുകൾ പ്രാദേശികമായി, സൗജന്യമായി പരീക്ഷിക്കാനുള്ള വഴി തുറക്കുന്നു.