150 பில்லியன் அளவுருக்களைக் கொண்ட ஒரு Mixture-of-Experts மாதிரி, ஒரு சாதாரண டெவலப்பர் லேப்டாப்பிலேயே உரையை உருவாக்க முடியும். SSD வேகத்தை விட, RAM தான் உண்மையான செயல்திறன் வரம்பைத் தீர்மானிக்கிறது என்பதை இந்தச் சோதனை காட்டுகிறது. இது முக்கியமானது, ஏனெனில் அதிநவீன அளவிலான (frontier-scale) மாதிரிகளை கிளவுட் கம்ப்யூட்டிங்கிற்கு செலவு செய்யாமலேயே உள்ளூரிலேயே (locally) சோதிக்க முடியும் என்பதை இது நிரூபிக்கிறது.
சோதனை
நாங்கள் REAP-pruned செய்யப்பட்ட 150 B-parameter MoE மாதிரியான DeepSeek V4 Flash மாதிரியை, திறந்த மூலமான (open-source) Colibrì inference engine மூலம் இயக்கினோம். இதற்காக 61 GB RAM மற்றும் 1 TB NVMe SSD கொண்ட AMD Ryzen AI 9 365 லேப்டாப் பயன்படுத்தப்பட்டது. மூன்று நிமிட உரை உருவாக்கும் செயல்பாட்டை நாங்கள் timed செய்து, ஒவ்வொரு டிஸ்க் அணுகலையும் (disk access) பதிவு செய்தோம்.
எண்கள் எதைக் காட்டுகின்றன
- டிஸ்க் செயல்பாடு மிகக் குறைவாகவே இருந்தது. மூன்று நிமிட உரை உருவாக்கத்தின் போது SSD 11 வினாடிகளுக்கும் குறைவான நேரமே தரவுகளைப் படித்தது. அந்த டிரைவ் உடனடியாகத் தரவுகளைப் படித்தாலும் கூட, மொத்தத் திறன் (throughput) சுமார் 6 சதவீதம் மட்டுமே மேம்படும்.
- RAM அளவு வேகத்தை நேரடியாகப் பாதித்தது. RAM கேச் (cache) அளவை பாதியாகக் குறைத்தபோது, மொத்தத் திறன் சுமார் 15 சதவீதம் குறைந்தது. டிஸ்க் காத்திருப்பதைப் போலவே, கேச் மிஸ் (cache misses) நிகழ்வுகளைக் கையாளுவதற்கும் (de-quantising, நகலெடுத்தல் மற்றும் தரவை நிர்வகித்தல்) CPU கிட்டத்தட்ட அதே நேரத்தைச் செலவிட்டது.
லேப்டாப்பில் பெரிய மாதிரிகளை இயக்குவதற்கு (inference) ஸ்டோரேஜ் பேண்ட்வித் (storage bandwidth) தான் முதன்மையான தடையாகும் என்ற பொதுவான நம்பிக்கையை இந்தத் தரவுகள் மாற்றியமைக்கின்றன.
ஏன் RAM, SSD-யை விட சிறந்தது
ஒரு மாடல் அளவுரு (parameter) ஏற்கனவே RAM-இல் இல்லை என்றால், சிஸ்டம் பின்வருவனவற்றைச் செய்ய வேண்டும்:
- SSD-யிலிருந்து தரவை எடுக்க வேண்டும்.
- அதை டீகோட் (decode) செய்து கணக்கீட்டிற்காக CPU ரெஜிஸ்டர்களுக்கு (registers) மாற்ற வேண்டும்.
இந்த இரண்டு படிகளும் கணினிச் சுழற்சிகளை (cycles) நுகர்கின்றன. முதல் படி SSD-யின் பேண்ட்வித் மூலம் கட்டுப்படுத்தப்படுகிறது; இரண்டாவது படி கிட்டத்தட்ட அதே தாமதத்தை ஏற்படுத்துகிறது, ஏனெனில் தரவு எவ்வளவு வேகமாக வந்தாலும் CPU அதை டீ-குவாண்டைஸ் (de-quantise) செய்ய வேண்டும். எனவே, வேகமான SSD பயன்படுத்துவதால் கிடைக்கும் பலன் குறைவு; ஆனால் அதிக RAM இருந்தால் மாடலின் அதிகப்படியான பகுதிகளை RAM-லேயே வைத்திருக்க முடியும், இது தேவையற்ற தரவுப் பரிமாற்றங்களைத் தவிர்க்கிறது.
டெவலப்பர்களுக்கான தாக்கங்கள்
- ஸ்டோரேஜில் அல்ல, மெமரியில் முதலீடு செய்யுங்கள்.
- உள்ளூர் சோதனை சாத்தியமாகிறது. டெவலப்பர்கள் தங்களின் தற்போதைய கணினிகளிலேயே open-weight MoE மாதிரிகளை இயக்கி, கிளவுட் கிரெடிட்டுகளுக்குப் பணம் செலுத்தாமல் அதன் நடை (style), டூல்-காலிங் (tool-calling) பண்பு மற்றும் வெளியீட்டுத் தரத்தைச் சரிபார்க்க முடியும்.
- தொகுப்பு மதிப்பீடு (Batch evaluation) யதார்த்தமானது. நிகழ்நேர அரட்டை (Real-time chat) இன்னும் மெதுவாகத் தோன்றலாம், ஆனால் வரிசைப்படுத்தப்பட்ட வேலைகள் (queued jobs)—ஆராய்ச்சிக்காகப் பல ப்ராம்ப்ட்களை உருவாக்குவது போன்றவைகளை—ஒரு லேப்டாப்பிலேயே வசதியாகச் செய்ய முடியும்.
சாத்தியமான எதிர்வாதம்
புதிய எக்ஸ்பர்ட் வெயிட்டுகளை (expert weights) மீண்டும் மீண்டும் ஏற்ற வேண்டிய வேலைகளுக்கு SSD லேட்டன்சி (latency) இன்னும் முக்கியமானது என்று சிலர் வாதிடலாம்.
அடுத்து கவனிக்க வேண்டியவை
- மெமரி-திறன் கொண்ட மாடல் வகைகள் (Memory-efficient model variants).
- பெரிய ஆன்-சிப் கேச் (on-chip caches) கொண்ட வன்பொருள்.
- மென்பொருள் மட்டத்திலான கேச்சிங் உத்திகள் (Software-level caching strategies).
சுருக்கமாகச் சொன்னால்: லேப்டாப்பில் பிரம்மாண்டமான MoE மாதிரிகளைச் சோதிக்க விரும்பும் டெவலப்பர்கள் அதிக RAM-ஐ வாங்க வேண்டும். SSD மேம்படுத்தல்கள் சில சதவீதங்களை மட்டுமே குறைக்கும், ஆனால் கூடுதல் மெமரி இன்ஃபரன்ஸ் நேரத்தை (inference time) இரட்டை இலக்க சதவீதங்களில் குறைக்க முடியும். இது AI புரோட்டோடைப்பிங்கிற்கான (prototyping) செலவு கணக்கீட்டை மாற்றுகிறது மற்றும் இதற்கு முன்பு பிரத்யேக கிளவுட் கிளஸ்டர்கள் தேவைப்படும் என்று கருதப்பட்ட மாதிரிகளை, செலவில்லாமல் உள்ளூரிலேயே சோதிப்பதற்கான வாய்ப்பைத் திறக்கிறது.
