VIDRAFT ஆல் வெளியிடப்பட்ட 35 பில்லியன் அளவுருக்களைக் (parameters) கொண்ட POCKET-35B என்ற மொழி மாதிரி (language model), இப்போது CPU மட்டுமே உள்ள ஒரு மடிக்கணினியிலும் இயக்க முடியும். இந்த மாதிரியின் GGUF வடிவத்தில் உள்ள எடைகள் (weights) நேரடியாக llama.cpp அல்லது Ollama-வில் ஏற்றப்படும், எனவே GPU பட்ஜெட் இல்லாத குழுக்கள் உடனடியாகச் சோதனைகளைத் தொடங்கலாம். வெளியிடப்பட்ட ஏழு வாரங்களுக்குள்ளேயே, இந்த மாதிரி Hugging Face தளத்தில் பத்து லட்சம் பதிவிறக்கங்களைக் கடந்து, உலகளவில் அனைத்து GGUF பதிவிறக்கங்களிலும் 13-வது இடத்தைப் பிடித்துள்ளது.
இப்போது CPU-மட்டும் கொண்ட LLM ஏன் முக்கியமானது
வாடிக்கையாளர் மின்னஞ்சல்கள், உள்நாட்டு டிக்கெட்டுகள் (internal tickets), குறியீட்டுத் துண்டுகள் (code snippets) போன்ற ரகசியத் தரவுகளைத் தங்கள் சொந்த இடத்திலேயே (on-premises) வைத்திருக்க வேண்டிய நிறுவனங்களிடம் பெரும்பாலும் பிரத்யேக கிராபிக்ஸ் கார்டுகளுக்கான நிதி இருப்பதில்லை. சமீப காலம் வரை, தரவுகளை கிளவுட் (cloud) மூலம் இயங்கும் API-க்கு அனுப்புவதே நடைமுறைச் சாத்தியமான ஒரே வழியாக இருந்தது; இது தனியுரிமையைச் சமரசம் செய்வதோடு தொடர்ச்சியான செலவுகளையும் ஏற்படுத்துகிறது. POCKET-35B ஒரு இடைநிலையை வழங்குகிறது: இது சிக்கலான ப்ராம்ப்ட்களைக் (prompts) கையாளும் அளவுக்குப் பெரியதாகவும், அதே சமயம் ஒரு சாதாரண அலுவலக மடிக்கணினி அல்லது மினி-பிசியின் (mini-PC) நினைவக வரம்பிற்குள் (memory limits) அடங்கும் வகையிலும் உள்ளது.
இந்த மாதிரி ஒரு மடிக்கணினியில் எவ்வாறு பொருந்துகிறது
- GGUF format – இது குவாண்டைஸ் செய்யப்பட்ட எடைகளைச் (quantized weights) சேமிக்கும் ஒரு பைனரி கொள்கலன் (binary container) ஆகும்.
- Compatibility – llama.cpp மற்றும் Ollama ஆகிய இரண்டுமே GGUF கோப்புகளைப் படித்து CPU-வில் இன்ஃபரன்ஸை (inference) செயல்படுத்தும் ரன்டைம்களைக் (runtimes) கொண்டுள்ளன. சில லேயர்களை (layers) மாற்றியமைக்க ஒருங்கிணைந்த GPU-வைப் பயன்படுத்தலாம், ஆனால் அது கட்டாயமில்லை.
- RAM check – GGUF கோப்பின் அளவே உங்களுக்குத் தேவையான குறைந்தபட்ச RAM அளவு ஆகும். உதாரணமாக, கோப்பின் அளவு சில ஜிகாபைட் (gigabytes) என்றால், பதிவிறக்கம் தொடங்குவதற்கு முன்பே அந்த அளவு குறைந்தபட்சம் காலியாக உள்ள நினைவகம் கொண்ட இயந்திரம் தேவைப்படும்.
உங்கள் மடிக்கணினியில் POCKET-35B-ஐ இயக்குவதற்கான வழிமுறைகள்
- Verify memory – உங்கள் கணினியின் டாஸ்க் மேனேஜரைத் (task manager) திறந்து, மொத்த RAM அளவைக் குறித்துக் கொண்டு, அதை Hugging Face பக்கத்தில் குறிப்பிடப்பட்டுள்ள GGUF கோப்பு அளவோடு ஒப்பிட்டுப் பார்க்கவும்.
- Pick the right quantization – Q4 பதிப்பிலிருந்து தொடங்கவும்; இது பெரும்பாலான மடிக்கணினிகளுக்கு அளவு மற்றும் வேகத்திற்கு இடையே சமநிலையைத் தருகிறது.
- Download via llama.cpp or Ollama – இரண்டு கருவிகளும் Hugging Face-லிருந்து நேரடியாக மாதிரியைப் பெற முடியும், மேலும் இவை செக்சம் சரிபார்ப்பை (checksum verification) தானாகவே கையாளுகின்றன.
- Run a quick sanity check – மாதிரி வெற்றிகரமாக ஏற்றப்பட்டதை உறுதிப்படுத்த, ஒரு எளிய “Hello, world” ப்ராம்ப்டுடன் ரன்டைமைத் தொடங்கவும்.
- Create a realistic benchmark suite – உங்கள் உற்பத்திப் பணிச்சுமையை (production workload) பிரதிபலிக்கும் 30-50 பணிகளைச் சேகரிக்கவும் (உதாரணமாக, டிக்கெட் வகைகளை வகைப்படுத்துதல், மின்னஞ்சல் பதில்களைத் தயாரித்தல்). அவற்றை மாதிரியின் மூலம் இயக்கி, லேட்டன்சி (latency) மற்றும் டோக்கன்-வெளியீட்டுத் தரவை (token-output quality) பதிவு செய்யவும்.
- Test language coverage – POCKET-35B-ன் ஆவணங்களில் மொழிகளின் பட்டியல் விடுபட்டுள்ளது. உங்களுக்கு வியட்நாமிய மொழி அல்லது பிற ஆங்கிலம் அல்லாத எழுத்துக்கள் தேவைப்பட்டால், சில உச்சரிப்புச் சொற்களைக் கொண்ட வாக்கியங்களைக் கொடுத்து, மாதிரி தெளிவான வெளியீட்டைத் தருகிறதா என்பதைக் கவனிக்கவும்.
- Measure actual latency – உங்கள் குறிப்பிட்ட வன்பொருளில் (hardware) ஒவ்வொரு ப்ராம்ப்டுக்கும் எடுக்கும் நேரத்தைப் பதிவு செய்யவும்; வெவ்வேறு CPU அல்லது RAM பேண்ட்வித் (bandwidth) கொண்ட பிற பயனர்கள் பதிவிட்ட பெஞ்ச்மார்க் எண்களை மட்டும் நம்பிவிடாதீர்கள்.
பதிவிறக்க எண்கள் உங்களுக்குச் சொல்லாதவை
பத்து லட்சம் பதிவிறக்கங்கள் என்பது சமூகத்தின் மிகுந்த ஆர்வத்தைக் குறிக்கிறதே தவிர, உத்தரவாதம் அளிக்கப்பட்ட செயல்திறனை அல்ல. மாதிரியின் பகுத்தறியும் திறன் (reasoning ability), குறியீடு உருவாக்கும் திறன் (code generation skill) மற்றும் அறிவுறுத்தல்களைப் பின்பற்றும் திறன் (instruction following) ஆகியவை இன்னும் சுயாதீனமாகத் தணிக்கை செய்யப்படவில்லை. VIDRAFT மாதிரியின் கட்டமைப்பு விவரங்களையோ (architecture details) அல்லது பயிற்சித் தரவு ஆதாரங்களையோ (training data sources) வெளிப்படுத்தவில்லை, இது உற்பத்திப் பயன்பாட்டிற்கு (production deployment) ஆபத்தான ஒரு தகவல் இடைவெளியை ஏற்படுத்துகிறது.
அபாயங்கள் மற்றும் எதிர்வாதங்கள்
- Unclear quality – வெளியிடப்பட்ட மதிப்பீட்டு அளவீடுகள் (evaluation metrics) இல்லாமல், POCKET-35B மற்ற திறந்த மூல (open-source) மாற்றுகளின் துல்லியத்திற்கு இணையாக இருக்கிறதா என்பதை உங்களால் உறுதியாகச் சொல்ல முடியாது.
- Production-grade uncertainties – கட்டமைப்பு வெளிப்படைத்தன்மை இல்லாதது, எதிரித்தனமான ப்ராம்ப்ட்கள் (adversarial prompts) அல்லது விசித்திரமான உள்ளீடுகளின் (edge-case inputs) கீழ் மாதிரியின் செயல்பாட்டைக் கணிப்பதைக் கடினமாக்குகிறது.
இறுதி முடிவு
உங்கள் குழு இன்று 35 B-அளவுரு கொண்ட LLM-ஐச் சோதிக்க விரும்பினால் மற்றும் GPU வாங்க வசதி இல்லையென்றால், POCKET-35B ஒரு சாத்தியமான, குறைந்த செலவிலான தொடக்கப் புள்ளியாக அமைகிறது. இந்த மாதிரி GGUF வடிவத்தைப் பயன்படுத்தி ஒரு சாதாரண மடிக்கணினியில் இயங்குகிறது, மேலும் திறந்த மூல ரன்டைம்கள் அமைப்பை எளிதாக்குகின்றன. இருப்பினும், இந்த மாதிரியை ஒரு சோதனை முயற்சியாகவே கருதுங்கள்: எந்தவொரு உற்பத்திப் பணிப்பாய்விலும் (production pipeline) இணைப்பதற்கு முன், நினைவகத் தேவைகளைச் சரிபார்க்கவும், உண்மையான பணிகளுடன் பெஞ்ச்மார்க் செய்யவும் மற்றும் மொழி கையாளுதலை உறுதிப்படுத்தவும். சமூகத் தரவுகள் சேரும்போதும், VIDRAFT கூடுதல் விவரங்களை வெளியிடும்போதும், இதன் அபாயத் தன்மை தெளிவாகும்—ஆனால் இப்போதைக்கு, ஒரு சாதாரண மடிக்கணினியால் உண்மையில் 35 B LLM-ஐத் தாங்க முடியும், இருப்பினும் நிதானமான எதிர்பார்ப்புகளுடன் அணுகுவது நல்லது.
