DeepSeek-ன் DSpark கட்டமைப்பானது, எந்தவிதமான மறுபயிற்சியும் (retraining) அல்லது தர இழப்பும் இன்றி, பிரபலமான பெரிய மொழி மாதிரிகள் (large language models) 85% வரை வேகமாக உரையை உருவாக்க அனுமதிக்கிறது. இந்த வேக அதிகரிப்பு இன்று DeepSeek-ன் API மூலமாகவும், எவர் வேண்டுமானாலும் தங்கள் சொந்த பயன்பாட்டில் இணைத்துக் கொள்ளக்கூடிய திறந்த மூல (open-source) MIT-அனுமதிக்கப்பட்ட நூலகமாகவும் (library) கிடைக்கிறது.

இப்போது அனுமான வேகம் (inference speed) ஏன் முக்கியமானது

2026-ஆம் ஆண்டிற்குள், AI-க்கான கணக்கீட்டு பட்ஜெட்டில் (compute budget) பெரும்பகுதி அனுமானத்திற்காகவே (inference) செலவிடப்படும் - அதாவது ஒரு பயிற்சி அளிக்கப்பட்ட மாதிரி கேள்விகளுக்குப் பதிலளிக்கும் நிலை. நிறுவனங்கள் மிகப்பெரிய மாதிரிகளை உருவாக்குவதிலிருந்து அவற்றை பெரிய அளவில் வழங்குவதை நோக்கி மாறும்போது, தாமதம் (latency) மற்றும் வன்பொருள் செலவுகள் (hardware costs) தீர்மானிக்கும் காரணிகளாகின்றன. வேகமான அனுமானம் என்பது மலிவான GPU கிளஸ்டர்கள், குறைந்த கிளவுட் கட்டணங்கள் மற்றும் அதிக துரிதமான பயனர் அனுபவங்களைக் குறிக்கிறது.

ஸ்பெகுலேட்டிவ் டீகோடிங் (speculative decoding) நுட்பம்

பாரம்பரியமான உருவாக்கம் டோக்கன் வாரியாக (token by token) நடைபெறுகிறது: மாதிரி அடுத்த வார்த்தையைத் துல்லியமாகக் கணிக்கும், பிறகு அடுத்த வார்த்தையைத் துல்லியமாகக் கணிக்கும், இப்படியே தொடரும். நவீன GPU-க்களின் பலமே இணையாகச் செயல்படுவது (parallelism) தான், ஆனால் இந்தத் தொடர்ச்சியான நடைமுறை அவற்றின் வேகத்தைக் குறைக்கிறது. DSpark, ஸ்பெகுலேட்டிவ் டீகோடிங் மூலம் இந்தத் தடையைத் தவிர்க்கிறது:

  • ஒரு இலகுவான "வரைவு" (draft) மாதிரி பல டோக்கன்களை முன்கூட்டியே கணிக்கும்.
  • பிரதானமான, மிகப் பெரிய மாதிரி அந்த கணிப்புகளை ஒரே தொகுப்பாக (single batch) சரிபார்க்கும்.
  • வரைவு மாதிரியின் கணிப்புகள் பெரிய மாதிரியின் எதிர்பார்ப்புகளுடன் ஒத்துப்போகும்போது, அமைப்பு அந்த முழு தொகுப்பையும் ஒரே நேரத்தில் வெளியிடுகிறது, இது ஒவ்வொரு டோக்கனுக்காகக் காத்திருக்கும் நேரத்தைக் குறைக்கிறது.
  • ஒரு கணிப்பு தவறாக இருந்தால், அந்தத் தொகுப்பு நிராகரிக்கப்பட்டு செயல்முறை மீண்டும் தொடங்கும், இதன் மூலம் இறுதி வெளியீடு பெரிய மாதிரி தனியாகச் செய்திருந்தால் எப்படி இருந்திருக்குமோ அதேபோல இருப்பதை உறுதி செய்கிறது.

பெரிய மாதிரி இறுதிச் சரிபார்ப்பைச் செய்வதால், உருவாக்கப்பட்ட உரை ஒரு தனி டோக்கன் முறையில் (single-token run) உருவாக்கப்பட்டதைப் போன்ற அதே தரம் மற்றும் துல்லியத்தைப் பெறுகிறது.

DSpark இன்று எவற்றையெல்லாம் ஆதரிக்கிறது

  • அனுமதி வழங்கும் MIT உரிமத்தின் கீழ் திறந்த மூலமாக (open-source) கிடைக்கிறது, எனவே குழுக்கள் உரிமத் தடைகள் இன்றி அதை ஆய்வு செய்யலாம், மாற்றியமைக்கலாம் அல்லது இணைக்கலாம்.
  • DeepSeek, Alibaba-வின் Qwen மற்றும் Google-ன் Gemma ஆகியவற்றுடன் இணக்கமானது, இது பல பிரபலமான திறந்த மூல LLM குடும்பங்களை உள்ளடக்கியது.
  • தற்போதுள்ள வன்பொருளிலேயே உடனடி வேக அதிகரிப்பு; பயனர்கள் 60% முதல் 85% வரை வேகமான அனுமானத்தைப் பயன்படுத்துவதாகக் கூறுகின்றனர், இது அதே வேலைப்பளுவிற்கு குறைந்த GPU நேரத்தையே செலவிடுகிறது.
  • புதிய மற்றும் அதிக விலையுள்ள GPU-களுக்கு மேம்படுத்த வேண்டிய அழுத்தம் குறைகிறது, இது ஸ்டார்ட்அப்கள் மற்றும் நிறுவனங்கள் ஆகிய இரண்டிற்கும் முக்கிய செலவுக் காரணியாகும்.

நீங்கள் ஏற்கனவே DeepSeek-ன் ஹோஸ்டட் API-யைப் பயன்படுத்தினால், DSpark மேம்பாடுகள் பின்னணியிலேயே இயங்கும். உங்கள் சொந்த ஸ்பெகுலேட்டிவ் குழாயை (speculative pipeline) உருவாக்கத் தேவையான வரைவு-மாதிரி உள்கட்டமைப்பை (draft-model infrastructure) GitHub-ல் உள்ள DeepSpec codebase வழங்குகிறது.

முக்கியக் கருத்து

புதிய வன்பொருள் தேவைப்படும் என்று கருதப்பட்ட தாமதக் குறைப்பைக் கூட, மென்பொருள் சார்ந்த மாற்றங்கள் மூலம் சாதிக்க முடியும் என்பதை DSpark நிரூபிக்கிறது. ஸ்பெகுலேட்டிவ் டீகோடிங்கைத் திறம்படக் கிடைக்கச் செய்வதன் மூலம், DeepSeek AI செயல்திறன்ப் போட்டியை "பெரிய சிப்கள்" என்பதிலிருந்து "புத்திசாலித்தனமான குறியீடு" (smarter code) நோக்கி நகர்த்துகிறது, இது ஒரு பெரிய மாதிரியை இயக்கக்கூடிய எவருக்கும் அதை வேகமாகவும் மலிவாகவும் இயக்கும் வாய்ப்பை வழங்குகிறது.