உள்ளூர் பெரிய மொழி மாதிரிகளை (local large language models) இயக்குவது பெரும்பாலும் உங்களை வன்பொருள் (hardware) சிக்கல்களுக்குள் தள்ளுகிறது. NVIDIA பயனர்கள் CUDA சூழலுக்குள் வாழ்கிறார்கள். Apple டெவலப்பர்கள் Metal-ஐத் தேர்ந்தெடுக்கிறார்கள். மற்ற அனைவரும் தங்கள் GPU, OpenCL-ஐ ஆதரிக்கிறதா அல்லது வெறுமனே CPU-வைச் சார்ந்து இருக்க வேண்டுமா என்று நம்புகிறார்கள். இந்தத் துண்டாடல் (fragmentation), ஒரு டெஸ்க்டாப் AI செயலியை உருவாக்குவதை தேவையற்ற கடினமான ஒன்றாக மாற்றுகிறது. TensorSharp, ஒரு Vulkan backend-ஐச் சேர்ப்பதன் மூலம் இந்தப் பிரச்சனைக்குத் தீர்வாகத் தொடங்கியுள்ளது, இது பல்வேறு தயாரிப்பு நிறுவனங்களின் தனித்த (discrete) GPU-க்களுக்கு ஒரு நம்பகமான பாதையை வழங்குகிறது.

Vulkan ஏன் இந்தச் சூழலை மாற்றுகிறது

Vulkan பொதுவாக கேமிங் வட்டங்களில் விவாதிக்கப்படுகிறது, ஆனால் குறைந்த மேலதிகச் செலவு (low-overhead) கொண்ட, குறுக்கு-தள கணினி API (cross-platform compute API) என்ற முறையில், இது அனுமானத்திற்கும் (inference) சமமான முக்கியத்துவம் வாய்ந்தது. இது CUDA புறக்கணிக்கும் வன்பொருள்களையும் சென்றடைகிறது. Intel UHD மற்றும் Iris Xe ஒருங்கிணைந்த சிப்கள் (integrated chips), பழைய தனித்த கார்டுகள் (discrete cards), NVIDIA ஸ்டிக்கர் இல்லாத பட்ஜெட் Windows லேப்டாப்கள் என அனைத்தையும் இது சென்றடைகிறது. ஒரு உள்ளூர் அனுமான இயந்திரத்திற்கு (local inference engine), இந்தத் தொடர்பு ஒரு நடைமுறைத் திறனாகும். ஒரு டெவலப்பர், CUDA-சார்ந்த தீர்வை விட அதிக இயந்திரங்களில் இயங்கக்கூடிய ஒரு ஒற்றை பைனரி பாதையை (single binary path) வழங்க முடியும்.

TensorSharp-ன் Vulkan ஆதரவு GGML திட்டத்தின் மூலம் அறிமுகப்படுத்தப்பட்டது. இந்த ஒருங்கிணைப்பு இன்று செயல்பாட்டில் உள்ளது, இருப்பினும் ஆசிரியர் பின்னர் ஒரு நேட்டிவ் Vulkan backend-ஐ உருவாக்கத் திட்டமிட்டுள்ளார். GGML-ஐ ஒரு பாலமாகப் பயன்படுத்துவது சரியான தற்காலிக நடவடிக்கையாகும். இது கட்டமைப்பை (architecture) உறுதிப்படுத்துகிறது மற்றும் சோதனையாளர்களின் கைகளில் உடனடியாக வன்பொருளைக் கொண்டு சேர்க்கிறது. அப்ஸ்ட்ராக்ஷன் மேலதிகச் செலவைக் (abstraction overhead) குறைக்கவும், கமெண்ட் பஃபர்கள் (command buffers) மற்றும் மெமரி பேரியர்கள் (memory barriers) மீது C#-மையப்படுத்தப்பட்ட இயந்திரத்திற்கு நுணுக்கமான கட்டுப்பாட்டை வழங்கவும் ஒரு நேட்டிவ் backend பின்தொடரும்.

சோதனைத் தளம் இதுவரை எப்படி உள்ளது

சரிபார்ப்பு ஏற்கனவே இரண்டு முற்றிலும் மாறுபட்ட Windows கட்டமைப்புகளை உள்ளடக்கியுள்ளது. டெவலப்பர் NVIDIA GeForce RTX 3080 Laptop GPU மற்றும் சாதாரண Intel UHD Graphics ஆகியவற்றில் சோதித்துள்ளார். இரண்டும் சிறப்பாக இயங்கின. இந்தத் தொடர் கவனிக்கத்தக்கது. அதிக வாட்டேஜ் கொண்ட தனித்த சிலிக்கான் மற்றும் அடிப்படை ஒருங்கிணைந்த கிராபிக்ஸ் ஆகியவை அனுமான உலகில் இவ்வளவு எளிதாகப் பகிர்ந்து கொள்ளப்படுவதில்லை. உங்களிடம் பிரத்யேக GPU இல்லாத ஒரு லேசான லேப்டாப் இருந்தால், TensorSharp இப்போது NVIDIA டிரைவர்களைச் சார்ந்து இல்லாத ஒரு உண்மையான வேகமூட்டும் பாதையை (acceleration path) வழங்குகிறது.

இந்த வரிசையில் விடுபட்டது AMD. இதுவரை எந்த Radeon வன்பொருளும் சோதிக்கப்படவில்லை. உங்களிடம் AMD GPU இருந்தால், இந்தத் திட்டத்திற்கு உங்கள் கருத்து தேவை. RX 6000 அல்லது 7000 தொடர் கார்டுகளில் சமூகச் சரிபார்ப்பு (community validation) இருந்தால் மட்டுமே ஒரு சோதனை ரீதியான backend, உற்பத்தித் தரமான (production-grade) விருப்பமாக மாறும். ஏதேனும் பிழை ஏற்பட்டால் ஒரு issue-வை பதிவு செய்யுங்கள். சிறப்பாகச் செயல்பட்டால் அதையும் பதிவு செய்யுங்கள். இரண்டு முடிவுகளும் இந்தத் திட்டத்தை முன்னோக்கித் தள்ளும்.

TensorSharp என்பது ஒரு Wrapper அல்ல

இந்தத் புள்ளிக்கு முக்கியத்துவம் அளிக்கப்பட வேண்டும். TensorSharp என்பது llama.cpp-க்கான ஒரு C# பிண்டிங் (binding) அல்ல. டெவலப்பர் முழு இயந்திரத்தையும் ஆரம்பத்திலிருந்து உருவாக்கினார். CPU backend முற்றிலும் C# ஆகும். நீங்கள் GPU இல்லாமல் அனுமானத்தை (inference) இயக்கும்போது, நீங்கள் ஒரு வெளிநாட்டுச் செயல்பாட்டு இடைமுகம் (foreign function interface) வழியாக C++ பைனரிக்கு மாற்றிக் கொண்டிருக்காமல், மேனேஜ்டு கோடை (managed code) இயக்குகிறீர்கள். இந்தத் திட்டம் CUDA, Apple-ன் MLX மற்றும் GGML ஆகியவற்றிற்கான பிரத்யேக backends-களையும் பராமரிக்கிறது. இந்தத் தனித்துவமான கட்டமைப்பு இருந்தபோதிலும், இதன் செயல்திறன் llama.cpp-க்கு இணையாக உள்ளது, இதுவே பெரும்பாலான உள்ளூர் அனுமானத் திட்டங்கள் இலக்காகக் கொண்டுள்ள ஒரு தரநிலையாகும். அந்தச் சமநிலையை அடைவது கடினமானது. இதன் பொருள் மெமரி லேஅவுட் (memory layout), கர்னல் டிஸ்பாட்ச் (kernel dispatch) மற்றும் டென்சர் ஆபரேஷன்கள் (tensor ops) அனைத்தும் உண்மையான சுமையின் கீழ் சிறப்பாகச் செயல்படுகின்றன என்பதாகும்.

மாடல் ஆதரவு Gemma4, DiffusionGemma மற்றும் Qwen3.6 ஆகியவற்றை உள்ளடக்கியது. இந்த ரன்டைம் (runtime) மல்டிமோடல் (multimodal) பணிகளையும் கையாள்கிறது. விஷன் (Vision), ஆடியோ மற்றும் ரீசனிங் (reasoning) பைப்லைன்கள் ஒரே இயந்திரத்தின் மூலம் இயங்குகின்றன. ஸ்கிரீன்ஷாட்களைப் படித்து குரல் கட்டளைகளை ஏற்கும் ஒரு டெஸ்க்டாப் உதவியாளரை நீங்கள் உருவாக்குகிறீர்கள் என்றால், மூன்று தனித்த ரன்டைம்களை இணைத்து அவற்றின் மெமரி பயன்பாடு உங்கள் இயந்திரத்திற்குள் அடங்குமா என்று கவலைப்பட வேண்டிய அவசியமில்லை.

பிளாட்ஃபார்ம் மற்றும் API நெகிழ்வுத்தன்மை

TensorSharp Windows, macOS மற்றும் Linux ஆகியவற்றில் இயங்குகிறது. புதிய Vulkan backend, ஏற்கனவே உள்ள CUDA மற்றும் Metal பாதைகளுடன் அந்த வரிசையில் சரியாகப் பொருந்துகிறது. இந்த இயந்திரம் OpenAI மற்றும் Ollama ஆகிய இரண்டு API-களுடனும் இணக்கத்தன்மையைக் கொண்டுள்ளது. அந்தத் தேர்வு ஒருங்கிணைப்புச் சிரமத்தைக் குறைக்கிறது. ப்ராம்ப்ட் டெம்ப்ளேட்களை (prompt templates) மீண்டும் எழுதாமலோ அல்லது புதிய ரெஸ்பான்ஸ் வடிவத்தை (response shape) பகுப்பாய்வு செய்யாமலோ, ஏற்கனவே உள்ள கிளையண்ட் கோடை ஒரு உள்ளூர் TensorSharp சர்வருக்குத் திருப்ப முடியும். ஏற்கனவே உள்நாட்டிலேயே Ollama-வை இயக்கும் அல்லது OpenAI-ன் REST மேற்பரப்பைச் சார்ந்து கட்டமைக்கும் குழுக்கள், ஒரு உள்ளூர் TensorSharp இன்ஸ்டன்ஸிற்கு மாறுவது என்பது பெரும்பாலும் ஒரு அடிப்படை URL-ஐ மாற்றுவது மட்டுமேயாகும்.

பயனுள்ள கடன் வாங்கப்பட்ட மேம்பாடுகள் (Borrowed Optimizations)

செயல்திறன் என்பது எந்த API, GPU-உடன் பேசுகிறது என்பதைப் பற்றியது மட்டுமல்ல. TensorSharp மற்ற இடங்களில் நிரூபிக்கப்பட்ட பல மேம்பாடுகளை ஒருங்கிணைக்கிறது.

vLLM-லிருந்து கடன் வாங்கப்பட்ட Paged KV cache, நீண்ட உரையாடல்களின் போது மெமரி அளவுக்கு அதிகமாக அதிகரிப்பதைத் (ballooning) தடுக்கிறது. ஒவ்வொரு வரிசைக்கும் (sequence) ஒரு தொடர்ச்சியான ஸ்க்ராட்ச்பேடை (scratchpad) ஒதுக்குவதற்குப் பதிலாக, இயந்திரம் நிலையான அளவு பக்கங்களை (fixed-size pages) ஒதுக்கி அவற்றை தேவைக்கேற்ப இணைக்கிறது. RAM பயன்பாடு அதிகரிப்பைக் கவலைப்படாமல், நீங்கள் கான்டெக்ஸ்ட் விண்டோக்களை (context windows) நீண்ட நேரம் திறந்து வைத்திருக்க முடியும்.

vLLM-லிருந்து வந்த continuous batching, throughput-ஐ மேம்படுத்துகிறது. தற்போதைய தொகுப்பு (group) முடியும் வரை காத்திருக்காமல், புதிய கோரிக்கைகளை (requests) இயங்கிக்கொண்டிருக்கும் தொகுப்புகளுக்குள் (active batches) இந்த எஞ்சின் இணைக்க முடியும். ஒரு பயனரின் prompt பத்து tokens ஆகவும், மற்றொருவரின் prompt இருநூறு tokens ஆகவும் இருந்தால், வன்பொருள் (hardware) அதிகப்படியாகப் பயன்படுத்தப்படும் மற்றும் சராசரி தாமதம் (average latency) குறையும்.

Mixture-of-Experts மாதிரிகளுக்கு, TensorSharp ஆனது oMLX-லிருந்து பெறப்பட்ட SSD-அடிப்படையிலான cache உத்தியை செயல்படுத்துகிறது. அடிக்கடி அணுகப்படும் expert weights, system RAM-க்காகப் போராடுவதற்குப் பதிலாக, வேகமான சேமிப்பகத்தில் (fast storage) தயாராக இருக்கும். குறைந்த நினைவகம் (memory) கொண்ட ஆனால் நல்ல NVMe drives கொண்ட கணினிகளில், இது MoE கட்டமைப்புகளைப் பயன்படுத்தக்கூடியதாக வைத்திருக்கும்.

Quantization ஆனது llama.cpp-ஆல் உருவாக்கப்பட்ட GGUF தரநிலையைப் பின்பற்றுகிறது. உங்கள் quantized 4-bit மற்றும் 5-bit மாதிரிகள் எந்த மாற்றும் (conversion) செய்யாமலேயே நேரடியாகப் பதிவாகும்.

முக்கியக் கருத்து

Vulkan ஆதரவு, TensorSharp-ஐ ஒரு சுவாரஸ்யமான C# பரிசோதனையிலிருந்து, பல்வேறு வகையான வன்பொருள்களுக்கான (heterogeneous hardware) ஒரு நடைமுறைப் பயன்பாட்டுத் தேர்வாக (practical inference option) மாற்றுகிறது. இதன் எதிர்காலத் திட்டம் (roadmap) தெளிவாக உள்ளது: AMD மற்றும் Intel discrete silicon-களில் இதைச் சரிபார்த்துவிட்டு, பின்னர் ஒரு native Vulkan backend மூலம் இதன் செயல்பாட்டை மேம்படுத்துவது. உங்கள் workstation அல்லது laptop-இல் AMD card இருந்தால், இந்த build-ஐ இயக்கி உங்கள் முடிவுகளைப் பகிருங்கள். அந்தப் பின்னூட்டமே (feedback loop) ஒரு சோதனை முயற்சியிலான குறியீட்டை, நீங்கள் பயன்பாட்டிற்கு அனுப்பக்கூடிய (ship) ஒரு நிலையான ஒன்றாக மாற்றுகிறது.

வெளியீட்டு விவரங்களை (release details) டெவலப்பரின் கட்டுரையில் காணலாம். இந்தத் திட்டம் CUDA toolkits-களைக் கையாளுவதிலிருந்தோ அல்லது macOS version locks-களுடன் போராடுவதிலிருந்தோ உங்களைக் காப்பாற்றினால், repository-இல் ஒரு star-ஐ வழங்கவும். தொடர்ச்சியான விவாதங்கள் மற்றும் சமூகச் சோதனைத் தொடர்களுக்கு (community testing threads), Telegram குழு எப்போதும் திறந்தே இருக்கும்.