GGUF மொழி மாதிரிகளுக்கான (language models) ஒரு தூய .NET inference engine ஆன TensorSharp, இப்போது பொதுப்பயன்பாட்டிற்கு வந்துள்ளது. இது .NET டெவலப்பர்கள் ஒரு Python சர்வரைத் தொடங்குவதே இன்றி, பெரிய மொழி மாதிரிகளின் (LLM) inference-ஐ இயக்க அனுமதிக்கிறது. Windows, macOS மற்றும் Linux ஆகியவற்றில் இயங்கக்கூடியதுடன், CPU, CUDA, MLX, Metal மற்றும் Vulkan back-ends ஆகியவற்றையும் ஆதரிக்கும் இந்தத் திட்டம், பரவலாகப் பயன்படுத்தப்படும் llama.cpp-க்கு இணையான செயல்திறனைத் தருவதாகக் கூறுகிறது.
ஏன் நேட்டிவ் (native) .NET முக்கியமானது
பெரும்பாலான LLM runtimes C/C++ மொழியில் எழுதப்பட்டுள்ளன அல்லது ஒரு தனிச் செயல்பாட்டை (process) வெளிப்படுத்தும் Python wrappers-ஐச் சார்ந்திருக்கின்றன. ஏற்கனவே .NET-இல் இயங்கும் சேவைகளைக் கொண்ட குழுக்களுக்கு, இந்த கூடுதல் அடுக்கு (layer) கூடுதல் containers, inter-process communication மற்றும் ஒரு பெரிய தாக்குதல் பரப்பளவை (attack surface) உருவாக்குகிறது. Inference-ஐ அதே runtime-க்குள் வைத்திருப்பது, டெவலப்பர்கள் CI/CD pipelines-ஐ எளிமையாக்கவும், நெட்வொர்க் தாவல்களால் (network hops) ஏற்படும் தாமதத்தைக் குறைக்கவும் மற்றும் ஒரு Python சூழலைப் பராமரிக்கும் செலவைக் குறைக்கவும் உதவுகிறது.
TensorSharp எவ்வாறு உருவாக்கப்பட்டுள்ளது
ஆசிரியர் llama.cpp-ஐ மீண்டும் பயன்படுத்துவதற்குப் பதிலாக, இந்த engine-ஐ ஆரம்பத்திலிருந்து (from scratch) எழுதினார். இதன் CPU backend 100% C# மொழியில் இருப்பதால், Windows மற்றும் Linux ஆகியவற்றில் எந்தவிதமான native dependencies-உம் இன்றி இயங்கும். GPU ஆதரவு ஏற்கனவே உள்ள graphics APIs மூலம் வழங்கப்படுகிறது: Nvidia-விற்கு CUDA, Apple silicon-விற்கு MLX, macOS GPUs-விற்கு Metal மற்றும் cross-platform hardware-களுக்கு Vulkan. Qwen மற்றும் Gemma போன்ற மாதிரிகளுக்கான paged key-value (KV) cache, continuous batching மற்றும் speculative decoding போன்ற நவீன நுட்பங்கள் இதன் மையப்பகுதியில் உள்ளன.
டெவலப்பர்களுக்குக் கிடைக்கும் அம்சங்கள்
- GGUF model compatibility – சமீபத்திய open-source LLM வெளியீடுகளில் பயன்படுத்தப்படும் அதே வடிவம்.
- Cross-platform operation – குறியீடு மாற்றங்கள் இன்றி Windows, macOS மற்றும் Linux ஆகியவற்றில் இயங்கும்.
- OpenAI- and Ollama-compatible HTTP APIs – ஏற்கனவே உள்ள client libraries-களுக்குப் பதிலாக நேரடியாகப் பயன்படுத்தலாம்.
- Multimodal handling – ஒரு prompt-இன் ஒரு பகுதியாக படங்கள், வீடியோ, ஆடியோ மற்றும் PDF-களை உள்ளீடாகப் பெற முடியும்.
- Tool calling and structured output – chat-அடிப்படையிலான ஏஜென்ட்களில் (agents) பொதுவாகக் காணப்படும் function-calling முறைகளை ஆதரிக்கிறது.
llama.cpp உடன் செயல்திறன் ஒப்பீடு
பராமரிப்பாளர் (maintainer) பகிர்ந்த benchmarks கலவையான முடிவுகளைக் காட்டுகின்றன:
- Prefill and time-to-first-token (TTFT) – TensorSharp பெரும்பாலும் llama.cpp-ஐ விடச் சிறப்பாகச் செயல்பட்டு, ஆரம்பப் பதிலுக்கான தாமதத்தைக் (latency) குறைக்கிறது.
- Decode throughput – பொதுவாக llama.cpp-க்கு இணையான அல்லது அதைவிடச் சற்றே மெதுவான வேகத்தைக் கொண்டுள்ளது.
இந்த எண்கள், தூய C# செயலாக்கம் (implementation) வேகத்தை இழக்காமல், தாமதத்திற்கு முக்கியமான நிலைகளில் சிறப்பாகச் செயல்படுவதையும், அதே சமயம் token-per-second வெளியீட்டில் போட்டியிடக்கூடிய நிலையிலும் இருப்பதையும் காட்டுகின்றன.
கவனத்தில் கொள்ள வேண்டியவை
- நிஜ உலகச் செயல்திறன், மாதிரி கட்டமைப்பு (model architecture), வன்பொருள் அமைப்பு (hardware configuration) மற்றும் மெமரி லேஅவுட் (memory layout) ஆகியவற்றைப் பொறுத்து மாறுபடும்; டெவலப்பர்கள் பயன்பாட்டுக்கு (production) எடுத்துச் செல்லும் முன் தமக்கான benchmarks-களைச் செய்து பார்க்க வேண்டும்.
அடுத்து என்ன எதிர்பார்க்கலாம்
டெலிகிராமில் (Telegram) உள்ள இந்தத் திட்டத்தின் கலந்துரையாடல் சேனல், ஆரம்பகாலப் பயனர்கள் தங்கள் முடிவுகளைப் பகிர்ந்து கொள்ளவும் புதிய அம்சங்களைக் கோரவும் ஒரு இடமாக அமைகிறது.
சுருக்கம்: TensorSharp, .NET நிறுவனங்கள் தங்களின் பயன்பாடுகளுக்குள் (applications) நேரடியாக LLM inference-ஐ இணைப்பதற்கான வழியை வழங்குகிறது. இது ஒரு தனி Python stack-இன் தேவையை நீக்குவதுடன், llama.cpp-க்கு இணையான தாமதத்தையும் (latency) வழங்குகிறது. உற்பத்தித் குழுக்கள் (Production teams) தங்களின் இலக்கு வன்பொருளில் (target hardware) செயல்திறனைச் சரிபார்க்க வேண்டும், ஆனால் இந்த engine .NET சூழலுக்குள் நேட்டிவ் AI சேவைகளுக்கான தெளிவான பாதையைத் திறக்கிறது.
