TensorSharp, GGUF ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ ਲਈ ਇੱਕ pure-.NET inference engine, ਹੁਣ ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਹੈ, ਜੋ .NET ਡਿਵੈਲਪਰਾਂ ਨੂੰ Python ਸਰਵਰ ਚਲਾਏ ਬਿਨਾਂ large-language-model (LLM) inference ਚਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਇਹ ਪ੍ਰੋਜੈਕਟ Windows, macOS ਅਤੇ Linux 'ਤੇ ਚੱਲਣ ਅਤੇ CPU, CUDA, MLX, Metal ਅਤੇ Vulkan back-ends ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹੋਏ, ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਵਰਤੇ ਜਾਣ ਵਾਲੇ llama.cpp ਦੇ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਦਾਅਵਾ ਕਰਦਾ ਹੈ।
Native .NET ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਜ਼ਿਆਦਾਤਰ LLM runtimes C/C++ ਵਿੱਚ ਲਿਖੇ ਹੁੰਦੇ ਹਨ ਜਾਂ Python wrappers 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ ਜੋ ਇੱਕ ਵੱਖਰੀ ਪ੍ਰਕਿਰਿਆ (process) ਨੂੰ ਪ੍ਰਗਟ ਕਰਦੇ ਹਨ। ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਜਿਨ੍ਹਾਂ ਦੀਆਂ ਸੇਵਾਵਾਂ ਪਹਿਲਾਂ ਹੀ .NET 'ਤੇ ਚੱਲਦੀਆਂ ਹਨ, ਉਹ ਵਾਧੂ ਲੇਅਰ ਕੰਟੇਨਰਾਂ, inter-process communication ਅਤੇ ਇੱਕ ਵੱਡਾ attack surface ਜੋੜਦੀ ਹੈ। Inference ਨੂੰ ਉਸੇ runtime ਦੇ ਅੰਦਰ ਰੱਖਣ ਨਾਲ ਡਿਵੈਲਪਰਾਂ ਨੂੰ CI/CD pipelines ਨੂੰ ਸਰਲ ਬਣਾਉਣ, network hops ਤੋਂ latency ਘਟਾਉਣ ਅਤੇ Python environment ਨੂੰ ਬਣਾਈ ਰੱਖਣ ਦੀ ਲਾਗਤ ਨੂੰ ਘਟਾਉਣ ਵਿੱਚ ਮਦਦ ਮਿਲਦੀ ਹੈ।
TensorSharp ਕਿਵੇਂ ਬਣਾਇਆ ਗਿਆ ਹੈ
ਲੇਖਕ ਨੇ llama.cpp ਨੂੰ ਦੁਬਾਰਾ ਵਰਤਣ ਦੀ ਬਜਾਏ ਇੰਜਣ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਲਿਖਿਆ ਹੈ। CPU backend 100% C# ਹੈ, ਇਸ ਲਈ Windows ਅਤੇ Linux ਬਿਨਾਂ ਕਿਸੇ native dependencies ਦੇ ਚੱਲਦੇ ਹਨ। GPU support ਮੌਜੂਦਾ graphics APIs ਤੋਂ ਆਉਂਦੀ ਹੈ: Nvidia ਲਈ CUDA, Apple silicon ਲਈ MLX, macOS GPUs ਲਈ Metal, ਅਤੇ cross-platform hardware ਲਈ Vulkan। Qwen ਅਤੇ Gemma ਵਰਗੇ ਮਾਡਲਾਂ ਲਈ paged key-value (KV) cache, continuous batching ਅਤੇ speculative decoding ਵਰਗੇ ਆਧੁਨਿਕ ਤਰੀਕੇ ਇਸਦੇ ਕੋਰ ਵਿੱਚ ਹਨ।
Features ਜੋ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਤਿਆਰ ਮਿਲਦੇ ਹਨ
- GGUF model compatibility – ਉਹੀ ਫਾਰਮੈਟ ਜੋ ਹਾਲ ਹੀ ਦੇ open-source LLM ਰਿਲੀਜ਼ਾਂ ਦੁਆਰਾ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ।
- Cross-platform operation – ਕੋਡ ਵਿੱਚ ਬਦਲਾਅ ਕੀਤੇ ਬਿਨਾਂ Windows, macOS ਅਤੇ Linux 'ਤੇ ਚੱਲਦਾ ਹੈ।
- OpenAI- ਅਤੇ Ollama-compatible HTTP APIs – ਮੌਜੂਦਾ client libraries ਲਈ ਇੱਕ ਸਿੱਧਾ ਬਦਲ।
- Multimodal handling – prompt ਦੇ ਹਿੱਸੇ ਵਜੋਂ images, video, audio ਅਤੇ PDFs ਨੂੰ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ।
- Tool calling ਅਤੇ structured output – chat-based agents ਵਿੱਚ ਆਮ function-calling patterns ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ।
llama.cpp ਦੇ ਮੁਕਾਬਲੇ ਪ੍ਰਦਰਸ਼ਨ
Maintainer ਦੁਆਰਾ ਸਾਂਝੇ ਕੀਤੇ ਗਏ benchmarks ਮਿਸ਼ਰਤ ਨਤੀਜੇ ਦਿਖਾਉਂਦੇ ਹਨ:
- Prefill ਅਤੇ time-to-first-token (TTFT) – TensorSharp ਅਕਸਰ llama.cpp ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ, ਸ਼ੁਰੂਆਤੀ ਜਵਾਬ ਲਈ ਘੱਟ latency ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- Decode throughput – ਆਮ ਤੌਰ 'ਤੇ llama.cpp ਦੇ ਸਮਾਨ ਜਾਂ ਥੋੜ੍ਹਾ ਹੌਲੀ ਹੁੰਦਾ ਹੈ।
ਅੰਕੜੇ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ pure C# implementation ਸਭ ਤੋਂ ਵੱਧ latency-sensitive ਪੜਾਵਾਂ ਵਿੱਚ ਰਫਤਾਰ ਨਾਲ ਸਮਝੌਤਾ ਨਹੀਂ ਕਰਦਾ ਹੈ, ਜਦੋਂ ਕਿ raw token-per-second output ਵਿੱਚ ਮੁਕਾਬਲੇਬਾਜ਼ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ।
ਧਿਆਨ ਵਿੱਚ ਰੱਖਣ ਯੋਗ ਗੱਲਾਂ
- ਅਸਲ-ਦੁਨੀਆ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਮਾਡਲ architecture, hardware configuration ਅਤੇ memory layout ਦੇ ਨਾਲ ਬਦਲਦਾ ਹੈ; ਡਿਵੈਲਪਰਾਂ ਨੂੰ production ਵਿੱਚ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਆਪਣੇ स्वयं ਦੇ benchmarks ਚਲਾਉਣੇ ਚਾਹੀਦੇ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
Telegram 'ਤੇ ਪ੍ਰੋਜੈਕਟ ਦਾ discussion channel early adopters ਨੂੰ ਨਤੀਜੇ ਸਾਂਝੇ ਕਰਨ ਅਤੇ features ਦੀ ਬੇਨਤੀ ਕਰਨ ਲਈ ਇੱਕ ਜਗ੍ਹਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
Takeaway: TensorSharp .NET shops ਨੂੰ ਉਹਨਾਂ ਦੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ ਵਿੱਚ ਸਿੱਧੇ ਤੌਰ 'ਤੇ LLM inference ਨੂੰ ਇਨਬੈਡ ਕਰਨ ਦਾ ਇੱਕ ਤਰੀਕਾ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਵੱਖਰੇ Python stack ਦੀ ਲੋੜ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ ਅਤੇ de-facto llama.cpp baseline ਦੇ ਬਰਾਬਰ latency ਪ੍ਰਦਾਨ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। Production ਟੀਮਾਂ ਨੂੰ ਆਪਣੇ target hardware 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਜਾਂਚ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ, ਪਰ ਇਹ ਇੰਜਣ .NET ecosystem ਦੇ ਅੰਦਰ native AI ਸੇਵਾਵਾਂ ਲਈ ਇੱਕ ਸਪਸ਼ਟ ਮਾਰਗ ਖੋਲ੍ਹਦਾ ਹੈ।
