TensorSharp, GGUF लैंग्वेज मॉडल्स के लिए एक प्योर-.NET इन्फरेंस इंजन, अब सार्वजनिक रूप से उपलब्ध है, जिससे .NET डेवलपर्स बिना किसी Python सर्वर को चलाए लार्ज-लैंग्वेज-मॉडल (LLM) इन्फरेंस चला सकते हैं। यह प्रोजेक्ट Windows, macOS और Linux पर चलते हुए और CPU, CUDA, MLX, Metal और Vulkan बैक-एंड्स का समर्थन करते हुए, व्यापक रूप से उपयोग किए जाने वाले llama.cpp के समान प्रदर्शन का दावा करता है।
नेटिव .NET क्यों महत्वपूर्ण है
अधिकांश LLM रनटाइम C/C++ में लिखे गए हैं या Python रैपर्स (wrappers) पर निर्भर करते हैं जो एक अलग प्रोसेस को एक्सपोज़ करते हैं। उन टीमों के लिए जिनकी सेवाएं पहले से ही .NET पर चलती हैं, वह अतिरिक्त लेयर कंटेनर्स, इंटर-प्रोसेस कम्युनिकेशन और एक बड़ा अटैक सरफेस (attack surface) जोड़ती है। इन्फरेंस को उसी रनटाइम के भीतर रखने से डेवलपर्स CI/CD पाइपलाइनों को सरल बना सकते हैं, नेटवर्क हॉप्स से लेटेंसी (latency) कम कर सकते हैं, और Python एनवायरनमेंट को बनाए रखने की लागत को कम कर सकते हैं।
TensorSharp कैसे बनाया गया है
लेखक ने llama.cpp का पुन: उपयोग करने के बजाय इंजन को स्क्रैच से लिखा है। इसका CPU बैकएंड 100% C# है, इसलिए Windows और Linux बिना किसी नेटिव डिपेंडेंसी के चलते हैं। GPU सपोर्ट मौजूदा ग्राफिक्स APIs से आता है: Nvidia के लिए CUDA, Apple silicon के लिए MLX, macOS GPUs के लिए Metal, और क्रॉस-प्लेटफ़ॉर्म हार्डवेयर के लिए Vulkan। Qwen और Gemma जैसे मॉडल्स के लिए पेज्ड की-वैल्यू (KV) कैश, कंटीन्यूअस बैचिंग और स्पेकुलेटिव डिकोडिंग जैसे आधुनिक तरीके इसके कोर में शामिल हैं।
फीचर्स जो डेवलपर्स को सीधे मिलते हैं
- GGUF मॉडल कम्पैटिबिलिटी – वही फॉर्मेट जिसका उपयोग हालिया ओपन-सोर्स LLM रिलीज़ में किया जाता है।
- क्रॉस-प्लेटफ़ॉर्म ऑपरेशन – बिना कोड बदले Windows, macOS और Linux पर चलता है।
- OpenAI और Ollama-कम्पैटिबल HTTP APIs – मौजूदा क्लाइंट लाइब्रेरीज़ के लिए ड्रॉप-इन रिप्लेसमेंट।
- मल्टीमॉडल हैंडलिंग – प्रॉम्प्ट के हिस्से के रूप में इमेज, वीडियो, ऑडियो और PDFs को इनजेस्ट कर सकता है।
- टूल कॉलिंग और स्ट्रक्चर्ड आउटपुट – चैट-आधारित एजेंट्स में सामान्य फंक्शन-कॉलिंग पैटर्न का समर्थन करता है।
llama.cpp बनाम परफॉरमेंस
मेंटेनर द्वारा साझा किए गए बेंचमार्क मिश्रित परिणाम दिखाते हैं:
- Prefill और time-to-first-token (TTFT) – TensorSharp अक्सर llama.cpp को पीछे छोड़ देता है, जिससे शुरुआती रिस्पॉन्स के लिए कम लेटेंसी मिलती है।
- Decode throughput – आमतौर पर llama.cpp के समान या उससे थोड़ा धीमा होता है।
आंकड़े बताते हैं कि प्योर C# इम्प्लीमेंटेशन सबसे अधिक लेटेंसी-सेंसिटिव चरणों में गति से समझौता नहीं करता है, जबकि रॉ टोकन-पर-सेकंड आउटपुट में प्रतिस्पर्धी बना रहता है।
ध्यान रखने योग्य सावधानियां
- वास्तविक दुनिया का प्रदर्शन मॉडल आर्किटेक्चर, हार्डवेयर कॉन्फ़िगरेशन और मेमोरी लेआउट के साथ बदलता रहता है; डेवलपर्स को प्रोडक्शन में जाने से पहले अपने स्वयं के बेंचमार्क चलाने चाहिए।
आगे क्या देखें
टेलीग्राम पर प्रोजेक्ट का डिस्कशन चैनल शुरुआती अपनाने वालों (early adopters) के लिए परिणाम साझा करने और फीचर्स का अनुरोध करने के लिए एक जगह प्रदान करता है।
निष्कर्ष: TensorSharp .NET कंपनियों को अपने एप्लिकेशन में सीधे LLM इन्फरेंस को एम्बेड करने का एक तरीका देता है, जिससे अलग Python स्टैक की आवश्यकता समाप्त हो जाती है और llama.cpp बेसलाइन के समान लेटेंसी मिलती है। प्रोडक्शन टीमों को अपने लक्षित हार्डवेयर पर प्रदर्शन को सत्यापित करना चाहिए, लेकिन यह इंजन .NET इकोसिस्टम के भीतर नेटिव AI सेवाओं के लिए एक स्पष्ट रास्ता खोलता है।
