TensorSharp، جو GGUF لینگویج ماڈلز کے لیے ایک خالص .NET انفرنس انجن ہے، اب عوامی طور پر دستیاب ہے، جس سے .NET ڈویلپرز پائتھن (Python) سرور چلائے بغیر لارج لینگویج ماڈل (LLM) انفرنس چلا سکتے ہیں۔ یہ پروجیکٹ دعویٰ کرتا ہے کہ اس کی کارکردگی وائڈلی استعمال ہونے والے llama.cpp کے برابر ہے جبکہ یہ Windows، macOS اور Linux پر چلتا ہے اور CPU، CUDA، MLX، Metal اور Vulkan بیک اینڈز کو سپورٹ کرتا ہے۔

نیٹیو (native) .NET کیوں اہم ہے

زیادہ تر LLM رن ٹائمز C/C++ میں لکھے گئے ہیں یا ایسے Python wrappers پر انحصار کرتے ہیں جو ایک الگ پراسیس کو ظاہر کرتے ہیں۔ ان ٹیموں کے لیے جن کی سروسز پہلے سے .NET پر چل رہی ہیں، وہ اضافی لیئر کنٹینرز، انٹر پراسیس کمیونیکیشن اور حملے کے ایک بڑے خطرے (attack surface) کا باعث بنتی ہے۔ انفرنس کو اسی رن ٹائم کے اندر رکھنے سے ڈویلپرز CI/CD پائپ لائنز کو سادہ بنا سکتے ہیں، نیٹ ورک ہاپس سے لیٹنسی (latency) کم کر سکتے ہیں، اور Python ماحول کو برقرار رکھنے کی لاگت میں کمی کر سکتے ہیں۔

TensorSharp کیسے بنایا گیا ہے

مصنف نے llama.cpp کو دوبارہ استعمال کرنے کے بجائے انجن کو شروع سے (from scratch) لکھا ہے۔ CPU بیک اینڈ 100% C# ہے، اس لیے Windows اور Linux بغیر کسی نیٹیو ڈیپینڈنسی کے چلتے ہیں۔ GPU سپورٹ موجودہ گرافکس APIs سے حاصل ہوتی ہے: Nvidia کے لیے CUDA، Apple silicon کے لیے MLX، macOS GPUs کے لیے Metal، اور کراس پلیٹ فارم ہارڈ ویئر کے لیے Vulkan۔ جدید تکنیکیں جیسے کہ paged key-value (KV) cache، continuous batching اور Qwen اور Gemma جیسے ماڈلز کے لیے speculative decoding اس کے کور میں موجود ہیں۔

وہ فیچرز جو ڈویلپرز کو فوری طور پر ملتے ہیں

  • GGUF ماڈل مطابقت – وہی فارمیٹ جو حالیہ اوپن سورس LLM ریلیز میں استعمال ہوتا ہے۔
  • کراس پلیٹ فارم آپریشن – کوڈ میں تبدیلی کے بغیر Windows، macOS اور Linux پر چلتا ہے۔
  • OpenAI اور Ollama کے ہم آہنگ HTTP APIs – موجودہ کلائنٹ لائبریریوں کے لیے ڈراپ ان متبادل۔
  • ملٹی موڈل ہینڈلنگ – پرامپٹ کے حصے کے طور پر تصاویر، ویڈیو، آڈیو اور PDFs کو شامل کر سکتا ہے۔
  • ٹول کالنگ اور اسٹرکچرڈ آؤٹ پٹ – چیٹ پر مبنی ایجنٹس میں عام فنکشن کالنگ پیٹرنز کو سپورٹ کرتا ہے۔

llama.cpp کے مقابلے میں کارکردگی

مینٹینر کے ذریعے شیئر کیے گئے بینچ مارکس ملے جلے نتائج دکھاتے ہیں:

  • Prefill اور time-to-first-token (TTFT) – TensorSharp اکثر llama.cpp کو پیچھے چھوڑ دیتا ہے، جو ابتدائی جواب کے لیے کم لیٹنسی فراہم کرتا ہے۔
  • Decode throughput – عام طور پر llama.cpp کے برابر یا اس سے تھوڑا سست ہوتا ہے۔

اعداد و شمار سے پتہ چلتا ہے کہ خالص C# امپلیمنٹیشن سب سے زیادہ لیٹنسی حساس مراحل میں رفتار کا نقصان نہیں کرتی، جبکہ خام ٹوکن فی سیکنڈ آؤٹ پٹ میں مقابلہ کرنے کے قابل رہتی ہے۔

ذہن میں رکھنے والی احتیاطی تدابیر

  • حقیقی دنیا کی کارکردگی ماڈل آرکیٹیکچر، ہارڈ ویئر کنفیگریشن اور میموری لے آؤٹ کے ساتھ مختلف ہوتی ہے؛ ڈویلپرز کو پروڈکشن میں استعمال کرنے سے پہلے اپنے خود کے بینچ مارکس چلانے چاہئیں۔

آگے کیا دیکھیں

ٹیلی گرام پر پروجیکٹ کا ڈسکشن چینل ابتدائی صارفین کو نتائج شیئر کرنے اور فیچرز کی درخواست کرنے کے لیے ایک جگہ فراہم کرتا ہے۔

خلاصہ: TensorSharp .NET کمپنیوں کو اپنی ایپلی کیشنز میں براہ راست LLM انفرنس شامل کرنے کا طریقہ فراہم کرتا ہے، جس سے الگ پائتھن اسٹیک کی ضرورت ختم ہو جاتی ہے اور llama.cpp کے معیار کے برابر لیٹنسی فراہم کی جاتی ہے۔ پروڈکشن ٹیموں کو اپنے ہدف والے ہارڈ ویئر پر کارکردگی کی تصدیق کرنی چاہیے، لیکن یہ انجن .NET ایکو سسٹم کے اندر نیٹیو AI سروسز کے لیے ایک واضح راستہ کھولتا ہے۔