TensorSharp, GGUF ল্যাঙ্গুয়েজ মডেলের জন্য একটি পিওর-.NET ইনফারেন্স ইঞ্জিন, এখন জনসমক্ষে উন্মুক্ত করা হয়েছে। এটি .NET ডেভেলপারদের কোনো পাইথন (Python) সার্ভার চালু না করেই লার্জ-ল্যাঙ্গুয়েজ-মডেল (LLM) ইনফারেন্স চালানোর সুবিধা দিচ্ছে। প্রকল্পটি দাবি করছে যে এটি Windows, macOS এবং Linux-এ চলার পাশাপাশি CPU, CUDA, MLX, Metal এবং Vulkan ব্যাক-এন্ড সমর্থন করে এবং বহুল ব্যবহৃত llama.cpp-এর সমতুল্য পারফরম্যান্স প্রদান করে।

কেন নেটিভ .NET গুরুত্বপূর্ণ

বেশিরভাগ LLM রানটাইম C/C++ এ লেখা অথবা পাইথন র‍্যাপারের (Python wrappers) ওপর নির্ভর করে যা একটি আলাদা প্রসেস তৈরি করে। যেসব টিমের সার্ভিসগুলো ইতিমধ্যে .NET-এ চলছে, তাদের জন্য এই অতিরিক্ত লেয়ারটি কন্টেইনার, ইন্টার-প্রসেস কমিউনিকেশন এবং একটি বড় অ্যাটাক সারফেস (attack surface) তৈরি করে। ইনফারেন্সকে একই রানটাইমের মধ্যে রাখলে ডেভেলপাররা তাদের CI/CD পাইপলাইন সহজ করতে পারেন, নেটওয়ার্ক হপ থেকে ল্যাটেন্সি কমাতে পারেন এবং একটি পাইথন এনভায়রনমেন্ট রক্ষণাবেক্ষণের খরচ কমাতে পারেন।

কীভাবে TensorSharp তৈরি করা হয়েছে

লেখক llama.cpp পুনরায় ব্যবহার না করে ইঞ্জিনটি একদম শুরু থেকে (from scratch) লিখেছেন। এর CPU ব্যাক-এন্ডটি ১০০% C# দিয়ে তৈরি, তাই Windows এবং Linux-এ কোনো নেটিভ ডিপেন্ডেন্সি ছাড়াই এটি চলতে পারে। GPU সাপোর্ট আসে বিদ্যমান গ্রাফিক্স API থেকে: Nvidia-র জন্য CUDA, Apple silicon-এর জন্য MLX, macOS GPU-র জন্য Metal এবং ক্রস-প্ল্যাটফর্ম হার্ডওয়্যারের জন্য Vulkan। এর মূলে রয়েছে আধুনিক কিছু কৌশল যেমন paged key-value (KV) cache, continuous batching এবং Qwen ও Gemma-র মতো মডেলগুলোর জন্য speculative decoding।

ডেভেলপাররা যা যা ফিচার সরাসরি পাবেন

  • GGUF মডেল সামঞ্জস্যতা – সাম্প্রতিক ওপেন-সোর্স LLM রিলিজগুলোতে ব্যবহৃত একই ফরম্যাট।
  • ক্রস-প্ল্যাটফর্ম অপারেশন – কোড পরিবর্তন ছাড়াই Windows, macOS এবং Linux-এ চলে।
  • OpenAI এবং Ollama-সামঞ্জস্যপূর্ণ HTTP API – বিদ্যমান ক্লায়েন্ট লাইব্রেরিগুলোর জন্য একটি সরাসরি বিকল্প।
  • মাল্টিমোডাল হ্যান্ডলিং – প্রম্পটের অংশ হিসেবে ছবি, ভিডিও, অডিও এবং PDF গ্রহণ করতে পারে।
  • টুল কলিং এবং স্ট্রাকচার্ড আউটপুট – চ্যাট-ভিত্তিক এজেন্টগুলোতে ব্যবহৃত সাধারণ ফাংশন-কলিং প্যাটার্ন সমর্থন করে।

llama.cpp-এর সাথে পারফরম্যান্স তুলনা

মেইনটেইনারের শেয়ার করা বেঞ্চমার্কগুলো মিশ্র ফলাফল দেখায়:

  • Prefill এবং time-to-first-token (TTFT) – TensorSharp প্রায়শই llama.cpp-কে ছাড়িয়ে যায় এবং প্রাথমিক রেসপন্সের জন্য কম ল্যাটেন্সি প্রদান করে।
  • Decode throughput – সাধারণত llama.cpp-এর কাছাকাছি বা কিছুটা ধীর।

এই সংখ্যাগুলো নির্দেশ করে যে, পিওর C# ইমপ্লিমেন্টেশন ল্যাটেন্সি-সংবেদনশীল ধাপগুলোতে গতি বিসর্জন দেয় না, পাশাপাশি র (raw) টোকেন-পার-সেকেন্ড আউটপুটেও প্রতিযোগিতামূলক থাকে।

মনে রাখার মতো সতর্কতা

  • বাস্তব জগতের পারফরম্যান্স মডেল আর্কিটেকচার, হার্ডওয়্যার কনফিগারেশন এবং মেমরি লেআউটের ওপর ভিত্তি করে পরিবর্তিত হয়; প্রোডাকশনে ব্যবহারের আগে ডেভেলপারদের নিজস্ব বেঞ্চমার্ক চালানো উচিত।

পরবর্তী পদক্ষেপ কী হতে পারে

টেলিগ্রামে প্রজেক্টটির ডিসকাশন চ্যানেলটি প্রাথমিক ব্যবহারকারীদের ফলাফল শেয়ার করার এবং নতুন ফিচারের অনুরোধ করার সুযোগ দেয়।

সারকথা: TensorSharp .NET কোম্পানিগুলোকে তাদের অ্যাপ্লিকেশনে সরাসরি LLM ইনফারেন্স যুক্ত করার একটি পথ দেখায়, যা আলাদা পাইথন স্ট্যাকের প্রয়োজনীয়তা দূর করে এবং llama.cpp-এর মতো ল্যাটেন্সি প্রদান করে। প্রোডাকশন টিমগুলোর উচিত তাদের টার্গেট হার্ডওয়্যারে পারফরম্যান্স যাচাই করে নেওয়া, তবে এই ইঞ্জিনটি .NET ইকোসিস্টেমের ভেতরে নেটিভ AI সার্ভিসের জন্য একটি স্পষ্ট পথ উন্মোচন করেছে।