TensorSharp, mesin inferensi pure-.NET untuk model bahasa GGUF, kini telah tersedia untuk publik, memungkinkan pengembang .NET menjalankan inferensi large-language-model (LLM) tanpa perlu menjalankan server Python. Proyek ini mengklaim performa yang sebanding dengan llama.cpp yang digunakan secara luas, sembari berjalan di Windows, macOS, dan Linux serta mendukung backend CPU, CUDA, MLX, Metal, dan Vulkan.
Mengapa .NET native itu penting
Sebagian besar runtime LLM ditulis dalam C/C++ atau mengandalkan wrapper Python yang mengekspos proses terpisah. Bagi tim yang layanannya sudah berjalan di .NET, lapisan tambahan tersebut menambah penggunaan container, komunikasi antar-proses (inter-process communication), dan memperluas permukaan serangan (attack surface). Menjaga inferensi tetap berada di dalam runtime yang sama memungkinkan pengembang untuk menyederhanakan pipeline CI/CD, mengurangi latensi dari lompatan jaringan (network hops), dan memangkas biaya pemeliharaan lingkungan Python.
Bagaimana TensorSharp dibangun
Penulis membangun mesin ini dari nol alih-alih menggunakan kembali llama.cpp. Backend CPU-nya 100% C#, sehingga Windows dan Linux dapat berjalan tanpa dependensi native. Dukungan GPU berasal dari API grafis yang sudah ada: CUDA untuk Nvidia, MLX untuk Apple silicon, Metal untuk GPU macOS, dan Vulkan untuk perangkat keras lintas platform. Teknik modern seperti paged key-value (KV) cache, continuous batching, dan speculative decoding untuk model seperti Qwen dan Gemma menjadi bagian inti dari mesin ini.
Fitur yang didapatkan pengembang secara langsung
- Kompatibilitas model GGUF – format yang sama dengan yang digunakan oleh rilis LLM open-source terbaru.
- Operasi lintas platform – berjalan di Windows, macOS, dan Linux tanpa perubahan kode.
- API HTTP yang kompatibel dengan OpenAI dan Ollama – pengganti langsung (drop-in replacement) untuk pustaka klien yang sudah ada.
- Penanganan multimodal – dapat memproses gambar, video, audio, dan PDF sebagai bagian dari prompt.
- Pemanggilan alat (tool calling) dan output terstruktur – mendukung pola pemanggilan fungsi (function-calling) yang umum pada agen berbasis chat.
Performa dibandingkan dengan llama.cpp
Benchmark yang dibagikan oleh pengelola menunjukkan hasil yang beragam:
- Prefill dan time-to-first-token (TTFT) – TensorSharp sering kali mengungguli llama.cpp, memberikan latensi yang lebih rendah untuk respons awal.
- Throughput decode – biasanya serupa atau sedikit lebih lambat daripada llama.cpp.
Angka-angka tersebut menunjukkan bahwa implementasi pure C# tidak mengorbankan kecepatan pada fase yang paling sensitif terhadap latensi, sembari tetap kompetitif dalam output token-per-detik mentah.
Catatan yang perlu diperhatikan
- Performa di dunia nyata bervariasi tergantung pada arsitektur model, konfigurasi perangkat keras, dan tata letak memori; pengembang harus menjalankan benchmark mereka sendiri sebelum menerapkannya di produksi.
Apa yang perlu diikuti selanjutnya
Saluran diskusi proyek di Telegram menawarkan tempat bagi para pengguna awal untuk berbagi hasil dan meminta fitur baru.
Kesimpulan: TensorSharp memberikan cara bagi pengembang .NET untuk menyematkan inferensi LLM secara langsung ke dalam aplikasi mereka, menghilangkan kebutuhan akan stack Python terpisah dan memberikan latensi yang sebanding dengan standar de-facto llama.cpp. Tim produksi harus memvalidasi performa pada perangkat keras target mereka, namun mesin ini membuka jalan yang jelas bagi layanan AI native di dalam ekosistem .NET.
