TensorSharp, જે GGUF લેંગ્વેજ મોડલ્સ માટેનું પ્યોર-.NET ઇન્ફરન્સ એન્જિન છે, તે હવે સાર્વજનિક રીતે ઉપલબ્ધ છે, જે .NET ડેવલપર્સને પાયથોન સર્વર ચલાવ્યા વિના લાર્જ-લેંગ્વેજ-મોડલ (LLM) ઇન્ફરન્સ ચલાવવાની સુવિધા આપે છે. આ પ્રોજેક્ટ Windows, macOS અને Linux પર ચાલતી વખતે અને CPU, CUDA, MLX, Metal અને Vulkan બેક-એન્ડ્સને સપોર્ટ કરતી વખતે વ્યાપકપણે ઉપયોગમાં લેવાતા llama.cpp ની સમકક્ષ કામગીરીનો દાવો કરે છે.
નેટિવ .NET શા માટે મહત્વનું છે
મોટાભાગના LLM રનટાઇમ્સ C/C++ માં લખાયેલા હોય છે અથવા Python વ્રેપર્સ પર આધારિત હોય છે જે અલગ પ્રોસેસને એક્સપોઝ કરે છે. જે ટીમોની સેવાઓ પહેલેથી જ .NET પર ચાલે છે, તેમના માટે તે વધારાનું લેયર કન્ટેનર્સ, ઇન્ટર-પ્રોસેસ કોમ્યુનિકેશન અને મોટું એટેક સરફેસ (attack surface) ઉમેરે છે. ઇન્ફરન્સને સમાન રનટાઇમની અંદર રાખવાથી ડેવલપર્સને CI/CD પાઇપલાઇન્સને સરળ બનાવવામાં, નેટવર્ક હોપ્સમાંથી લેટન્સી ઘટાડવામાં અને Python એન્વાયરમેન્ટ જાળવવાનો ખર્ચ ઘટાડવામાં મદદ મળે છે.
TensorSharp કેવી રીતે બનાવવામાં આવ્યું છે
લેખકે llama.cpp નો ફરીથી ઉપયોગ કરવાને બદલે એન્જિનને શૂન્યથી (from scratch) લખ્યું છે. CPU બેકએન્ડ 100% C# છે, તેથી Windows અને Linux કોઈપણ નેટિવ ડિપેન્ડન્સી વગર ચાલે છે. GPU સપોર્ટ હાલના ગ્રાફિક્સ APIs માંથી આવે છે: Nvidia માટે CUDA, Apple silicon માટે MLX, macOS GPUs માટે Metal, અને ક્રોસ-પ્લેટફોર્મ હાર્ડવેર માટે Vulkan. Qwen અને Gemma જેવા મોડલ્સ માટે paged key-value (KV) cache, continuous batching અને speculative decoding જેવી આધુનિક પદ્ધતિઓ તેના કોરમાં રહેલી છે.
ડેવલપર્સને મળતી ઇન-બિલ્ટ સુવિધાઓ
- GGUF મોડલ સુસંગતતા – તાજેતરના ઓપન-સોર્સ LLM રિલીઝ દ્વારા ઉપયોગમાં લેવાતું સમાન ફોર્મેટ.
- ક્રોસ-પ્લેટફોર્મ ઓપરેશન – કોડમાં ફેરફાર કર્યા વિના Windows, macOS અને Linux પર ચાલે છે.
- OpenAI અને Ollama-સુસંગત HTTP APIs – હાલની ક્લાયન્ટ લાઇબ્રેરીઓ માટે ડ્રોપ-ઇન રિપ્લેસમેન્ટ.
- મલ્ટિમોડલ હેન્ડલિંગ – પ્રોમ્પ્ટના ભાગ તરીકે ઇમેજ, વિડિયો, ઓડિયો અને PDF ને ઇનપુટ તરીકે લઈ શકે છે.
- ટૂલ કોલિંગ અને સ્ટ્રક્ચર્ડ આઉટપુટ – ચેટ-આધારિત એજન્ટોમાં સામાન્ય રીતે જોવા મળતા ફંક્શન-કોલિંગ પેટર્નને સપોર્ટ કરે છે.
llama.cpp વિરુદ્ધ કામગીરી
મેન્ટેનર દ્વારા શેર કરવામાં આવેલા બેન્ચમાર્ક મિશ્ર પરિણામો દર્શાવે છે:
- Prefill અને time-to-first-token (TTFT) – TensorSharp ઘણીવાર llama.cpp ને પાછળ છોડી દે છે, જે પ્રારંભિક પ્રતિસાદ માટે ઓછી લેટન્સી આપે છે.
- Decode throughput – સામાન્ય રીતે llama.cpp જેવું જ અથવા તેના કરતા થોડું ધીમું હોય છે.
આ આંકડા સૂચવે છે કે પ્યોર C# અમલીકરણ સૌથી વધુ લેટન્સી-સેન્સિટિવ તબક્કાઓમાં ઝડપનો ભોગ લેતું નથી, જ્યારે રો (raw) ટોકન-પર-સેકન્ડ આઉટપુટમાં સ્પર્ધાત્મક રહે છે.
ધ્યાનમાં રાખવા જેવી સાવચેતીઓ
- વાસ્તવિક દુનિયાની કામગીરી મોડલ આર્કિટેક્ચર, હાર્ડવેર કોન્ફિગરેશન અને મેમરી લેઆઉટ સાથે બદલાય છે; ડેવલપર્સે પ્રોડક્શનમાં ઉપયોગ કરતા પહેલા પોતાના બેન્ચમાર્ક ચલાવવા જોઈએ.
આગળ શું જોવું
ટેલિગ્રામ પર પ્રોજેક્ટનું ડિસ્કશન ચેનલ પ્રારંભિક એડોપ્ટર્સ (early adopters) માટે પરિણામો શેર કરવા અને સુવિધાઓ વિનંતી કરવા માટેનું સ્થાન પૂરું પાડે છે.
મુખ્ય વાત: TensorSharp .NET કંપનીઓને તેમના એપ્લિકેશન્સમાં સીધું જ LLM ઇન્ફરન્સ એમ્બેડ કરવાની રીત આપે છે, જેનાથી અલગ પાયથોન સ્ટેકની જરૂરિયાત દૂર થાય છે અને llama.cpp બેઝલાઇન જેવી જ લેટન્સી મળે છે. પ્રોડક્શન ટીમોએ તેમના ટાર્ગેટ હાર્ડવેર પર કામગીરીની ચકાસણી કરવી જોઈએ, પરંતુ આ એન્જિન .NET ઇકોસિસ્ટમની અંદર નેટિવ AI સેવાઓ માટે સ્પષ્ટ માર્ગ ખોલે છે.
