GGUF లాంగ్వేజ్ మోడల్స్ కోసం ప్యూర్-.NET ఇన్ఫరెన్స్ ఇంజిన్ అయిన TensorSharp ఇప్పుడు పబ్లిక్గా అందుబాటులోకి వచ్చింది. దీనివల్ల .NET డెవలపర్లు పైథాన్ సర్వర్ను నడపాల్సిన అవసరం లేకుండానే లార్జ్-లాంగ్వేజ్-మోడల్ (LLM) ఇన్ఫరెన్స్ను రన్ చేయవచ్చు. ఈ ప్రాజెక్ట్ Windows, macOS మరియు Linux లలో రన్ అవుతూనే, CPU, CUDA, MLX, Metal మరియు Vulkan బ్యాక్-ఎండ్లను సపోర్ట్ చేస్తూ, విస్తృతంగా ఉపయోగించబడే llama.cpp కి సమానమైన పనితీరును అందిస్తుందని పేర్కొంది.
నేటివ్ .NET ఎందుకు ముఖ్యమైనది
చాలా LLM రన్టైమ్లు C/C++ లో వ్రాయబడ్డాయి లేదా విడిగా ఒక ప్రాసెస్ను ఎక్స్పోజ్ చేసే పైథాన్ రాపర్స్ (wrappers) పై ఆధారపడతాయి. తమ సర్వీసులు ఇప్పటికే .NET పై నడుస్తున్న టీమ్ల కోసం, ఆ అదనపు లేయర్ వల్ల కంటైనర్లు, ఇంటర్-ప్రాసెస్ కమ్యూనికేషన్ మరియు పెద్ద అటాక్ సర్ఫేస్ వంటి సమస్యలు వస్తాయి. ఇన్ఫరెన్స్ను అదే రన్టైమ్ లోపల ఉంచడం వల్ల డెవలపర్లు CI/CD పైప్లైన్లను సరళీకరించవచ్చు, నెట్వర్క్ హాప్స్ నుండి లేటెన్సీని తగ్గించవచ్చు మరియు పైథాన్ ఎన్విరాన్మెంట్ను నిర్వహించే ఖర్చును తగ్గించవచ్చు.
TensorSharp ఎలా నిర్మించబడింది
రచయిత llama.cpp ని తిరిగి ఉపయోగించకుండా, ఈ ఇంజిన్ను మొదటి నుండి (from scratch) వ్రాశారు. దీని CPU బ్యాకెండ్ 100% C# లో ఉంది, కాబట్టి Windows మరియు Linux లలో ఎటువంటి నేటివ్ డిపెండెన్సీలు లేకుండా రన్ అవుతుంది. GPU సపోర్ట్ ఇప్పటికే ఉన్న గ్రాఫిక్స్ APIల నుండి వస్తుంది: Nvidia కోసం CUDA, Apple సిలికాన్ కోసం MLX, macOS GPUల కోసం Metal, మరియు క్రాస్-ప్లాట్ఫామ్ హార్డ్వేర్ కోసం Vulkan. Qwen మరియు Gemma వంటి మోడళ్ల కోసం paged key-value (KV) cache, continuous batching మరియు speculative decoding వంటి ఆధునిక పద్ధతులు దీని కోర్లో ఉన్నాయి.
డెవలపర్లకు లభించే ఫీచర్లు
- GGUF మోడల్ అనుకూలత – ఇటీవలి ఓపెన్-సోర్స్ LLM విడుదలల్లో ఉపయోగించిన ఫార్మాట్.
- క్రాస్-ప్లాట్ఫామ్ ఆపరేషన్ – కోడ్ మార్పులు లేకుండా Windows, macOS మరియు Linux లలో రన్ అవుతుంది.
- OpenAI- మరియు Ollama-అనుకూల HTTP APIలు – ఇప్పటికే ఉన్న క్లయింట్ లైబ్రరీలకు ప్రత్యామ్నాయంగా నేరుగా ఉపయోగించవచ్చు.
- మల్టీమోడల్ హ్యాండ్లింగ్ – ప్రాంప్ట్లో భాగంగా ఇమేజ్లు, వీడియో, ఆడియో మరియు PDFలను తీసుకోగలదు.
- టూల్ కాలింగ్ మరియు స్ట్రక్చర్డ్ అవుట్పుట్ – చాట్-ఆధారిత ఏజెంట్లలో సాధారణంగా ఉండే ఫంక్షన్-కాలింగ్ ప్యాటర్న్లను సపోర్ట్ చేస్తుంది.
llama.cpp తో పోలిస్తే పనితీరు
మెయింటైనర్ షేర్ చేసిన బెంచ్మార్క్లు మిశ్రమ ఫలితాలను చూపుతున్నాయి:
- Prefill మరియు time-to-first-token (TTFT) – TensorSharp తరచుగా llama.cpp కంటే మెరుగ్గా పనిచేస్తుంది, ప్రారంభ ప్రతిస్పందన కోసం తక్కువ లేటెన్సీని అందిస్తుంది.
- Decode throughput – సాధారణంగా llama.cpp కి సమానంగా లేదా కొంచెం నెమ్మదిగా ఉంటుంది.
ఈ గణాంకాల ప్రకారం, ప్యూర్ C# ఇంప్లిమెంటేషన్ లేటెన్సీకి అత్యంత సున్నితమైన దశల్లో వేగాన్ని తగ్గించదు, అదే సమయంలో టోకెన్-పర్-సెకండ్ అవుట్పుట్లో కూడా పోటీగా ఉంటుంది.
గుర్తుంచుకోవలసిన అంశాలు
- వాస్తవ ప్రపంచ పనితీరు మోడల్ ఆర్కిటెక్చర్, హార్డ్వేర్ కాన్ఫిగరేషన్ మరియు మెమరీ లేఅవుట్పై ఆధారపడి మారుతుంది; డెవలపర్లు ప్రొడక్షన్లోకి వెళ్లే ముందు తమ స్వంత బెంచ్మార్క్లను రన్ చేయాలి.
తదుపరి ఏమి చూడాలి
టెలిగ్రామ్లోని ప్రాజెక్ట్ డిస్కషన్ ఛానెల్, ప్రారంభ వినియోగదారులు తమ ఫలితాలను పంచుకోవడానికి మరియు ఫీచర్లను కోరడానికి ఒక వేదికను అందిస్తుంది.
సారాంశం: TensorSharp .NET డెవలపర్లకు తమ అప్లికేషన్లలో నేరుగా LLM ఇన్ఫరెన్స్ను ఎంబెడ్ చేసుకునే మార్గాన్ని అందిస్తుంది, దీనివల్ల విడిగా పైథాన్ స్టాక్ అవసరం ఉండదు మరియు ప్రామాణికమైన llama.cpp బేస్లైన్తో సమానమైన లేటెన్సీని అందిస్తుంది. ప్రొడక్షన్ టీమ్లు తమ టార్గెట్ హార్డ్వేర్పై పనితీరును ధృవీకరించుకోవాలి, కానీ ఈ ఇంజిన్ .NET ఎకోసిస్టమ్లో నేటివ్ AI సర్వీసుల కోసం ఒక స్పష్టమైన మార్గాన్ని చూపుతోంది.
