TensorSharp, um motor de inferência puramente .NET para modelos de linguagem GGUF, já está disponível publicamente, permitindo que desenvolvedores .NET executem inferência de modelos de linguagem de grande escala (LLM) sem a necessidade de iniciar um servidor Python. O projeto afirma ter um desempenho comparável ao amplamente utilizado llama.cpp, rodando em Windows, macOS e Linux e oferecendo suporte aos back-ends CPU, CUDA, MLX, Metal e Vulkan.

Por que o .NET nativo é importante

A maioria dos runtimes de LLM é escrita em C/C++ ou depende de wrappers em Python que expõem um processo separado. Para equipes cujos serviços já rodam em .NET, essa camada extra adiciona containers, comunicação entre processos e uma superfície de ataque maior. Manter a inferência dentro do mesmo runtime permite que os desenvolvedores simplifiquem os pipelines de CI/CD, reduzam a latência de saltos de rede e diminuam o custo de manutenção de um ambiente Python.

Como o TensorSharp é construído

O autor escreveu o motor do zero em vez de reutilizar o llama.cpp. O backend de CPU é 100% C#, portanto, Windows e Linux rodam sem dependências nativas. O suporte a GPU vem de APIs gráficas existentes: CUDA para Nvidia, MLX para Apple silicon, Metal para GPUs macOS e Vulkan para hardware multiplataforma. Truques modernos, como cache de chave-valor (KV) paginado, continuous batching e speculative decoding para modelos como Qwen e Gemma, estão integrados ao núcleo.

Recursos que os desenvolvedores recebem prontos para uso

  • Compatibilidade com modelos GGUF – o mesmo formato usado pelos lançamentos recentes de LLMs de código aberto.
  • Operação multiplataforma – roda em Windows, macOS e Linux sem alterações no código.
  • APIs HTTP compatíveis com OpenAI e Ollama – substituição direta para bibliotecas de cliente existentes.
  • Manipulação multimodal – pode processar imagens, vídeo, áudio e PDFs como parte de um prompt.
  • Chamada de ferramentas e saída estruturada – suporta padrões de chamada de função (function-calling) comuns em agentes baseados em chat.

Desempenho versus llama.cpp

Benchmarks compartilhados pelo mantenedor mostram resultados variados:

  • Prefill e time-to-first-token (TTFT) – o TensorSharp frequentemente supera o llama.cpp, entregando menor latência para a resposta inicial.
  • Throughput de decodificação – geralmente similar ou ligeiramente mais lento que o llama.cpp.

Os números sugerem que a implementação pura em C# não sacrifica a velocidade nas fases mais sensíveis à latência, mantendo-se competitiva na saída bruta de tokens por segundo.

Ressalvas a serem consideradas

  • O desempenho no mundo real varia de acordo com a arquitetura do modelo, configuração de hardware e layout de memória; os desenvolvedores devem realizar seus próprios benchmarks antes de adotar em produção.

O que observar a seguir

O canal de discussão do projeto no Telegram oferece um espaço para os primeiros usuários compartilharem resultados e solicitarem recursos.

Conclusão: O TensorSharp oferece às empresas que utilizam .NET uma maneira de incorporar a inferência de LLM diretamente em suas aplicações, eliminando a necessidade de uma stack Python separada e entregando uma latência comparável ao padrão de fato do llama.cpp. As equipes de produção devem validar o desempenho em seu hardware de destino, mas o motor abre um caminho claro para serviços de IA nativos dentro do ecossistema .NET.