GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Nemotron 3.5 Lightning chega à AWS, reduzindo drasticamente os custos de hardware de LLM para empresas

Desenvolvedores agora podem implementar o Nemotron 3.5 Lightning diretamente pelo console SageMaker JumpStart com apenas um clique, evitando a necessidade de clusters de GPU separados, instalações de drivers ou contêineres personalizados. O preço é baseado em tokens e varia por região, portanto, as equipes devem validar a latência e a precisão antes de entrar em produção.

AI · 2 min de leitura

180M-Parameter LLM Runs on a $10 ESP32-P4 Microcontroller

The p-for-llm project packs a 180.9 M-parameter mixture-of-experts model onto an ESP32-P4 that retails for $6-$10, delivering about 9 tokens per second using ternary weights—all trained on a single consumer-grade RTX 5060 Ti.

AI · 2 min de leitura

Google reforça o Chrome com ex-CEO da Relay para impulsionar agentes de IA no navegador

A Relay interromperá o serviço para usuários gratuitos em 15 de agosto e para clientes pagantes em 14 de setembro, encerrando seu serviço de automação por IA. Enquanto isso, Jacob Bank, que anteriormente liderou os produtos Gmail, Agenda e Chat, é agora o VP de produto e relações com desenvolvedores do Chrome, liderando a integração de agentes baseados no Gemini.

AI · 5 min de leitura

Kog Claims 30x Faster LLM Decoding on Existing Nvidia H200 GPUs

Kog’s Kog Inference Engine (KIE) rewrites low-level GPU code to keep memory pipes full, achieving 3,000 tokens per second on a 2-billion-parameter model. Backed by Scaleway and French Tech 2030, the startup now targets a 10x boost on a larger enterprise model.

AI · 5 min de leitura