Além dos Transformers: As Startups que estão Redefinindo a Próxima Era dos LLMs

A era do transformer está enfrentando um gargalo fundamental à medida que as demandas computacionais dos grandes modelos de linguagem (LLMs) atingem um ponto de ruptura. Embora o artigo "Attention Is All You Need" de 2017 tenha estabelecido as bases para o atual boom da IA, uma nova geração de startups está agora correndo para substituir ou reinventar a arquitetura central para alcançar uma eficiência real.

O Gargalo do Transformer: Por que a Atenção Densa está Falhando

Por quase uma década, o transformer tem sido o motor da indústria de IA, impulsionado por um mecanismo conhecido como "dense attention" (atenção densa). Esse processo compara cada token em um bloco de texto com todos os outros tokens por meio de multiplicações em escala massiva. Embora seja incrivelmente preciso ao capturar o significado semântico, a complexidade matemática escala de forma ineficiente.

Por exemplo, um documento de 10.000 palavras pode exigir que um transformer realize aproximadamente 50 milhões de multiplicações. Esse crescimento quadrático na computação leva a dois desafios massivos: o consumo de energia disparando e janelas de contexto limitadas. Com a OpenAI supostamente planejando gastar US$ 50 bilhões em computação este ano e a expectativa de que a demanda de eletricidade dos data centers dobre até 2030, a indústria está atingindo um muro tanto de custo quanto de física.

Repensando a Atenção: A Ascensão dos Mecanismos Esparsos

Para resolver a crise de eficiência, várias startups estão tentando se afastar da atenção densa em direção à "sparse attention" (atenção esparsa). Em vez de calcular todos os pares de palavras possíveis, a atenção esparsa foca apenas nas conexões mais relevantes, reduzindo significativamente a carga computacional.

A startup Subquadratic, sediada em Miami, é líder neste espaço com seu modelo SubQ. Ao contrário de mecanismos esparsos anteriores que tinham dificuldade em manter a precisão, a Subquadratic afirma que sua tecnologia rivaliza com os LLMs convencionais em tarefas especializadas, como codificação e busca. A abordagem deles envolve um sistema dinâmico que identifica, em tempo real, quais palavras realmente importam para um determinado trecho de texto, em vez de desperdiçar ciclos com tokens irrelevantes.

Power Retention: Movendo-se em Direção a Resumos Contínuos

Outra abordagem envolve afastar-se inteiramente do mecanismo de atenção. A Manifest AI, sediada em San Francisco, está sendo pioneira em uma técnica chamada "power retention". Enquanto modelos de atenção esparsa como o SubQ ainda tentam manter uma visão geral de toda a janela de contexto, o power retention funciona fornecendo ao modelo um resumo contínuo (rolling summary) de sua memória.

À medida que novas informações entram na janela de contexto, o modelo identifica e descarta dados menos relevantes, garantindo que a carga computacional permaneça gerenciável, independentemente do tamanho da entrada. A Manifest AI já demonstrou a viabilidade dessa abordagem ao:

  • Converter o modelo de código aberto StarCoder no PowerCoder usando power retention.
  • Lançar o Brumby, um modelo que eles afirmam rivalizar com os populares modelos de código aberto Qwen da Alibaba.

A capacidade de adaptar modelos transformer existentes em modelos de power retention com o mínimo de retreinamento sugere que a transição para "LLMs+" — a próxima geração de modelos — pode acontecer muito mais rápido do que o previsto.

Principais Conclusões

  • O Limite do Transformer: O escalonamento quadrático da atenção densa torna os LLMs atuais incrivelmente caros para operar e difíceis de escalar para conjuntos de dados massivos ou raciocínio de longo formato.
  • Esparsa vs. Retenção: As startups estão atacando o problema de dois lados: a Subquadratic está otimizando a atenção por meio de cálculos esparsos (SubQ), enquanto a Manifest AI a está substituindo por resumos contínuos (Power Retention).
  • Imperativo Econômico: À medida que os custos de computação de IA atingem dezenas de bilhões de dólares, o vencedor da próxima era da IA provavelmente será aquele que resolver a questão da eficiência, em vez de apenas a escala bruta.