Más allá de los Transformers: Las startups que están redefiniendo la próxima era de los LLM

La era del transformer se enfrenta a un cuello de botella fundamental a medida que las demandas computacionales de los modelos de lenguaje de gran tamaño (LLM) alcanzan un punto crítico. Si bien el artículo "Attention Is All You Need" de 2017 sentó las bases del actual auge de la IA, una nueva generación de startups compite ahora por reemplazar o reinventar la arquitectura central para lograr una eficiencia real.

El cuello de botella del Transformer: Por qué la atención densa está fallando

Durante casi una década, el transformer ha sido el motor de la industria de la IA, impulsado por un mecanismo conocido como "atención densa" (dense attention). Este proceso compara cada token en un bloque de texto con todos los demás mediante multiplicaciones a escala masiva. Aunque es increíblemente preciso para capturar el significado semántico, su complejidad matemática escala de forma deficiente.

Por ejemplo, un documento de 10.000 palabras puede requerir que un transformer realice aproximadamente 50 millones de multiplicaciones. Este crecimiento cuadrático en la computación conlleva dos desafíos masivos: un consumo de energía disparado y ventanas de contexto limitadas. Con informes que indican que OpenAI gastará 50.000 millones de dólares en computación este año y que se espera que la demanda de electricidad de los centros de datos se duplique para 2030, la industria está chocando contra un muro tanto de costes como de física.

Replanteando la atención: El auge de los mecanismos dispersos

Para resolver la crisis de eficiencia, varias startups están intentando alejarse de la atención densa para pasar a la "atención dispersa" (sparse attention). En lugar de calcular cada posible combinación de palabras, la atención dispersa se centra únicamente en las conexiones más relevantes, reduciendo significativamente la carga computacional.

La startup con sede en Miami, Subquadratic, es líder en este espacio con su modelo SubQ. A diferencia de los mecanismos dispersos anteriores que tenían dificultades para mantener la precisión, Subquadratic afirma que su tecnología rivaliza con los LLM convencionales en tareas especializadas como la programación y la búsqueda. Su enfoque consiste en un sistema dinámico que identifica sobre la marcha qué palabras son realmente importantes para un texto determinado, en lugar de desperdiciar ciclos en tokens irrelevantes.

Retención de potencia: Hacia los resúmenes continuos

Otro enfoque consiste en alejarse por completo del mecanismo de atención. Manifest AI, con sede en San Francisco, es pionera en una técnica llamada "power retention" (retención de potencia). Mientras que los modelos de atención dispersa como SubQ todavía intentan mantener una imagen aproximada de toda la ventana de contexto, la retención de potencia funciona proporcionando al modelo un resumen continuo (rolling summary) de su memoria.

A medida que la nueva información entra en la ventana de contexto, el modelo identifica y descarta los datos menos relevantes, asegurando que la carga computacional siga siendo manejable independientemente del tamaño de la entrada. Manifest AI ya ha demostrado la viabilidad de este enfoque mediante:

  • La conversión del modelo de código abierto StarCoder en PowerCoder mediante la retención de potencia.
  • El lanzamiento de Brumby, un modelo que, según afirman, rivaliza con los populares modelos de código abierto Qwen de Alibaba.

La capacidad de adaptar los modelos transformer existentes a modelos de retención de potencia con un reentrenamiento mínimo sugiere que la transición hacia los "LLM+" —la próxima generación de modelos— podría ocurrir mucho más rápido de lo previsto.

Conclusiones clave

  • El límite del Transformer: El escalado cuadrático de la atención densa hace que los LLM actuales sean increíblemente caros de ejecutar y difíciles de escalar para conjuntos de datos masivos o razonamientos de larga duración.
  • Dispersión frente a retención: Las startups están abordando el problema desde dos frentes: Subquadratic está optimizando la atención mediante cálculos dispersos (SubQ), mientras que Manifest AI la está sustituyendo por resúmenes continuos (Power Retention).
  • Imperativo económico: A medida que los costes de computación de la IA alcanzan decenas de miles de millones de dólares, el ganador de la próxima era de la IA será probablemente aquel que resuelva la eficiencia en lugar de centrarse solo en la escala bruta.