Jenseits von Transformern: Die Startups, die die nächste Ära der LLMs neu definieren
Die Ära der Transformer steht vor einem fundamentalen Engpass, da die Rechenanforderungen großer Sprachmodelle (LLMs) einen kritischen Punkt erreichen. Während das Paper „Attention Is All You Need“ aus dem Jahr 2017 das Fundament für den aktuellen KI-Boom legte, arbeitet nun eine neue Generation von Startups daran, die Kernarchitektur zu ersetzen oder neu zu erfinden, um echte Effizienz zu erreichen.
Der Transformer-Engpass: Warum „Dense Attention“ scheitert
Seit fast einem Jahrzehnt ist der Transformer der Motor der KI-Industrie, angetrieben durch einen Mechanismus, der als „Dense Attention“ bekannt ist. Dieser Prozess vergleicht jedes Token in einem Textblock mittels massiver Multiplikationen mit jedem anderen Token. Obwohl er semantische Bedeutungen unglaublich präzise erfasst, skaliert die mathematische Komplexität schlecht.
Beispielsweise kann ein Dokument mit 10.000 Wörtern einen Transformer dazu zwingen, etwa 50 Millionen Multiplikationen durchzuführen. Dieses quadratische Wachstum der Rechenleistung führt zu zwei massiven Herausforderungen: explodierendem Energieverbrauch und begrenzten Kontextfenstern. Da OpenAI Berichten zufolge in diesem Jahr 50 Milliarden US-Dollar für Rechenleistung ausgeben wird und der Strombedarf von Rechenzentren bis 2030 voraussichtlich doppelt so hoch sein wird, stößt die Branche sowohl an Kosten- als auch an physikalische Grenzen.
Attention neu denken: Der Aufstieg von „Sparse Mechanisms“
Um die Effizienzkrise zu lösen, versuchen mehrere Startups, sich von „Dense Attention“ hin zu „Sparse Attention“ zu bewegen. Anstatt jede mögliche Wortpaarung zu berechnen, konzentriert sich Sparse Attention nur auf die relevantesten Verbindungen, was die Rechenlast erheblich reduziert.
Das in Miami ansässige Startup Subquadratic ist in diesem Bereich mit seinem SubQ-Modell führend. Im Gegensatz zu früheren Sparse-Mechanismen, die Schwierigkeiten hatten, die Genauigkeit beizubehalten, behauptet Subquadratic, dass seine Technologie bei spezialisierten Aufgaben wie Programmierung und Suche mit gängigen LLMs konkurrieren kann. Ihr Ansatz umfasst ein dynamisches System, das während der Verarbeitung (on the fly) identifiziert, welche Wörter für ein bestimmtes Textstück tatsächlich wichtig sind, anstatt Rechenzyklen für irrelevante Token zu verschwenden.
Power Retention: Der Weg zu rollierenden Zusammenfassungen
Ein anderer Ansatz besteht darin, sich gänzlich vom Attention-Mechanismus zu lösen. Das in San Francisco ansässige Unternehmen Manifest AI geht mit einer Technik namens „Power Retention“ voran. Während Sparse-Attention-Modelle wie SubQ immer noch versuchen, ein grobes Bild des gesamten Kontextfensters beizubehalten, funktioniert Power Retention dadurch, dass dem Modell eine rollierende Zusammenfassung seines Gedächtnisses bereitgestellt wird.
Wenn neue Informationen in das Kontextfenster gelangen, identifiziert das Modell weniger relevante Daten und verwirft diese, sodass die Rechenlast unabhängig von der Eingabegröße überschaubar bleibt. Manifest AI hat die Machbarkeit dieses Ansatzes bereits demonstriert, indem es:
- das Open-Source-Modell StarCoder mittels Power Retention in PowerCoder umgewandelt hat.
- Brumby veröffentlicht hat, ein Modell, das laut ihrer Aussage mit den populären Open-Source-Modellen Qwen von Alibaba konkurrieren kann.
Die Fähigkeit, bestehende Transformer-Modelle mit minimalem Nachtraining in Power-Retention-Modelle umzuwandeln, deutet darauf hin, dass der Übergang zu „LLMs+“ – der nächsten Modellgeneration – viel schneller als erwartet erfolgen könnte.
Wichtigste Erkenntnisse
- Das Transformer-Limit: Die quadratische Skalierung von Dense Attention macht den Betrieb aktueller LLMs unglaublich teuer und erschwert die Skalierung für massive Datensätze oder komplexes, langwieriges Denken (long-form reasoning).
- Sparse vs. Retention: Startups bekämpfen das Problem von zwei Seiten: Subquadratic optimiert die Attention durch Sparse-Berechnungen (SubQ), während Manifest AI sie durch rollierende Zusammenfassungen (Power Retention) ersetzt.
- Wirtschaftliche Notwendigkeit: Da die KI-Rechenkosten in die Zehnerbillarden-Dollar-Region vorstoßen, wird der Gewinner der nächsten KI-Ära wahrscheinlich derjenige sein, der die Effizienz löst, anstatt nur auf reine Skalierung zu setzen.
