Mira Muratis Thinking Machines Lab ist mit Inkling offiziell in den Wettbewerb eingestiegen – ein Open-Weight-Modell, das entwickelt wurde, um die Dominanz zentralisierter „Einheitslösungen“ (one-size-fits-all) der KI-Giganten herauszufordern. Indem das Startup auf Anpassbarkeit statt auf reine, universelle Rechenleistung setzt, sieht es die Zukunft der Unternehmens-KI in spezialisierter, lokal optimierter Intelligenz.

Die Architektur von Inkling: Effizienz durch MoE

Inkling ist ein Mixture-of-Experts-System mit gewaltigen insgesamt 975 Milliarden Parametern. Dennoch werden für eine einzelne Aufgabe nur etwa 41 Milliarden Parameter aktiviert, was die Latenz und die Kosten senkt und gleichzeitig ein hohes Maß an logischem Denken (Reasoning) bewahrt. Das Modell wurde mit 45 Billionen Token aus Text, Bild, Audio und Video trainiert, was ihm native multimodale Fähigkeiten verleiht. Das Unternehmen behauptet, dass Inkling bei Coding-Benchmarks mit Nvidias Nemotron 3 Ultra mithält, dabei aber nur ein Drittel der Token verwendet – ein klares Zeichen für die Effizienz des Trainings.

Ein strategischer Schwenk hin zur Anpassung für Unternehmen

Im Gegensatz zu den Flaggschiff-Produkten von OpenAI, Anthropic oder Google, die hauptsächlich als universelle Chatbots fungieren, wird Inkling als Fundament für Organisationen vermarktet. Thinking Machines positioniert das Modell als Ausgangspunkt und fordert Unternehmen auf, es über die eigene „Tinker“-Plattform mit proprietären Daten feinabzustimmen.

Dieser Schritt adressiert die „Doppelzahlungsfalle“ der Branche. Microsoft-CEO Satya Nadella warnte davor, dass Unternehmen doppelt zahlen – einmal für ein Abonnement und ein zweites Mal, indem sie ihre einzigartige Geschäftslogik in ein Modell einspeisen, das letztlich den Trainingsdatensatz des Anbieters bereichert. Durch das Angebot eines Open-Weight-Modells ermöglicht Thinking Machines es Firmen, diese Intelligenz intern zu behalten.

Infrastruktur mit hohem Einsatz und rasante Entwicklung

Thinking Machines ist mit Hochgeschwindigkeit auf den Markt gegangen. Während OpenAI etwa fünf Jahre und Anthropic etwa drei Jahre benötigten, gibt Thinking Machines an, einen vergleichbaren Meilenstein in nur neun Monaten erreicht zu haben.

Um dieses Tempo zu halten, setzte das Unternehmen auf spezialisierte Hardware. Nach einer Partnerschaft mit Nvidia im März wurde Inkling vollständig auf Nvidias GB300 NVL72-Systemen trainiert. Das Unternehmen nutzte Destillationsverfahren – wobei Open-Weight-Modelle wie Kimi K2.5 von Moonshot AI für das frühe Post-Training eingesetzt wurden –, verspricht jedoch, zukünftiges Post-Training vollständig intern durchzuführen.

Die wichtigsten Erkenntnisse

  • Open-Weight-Vorteil: Entwickler können das 975-Milliarden-Parameter-MoE-Modell herunterladen und modifizieren, wodurch die Kontrolle nicht in geschlossenen Ökosystemen verbleibt.
  • Effizienz-orientiertes Design: Durch die Aktivierung von nur 41 Milliarden Parametern pro Aufgabe und die Reduzierung des Token-Verbrauchs kann das Modell erstklassiges Reasoning zu einem Bruchteil der Betriebskosten liefern.
  • Die Wette auf Anpassbarkeit: Thinking Machines bewegt sich weg von generischen Chatbots hin zu „Tinker“, einer Plattform, die Basismodelle in spezialisierte Assets für jede Organisation verwandelt.