Eine aktuelle Kostenanalyse zeigt, dass sich das Self-Hosting eines Large Language Models gegenüber kommerziellen APIs nur dann lohnt, wenn ein Unternehmen etwa 5 bis 10 Millionen Input-Token pro Monat verarbeitet. Für alle, die KI-Dienste budgetieren, entscheidet der Break-even-Punkt darüber, ob die Verlockung „kostenloser“ Open-Weight-Modelle zu echten Einsparungen führt.

Das API-Modell

API-Anbieter berechnen pro Token und kümmern sich um die gesamte Hardware, den Stromverbrauch und die Kühlung. Aktuelle öffentliche Tarife sind:

  • Claude Sonnet 5 – $2 pro Million Input-Token
  • GPT-5.6 – etwa $1 pro Million Input-Token
  • Meta Muse Spark – $1,25 pro Million Inbound-Token, $4,25 pro Million Outbound-Token

Das Modell basiert auf Pay-as-you-go. Wenn der Traffic auf Null sinkt, sinkt auch die Rechnung auf Null. Nutzer vermeiden zudem den Ärger mit GPU-Ausfällen, Firmware-Updates und Kapazitätsplanung.

Das Self-Hosting-Modell

Das Ausführen eines Open-Weight-Modells auf eigener Hardware bedeutet, dass man die Rechenkosten unabhängig von der Auslastung trägt. Eine einzelne NVIDIA H100 – eine gängige Wahl für LLM-Inferenz – kostet:

  • $2 – $3 pro Stunde bei generischen GPU-Cloud-Diensten
  • $7 – $12 pro Stunde auf großen Cloud-Plattformen (AWS, Azure)

Das entspricht etwa $1.800 – $2.000 pro Monat für den kontinuierlichen Betrieb einer H100. Der Hardwarepreis ist dabei nur der sichtbare Teil der Rechnung.

Wo die Zahlen aufeinandertreffen

Die Analyse ergibt, dass Self-Hosting günstiger als Premium-APIs wird, sobald das monatliche Input-Token-Volumen den Bereich von 5 bis 10 Millionen erreicht. Unter dieser Schwelle gewinnen die API-Tarife pro Token. Bei Volumina von 100 Millionen Token pro Monat oder mehr sinkt die Kostenkurve der reinen Hardware unter die der API, was Self-Hosting auf dem Papier attraktiv macht.

Versteckte Betriebskosten

Die GPU-Miete macht nur etwa 30 % der tatsächlichen Kosten für den Betrieb eines Modells in der Produktion aus. Der Rest setzt sich zusammen aus:

  • Netzwerk und Speicher – Hochdurchsatz-Verbindungen und schnelle Festplatten halten die Latenz niedrig.
  • Redundanz und Monitoring – Mehrere Instanzen, Health Checks und Alert-Pipelines erhöhen sowohl die Software- als auch die Hardwareausgaben.
  • Engineering-Talente – Um ein Modell zuverlässig online zu halten, werden in der Regel 1,5 bis 2 Vollzeit-Ingenieure benötigt. Bei marktüblichen Gehältern erhöht dies die jährlichen Ausgaben um $270.000 – $550.000.

Wenn diese Ebenen hinzukommen, lösen sich die scheinbaren Einsparungen durch die Hardware allein schnell in Luft auf.

Wer Self-Hosting in Betracht ziehen sollte

Self-Hosting ist nur unter bestimmten Bedingungen sinnvoll:

  • Konstant massives Volumen – das Unternehmen muss regelmäßig die Schwelle von 5 Millionen Token überschreiten, andernfalls bleibt der API-Preis pro Token niedriger.
  • Regulatorische oder datenschutzrechtliche Einschränkungen – einige Sektoren verbieten es, proprietäre oder personenbezogene Daten an Endpunkte von Drittanbietern zu senden.
  • Spezialisierte Anpassungen oder Latenzgarantien – wenn ein Modell auf internen Daten feinjustiert werden muss oder Antworten im Sub-Sekundenbereich liefern soll, kann der Besitz des gesamten Stacks gerechtfertigt sein.

Wenn keiner dieser Faktoren vorliegt, übersteigen die versteckten Personal- und Infrastrukturkosten oft die Hardware-Einsparungen.

Ein hybrider Leitfaden

Die meisten Teams, die eine Größenordnung erreichen, in der sich Self-Hosting lohnt, verfolgen dennoch einen gemischten Ansatz:

  1. Mit APIs beginnen – sie sind günstig, schnell zu integrieren und perfekt für Experimente oder Workloads mit geringem Volumen.
  2. Hochvolumige Datenströme migrieren – sobald die Token-Zahlen konsistent über den Break-even-Punkt steigen, werden diese Pipelines auf einen internen Cluster verlagert.
  3. Ein Sicherheitsnetz behalten – gelegentliche oder schwankende Anfragen werden weiterhin über die API abgewickelt, um eine Überprovisionierung von On-Premise-Ressourcen zu vermeiden.

Berechnen Sie die Token-Zahlen regelmäßig und berücksichtigen Sie dann den operativen Overhead, den reine Hardwarepreise ignorieren. Entscheidungen, die auf diesem Gesamtbild basieren, lassen sich weitaus weniger leicht von Mythen beeinflussen.

Fazit

Wenn Ihr KI-Produkt weniger als ein paar Millionen Token pro Monat verarbeitet, ist der einfachste und günstigste Weg nach wie vor der Aufruf einer API. Erst wenn anhaltender, hoher Bedarf, strikte Compliance oder spezielle Latenzanforderungen entstehen, wird Self-Hosting finanziell rentabel – und selbst dann müssen die versteckten Kosten für Personal und Infrastruktur berücksichtigt werden, bevor man den Sieg über die Cloud verkündet.