Google hat am Dienstag Gemini 3.5 Transcribe veröffentlicht. Das Speech-to-Text-Modell entfernt Füllwörter, berücksichtigt benutzerdefinierte Vokabulare und kennzeichnet bis zu drei Sprecher in einer einzigen Aufnahme. Indem der Dienst rohes Audio in polierten, strukturierten Text ohne menschliche Bearbeitung umwandelt, reduziert er die Zeit, die Entwickler mit der Bereinigung von Transkripten für Besprechungsnotizen, juristische Dokumente und mehr verbringen.
Warum Google jetzt handelt
Googles Audio-Verarbeitungs-Stack entwickelt sich seit Jahren weiter, aber das frühere Angebot, Chirp 3, stolperte noch über Pausen, Fachbegriffe und Sprecherwechsel. Remote-Arbeit und Podcasting haben den Transkriptionsmarkt aufgebläht, doch viele Unternehmen verlassen sich immer noch auf manuelle Nachbearbeitung oder teure Nischenanbieter. Gemini 3.5 Transcribe adressiert diesen Reibungspunkt: ein Modell, das Sprache nicht nur erkennt, sondern sie auch direkt bearbeitet.
Was das neue Modell tatsächlich tut
- Automatische Entfernung von Füllwörtern – „Ähm“, „äh“ und ähnliche Unflüssigkeiten verschwinden während der Erstellung des Transkripts, was zu einem saubereren Ergebnis führt.
- Benutzerdefinierte Vokabulare – Nutzer können eine Liste fachspezifischer Wörter hochladen, um zu verhindern, dass das Modell diese in generische Begriffe „korrigiert“. Dies ist wichtig für Bereiche, die reich an Akronymen, Produktnamen oder Fremdschreibweisen sind.
- Sprecherzuordnung – Das System identifiziert bis zu drei verschiedene Stimmen, weist jeder Äußerung ein Sprecherlabel zu und fügt einen Zeitstempel auf Wortebene hinzu. Juristische Teams, medizinische Schreibkräfte und Journalisten können zeitgestempelte Aufzeichnungen direkt aus der Quelldatei erstellen.
- Mehrsprachige Reichweite – Google verspricht eine verbesserte Genauigkeit in mehr als 85 Sprachen, was eine Steigerung gegenüber dem begrenzteren Umfang seines Vorgängers darstellt.
All diese Funktionen sind über eine entwicklerorientierte API verfügbar. Apps fordern ein Transkript an und erhalten eine JSON-Payload, die bereits den bereinigten Text, Sprecher-Tags und Zeitstempel enthält.
Der umfassendere Gemini-Audio-Rollout
Gemini 3.5 Transcribe gehört zu einer größeren Familie von Audiomodellen:
- Gemini 3.5 Live – Optimiert für Echtzeit-Interaktionen, kann es Unterbrechungen mitten im Satz besser handhaben als frühere Live-Modelle.
- Gemini 3.5 Live Experimental – Eine Variante mit höherer Argumentationsfähigkeit, die ihr eigenes schrittweises Denken während der Lösung komplexer Aufgaben kommentiert.
Beide Live-Modelle sind derzeit auf Englisch in der macOS Gemini-App und über die Rambler-Diktierfunktion auf Android in einigen Regionen verfügbar.
Wer davon profitiert
Entwickler können eine „Clean-as-you-speak“-Pipeline in Kollaborations-Tools, Content-Creation-Plattformen und sprachgesteuerte Assistenten integrieren. Unternehmen können direkt veröffentlichungsreife Transkripte erstellen und so die Abhängigkeit von Drittanbietern verringern, die pro Minute abrechnen und strenge Datenschutzbestimmungen auferlegen. Content-Ersteller können polierte Untertitel ohne separaten Bearbeitungsschritt veröffentlichen, was die Produktionszyklen von Videos und Podcasts beschleunigt.
Wer unter Druck geraten könnte
Spezialisierte Transkriptionsanbieter, die Premiumpreise für Sprecherdiarisierung und den Umgang mit Fachjargon verlangen, könnten einen Rückgang der Nachfrage erleben, insbesondere bei kostenbewussten Startups. Das Limit von drei Sprechern des Modells könnte zudem größere Organisationen dazu bewegen, auf dedizierte Lösungen umzusteigen, die mehr Teilnehmer in einem einzigen Anruf unterstützen.
Grenzen und offene Fragen
- Anzahl der Sprecher – Pro Datei können nur drei Sprecher unterschieden werden; Meetings mit größeren Runden werden weiterhin externe Tools benötigen.
- Sprach-Rollout – Die mehrsprachige Unterstützung wurde angekündigt, aber die Live-Modelle sind weiterhin auf Englisch beschränkt, sodass nicht-englischsprachige Nutzer auf die volle Funktionalität warten müssen.
- Datenschutz – Wie bei jedem cloudbasierten Sprachdienst müssen Unternehmen den Komfort der Google-Infrastruktur gegen die Notwendigkeit abwägen, sensible Audiodaten nicht auf externen Servern zu speichern. Die Bedingungen von Google erlauben eine On-Premise-Bereitstellung für bestimmte Kunden, aber diese Option ist noch nicht öffentlich zugänglich.
Worauf man als Nächstes achten sollte
Google hat zukünftige Updates angedeutet, die die Obergrenze für Sprecher anheben und die Abdeckung der Live-Modelle auf weitere Sprachen ausweiten werden. Auch die Beobachtung der Preisstufen der API wird entscheidend sein; hohe Kosten pro Minute könnten die Produktivitätsgewinne für Nutzer mit hohem Volumen zunichtemachen. Schließlich wird die Adoptionskurve unter Entwicklern zeigen, ob der Komfort der automatischen Entfernung von Füllwörtern etwaige Restfehler in Nischenvokabularen überwiegt.
Fazit: Gemini 3.5 Transcribe verwandelt die mühsame Aufgabe, Audioaufnahmen aufzubereiten, in einen einzigen API-Aufruf und bietet Entwicklern so ein fertiges Werkzeug für sauberen, mit Sprecherzuordnung versehenen Text. Der Erfolg hängt davon ab, wie schnell Google die Sprachunterstützung erweitert, das Limit für die Anzahl der Sprecher erhöht und die Datenschutzbedenken von Unternehmen ausräumt.
