Sprachassistenten stoßen schon lange an eine frustrierende Grenze. Man konnte sie nach dem Wetter fragen, einen Timer stellen oder eine Playlist abspielen. Sobald sich das Gespräch auf etwas Komplexes zubewegte – Code debuggen, einen Geschäftsabschluss strukturieren, eine Produktstrategie auf Herz und Nieren prüfen – brach die Interaktion zusammen. Der Assistent verstand einen vielleicht richtig, aber es fehlte ihm an der nötigen Tiefe im logischen Denken, um das Problem gemeinsam mit einem durchzuarbeiten.
Anthropic versucht, das zu ändern. Das Unternehmen hat den Sprachmodus in Claude von seinem Einsteigermodell Haiku auf seine leistungsfähigsten Systeme, Opus und Sonnet, ausgeweitet. Dieser Schritt signalisiert etwas Interessanteres als ein bloßes Feature-Rollout. Anthropic setzt darauf, dass ernsthafte Arbeit durch gesprochene Konversation möglich ist, nicht nur über die Tastatur.
Warum Sprache Denkvermögen braucht
Zuvor lief der Sprachmodus von Claude ausschließlich auf Haiku. Dieses Modell priorisiert Geschwindigkeit und geringe Latenz. Für schnelle Fragen – „Was ist die Hauptstadt von Estland?“ oder „Fasse diese E-Mail zusammen?“ – war dieser Kompromiss sinnvoll. Haiku liefert Antworten blitzschnell. Doch Anthropic bemerkte, dass die Nutzer das Feature intensiver nutzten, als Haiku eigentlich dafür ausgelegt war. Die Leute versuchten, Sprache für substanzielle Arbeit einzusetzen, und das Modell stieß oft an seine Grenzen, wenn es um die tiefgreifende Argumentation ging, die solche Aufgaben erfordern.
Die Einbindung von Opus und Sonnet verändert die Dynamik des Gesprächs grundlegend. Diese Modelle sind die Arbeitspferde von Anthropic für schwierige kognitive Aufgaben. Opus, das Flaggschiff, bewältigt komplexe Analysen, ausgedehnte logische Schlussfolgerungsketten und kreative Synthesen. Sonnet liegt in der Mitte und bietet eine starke Argumentationsfähigkeit bei größerer Geschwindigkeit als Opus. Durch die zusätzliche Sprachschicht können Sie nun eine unübersichtliche technische Architektur oder ein nuanciertes Finanzmodell durchsprechen und erwarten, dass die KI der Logik folgt, Inkonsistenzen erkennt und mit relevanten Gegenfragen nachhakt.
Lautes Denken
Der Unterschied ist qualitativ. Mit der Haiku-Stimme fühlte sich die Interaktion transaktional an. Man fragte, die KI antwortete. Mit Opus und Sonnet wird die Interaktion kollaborativ.
Stellen Sie sich vor, Sie sind ein Produktmanager auf dem Heimweg. Sie diktieren eine halb ausgereifte Idee für einen neuen Onboarding-Prozess. Anstatt eine generische Antwort wie „Das ist interessant“ zu erhalten, beginnt Claude Sonnet nachzubohren. Es fragt, ob Sie Grenzfälle für Unternehmenskunden berücksichtigt haben. Es zieht Parallelen zu Onboarding-Mustern, die es aus anderen Kontexten kennt. Wenn Sie Ihre Einfahrt erreichen, haben Sie die Idee bereits aus drei Blickwinkeln geprüft, die Sie zuvor nicht in Betracht gezogen hatten.
Oder stellen Sie sich eine Ingenieurin vor, die einen Ausfall eines verteilten Systems behebt, während sie auf einem zweiten Bildschirm Protokolldateien (Logs) ausliest. Im Gespräch mit Claude Opus kann sie die Symptome in einfacher Sprache beschreiben, Fehlermeldungen laut vorlesen und Hypothesen durchsprechen, ohne zum Tippen anhalten zu müssen. Das Modell verfolgt den roten Faden über mehrere Gesprächsrunden hinweg, erinnert sich daran, welche Ansätze bereits ausgeschlossen wurden, und schlägt Konfigurationsänderungen basierend auf der sich entwickelnden Diagnose vor. Das ist keine Transkription mit angeschlossener Suchmaschine. Es ist logisches Denken in Echtzeit, ermöglicht durch Sprache.
Vom Reden zum Handeln
Die vielleicht bedeutendste Veränderung ist, dass diese fortschrittlichen Modelle handeln können, anstatt nur zu chatten. Anthropic beschreibt den aktualisierten Sprachmodus als eine „agentische Schnittstelle“ (agentic interface). Da Opus und Sonnet über die Fähigkeit verfügen, Absichten präzise zu interpretieren, können sie ein gesprochenes Gespräch in konkrete Ergebnisse umwandeln.
Das Beispiel, das Anthropic liefert, ist simpel, aber aussagekräftig. Ein Nutzer bespricht eine Geschäftsidee per Sprache und weist Claude dann an, dieses ausschweifende Gespräch in einen strukturierten Einseiter-Pitch zu verwandeln. Das Modell analysiert den unstrukturierten Dialog, identifiziert das Kernwertversprechen, die Zielgruppe sowie die finanziellen Annahmen und erstellt ein formatiertes Dokument. Kein Abtippen. Kein Kopieren von Chat-Protokollen in eine separate Vorlage.
Diese agentische Ebene erstreckt sich auch auf Produktivitätswerkzeuge. Anthropic verbindet das Spracherlebnis mit Gmail, Slack und Canva. Das bedeutet, Sie könnten Claude eine Projektbeschreibung diktieren, ihn bitten, die Präsentation in Canva zu erstellen, eine Zusammenfassung in den Slack-Kanal Ihres Teams zu posten und die Follow-up-E-Mail in Gmail zu entwerfen – alles in einer einzigen Sprachsitzung. Das Modell wird zum Koordinator, der gesprochene Absichten in Aktionen über verschiedene Anwendungen hinweg übersetzt.
Den Fokus behalten beim Themenwechsel
Anthropic hat das Erlebnis zudem so gestaltet, dass Barrieren zwischen verschiedenen Interaktionsmodi abgebaut werden. Nutzer können nun innerhalb desselben Gesprächs zwischen Text und Sprache wechseln, ohne den Kontext zu verlieren. Man beginnt vielleicht, am Schreibtisch eine technische Anfrage zu tippen, wechselt zur Sprachsteuerung, während man zu einem Meeting geht, und kehrt dann zum Text zurück, um ein Code-Snippet einzufügen.
Das System ermöglicht zudem den Wechsel zwischen verschiedenen Modellstufen mitten im Gespräch. Wenn Sie eine lockere Brainstorming-Session mit Haiku beginnen – und dabei von dessen schnellen Antworten profitieren – können Sie das Gespräch auf Opus hochstufen, sobald die Diskussion in Richtung einer präzisen technischen Umsetzung geht. Der Kontext wird übernommen. Die KI erinnert sich daran, was Sie vor drei Interaktionen gesagt haben, unabhängig davon, ob Sie es getippt oder gesprochen haben oder ob Sie mit dem schnellen oder dem tiefgründigen Modell kommuniziert haben.
Diese Flexibilität ist wichtig, da echte Arbeit selten linear verläuft. Manche Probleme erfordern Geschwindigkeit, andere Tiefe. Eine einzige Benutzeroberfläche zu schaffen, in der Nutzer zwischen diesen „Gängen“ wechseln können, reduziert den kognitiven Aufwand. Es verhindert die Reibungsverluste durch das Öffnen neuer Tabs, das Kopieren von Prompts oder das erneute Erklären des Kontexts.
Die Sprachen der Welt sprechen
Die Erweiterung beschränkt sich nicht nur auf englischsprachige Nutzer. Anthropic hat die englischsprachige Beta-Phase beendet und die offizielle Unterstützung für neun weitere Sprachen hinzugefügt:
- Europäische Sprachen: Französisch, Deutsch, Italienisch, Spanisch und Portugiesisch.
- Asiatische Sprachen: Hindi, Indonesisch, Japanisch und Koreanisch.
Dies ist nicht bloß ein Häkchen bei der Lokalisierung. Hochintelligente Sprachassistenz auf Koreanisch oder Hindi verändert grundlegend, wer diese Werkzeuge für die professionelle Arbeit nutzen kann. Ein Startup-Gründer in Jakarta kann ein Update für Investoren per Sprache auf Indonesisch entwerfen. Ein Produktionsanalyst in Turin kann Lieferkettendaten auf Italienisch abfragen. Die kognitive Leistungsfähigkeit von Opus wird für jeden zugänglich, der in seiner Muttersprache natürlicher denkt als auf Englisch.
Im breiteren Markt für KI-Assistenten verschärft dieser mehrsprachige Rollout – gepaart mit den Denkfähigkeiten der Top-Modelle – Claudes Wettbewerbsvorteil. Die meisten Sprachassistenten haben nicht-englischsprachige Märkte historisch gesehen eher als Nebensache behandelt, indem sie lediglich eine Übersetzung über oberflächliche Logik gelegt haben. Anthropic scheint darauf zu setzen, dass globale Nutzer dieselbe Tiefe des Denkens in ihren eigenen Sprachen erwarten, wie sie es von englischsprachigen Nutzern gewohnt sind.
