Asystenci głosowi od dawna zmagają się z frustrującym ograniczeniem. Można było zapytać ich o pogodę, ustawić minutnik lub kolejną piosenkę w playlistcie. Jednak w momencie, gdy rozmowa schodziła na tematy bardziej złożone — debugowanie kodu, strukturyzowanie transakcji biznesowej czy testowanie odporności strategii produktu — interakcja się rozpadała. Asystent mógł cię poprawnie usłyszeć, ale brakowało mu głębi rozumowania, aby wspólnie z tobą przemyśleć problem.
Anthropic próbuje to naprawić. Firma rozszerzyła tryb głosowy w Claude, wprowadzając go z modelu Haiku na poziomie podstawowym do swoich najbardziej zaawansowanych systemów: Opus i Sonnet. Ten ruch zwiastuje coś więcej niż tylko proste wdrożenie nowej funkcji. Anthropic zakłada, że poważna praca może odbywać się poprzez rozmowę mówioną, a nie tylko za pomocą klawiatury.
Dlaczego głos potrzebuje intelektualnej mocy
Wcześniej tryb głosowy Claude działał wyłącznie na modelu Haiku. Model ten priorytetyzuje szybkość i niskie opóźnienia. W przypadku szybkich pytań — „Jaka jest stolica Estonii?” lub „Podsumuj ten e-mail?” — taki kompromis miał sens. Haiku błyskawicznie udziela odpowiedzi. Anthropic zauważyło jednak, że użytkownicy zaczęli wykorzystywać tę funkcję do zadań wykraczających poza możliwości Haiku. Ludzie próbowali używać głosu do merytorycznej pracy, a model często nie radził sobie z rodzajem rozbudowanego rozumowania, którego wymagają takie zadania.
Włączenie modeli Opus i Sonnet zmienia dynamikę rozmowy. Są to „konie robocze” Anthropic w trudnych zadaniach poznawczych. Opus, model flagowy, radzi sobie ze złożoną analizą, długimi ciągami rozumowania i kreatywną syntezą. Sonnet plasuje się pośrodku, oferując silne zdolności rozumowania przy większej szybkości niż Opus. Dzięki warstwie głosowej możesz teraz omówić skomplikowaną architekturę techniczną lub niuansowy model finansowy, oczekując, że AI będzie śledzić logikę, wyłapywać niespójności i zadawać trafne pytania.
Myślenie na głos
Różnica ma charakter jakościowy. W przypadku głosu Haiku interakcja wydawała się transakcyjna. Ty pytałeś, ono odpowiadało. Z Opus i Sonnet interakcja staje się kolaboracyjna.
Wyobraź sobie, że jesteś menedżerem produktu jadącym samochodem do domu. Dyktujesz niedopracowany pomysł na nowy proces onboardingu. Zamiast otrzymać generyczną odpowiedź „To interesujące”, Claude Sonnet zaczyna drążyć temat. Pyta, czy wziąłeś pod uwagę przypadki brzegowe dla użytkowników korporacyjnych. Przywołuje analogie do wzorców onboardingu, które widział w innych kontekstach. Zanim dotrzesz do podjazdu, przetestowałeś pomysł pod trzema kątami, o których wcześniej nie pomyślałeś.
Albo wyobraź sobie inżyniera diagnozującego awarię systemu rozproszonego, analizując logi na drugim ekranie. Rozmawiając z Claude Opus, może opisać objawy prostym językiem, odczytać na głos komunikaty błędów i omawiać hipotezy bez przerywania pracy na pisanie. Model śledzi wątek przez wiele tur rozmowy, pamięta, które ścieżki zostały już wykluczone, i sugeruje zmiany w konfiguracji na podstawie ewoluującej diagnozy. To nie jest transkrypcja z podpiętą wyszukiwarką. To rozumowanie wykonywane w czasie rzeczywistym za pomocą mowy.
Od rozmowy do działania
Być może najważniejszą zmianą jest to, że te zaawansowane modele mogą działać, a nie tylko czatować. Anthropic przedstawia zaktualizowany tryb głosowy jako interfejs agentowy. Ponieważ Opus i Sonnet posiadają zdolność rozumowania pozwalającą na dokładną interpretację intencji, mogą przekształcać rozmowę mówioną w konkretne rezultaty.
Przykład podany przez Anthropic jest prosty, ale wymowny. Użytkownik omawia pomysł biznesowy głosowo, a następnie mówi Claude, aby przekształcił tę chaotyczną rozmowę w ustrukturyzowany, jednostronicowy pitch. Model analizuje nieustrukturyzowany dialog, identyfikuje kluczową propozycję wartości, grupę docelową oraz założenia finansowe i generuje sformatowany dokument. Bez przepisywania. Bez kopiowania logów czatu do osobnego szablonu.
Ta warstwa agentowa rozciąga się na narzędzia produktywności. Anthropic łączy doświadczenie głosowe z Gmail, Slack i Canva. Oznacza to, że możesz wydyktować Claude brief projektu, poprosić o wygenerowanie prezentacji w Canva, wrzucić podsumowanie na kanał zespołu w Slack i przygotować szkic e-maila uzupełniającego w Gmail — a wszystko to w ramach jednej sesji głosowej. Model staje się koordynatorem, tłumaczącym intencje mówione na działania w różnych aplikacjach.
Zmiana tematu bez utraty wątku
Anthropic zaprojektowało również to doświadczenie tak, aby przełamywało bariery między różnymi trybami interakcji. Użytkownicy mogą teraz przełączać się między tekstem a głosem w ramach tej samej rozmowy, nie tracąc kontekstu. Możesz zacząć wpisywać techniczne zapytanie przy biurku, przełączyć się na głos podczas drogi na spotkanie, a następnie wrócić do tekstu, aby wkleić fragment kodu.
System umożliwia również zmianę poziomów modelu w trakcie trwania sesji. Jeśli rozpoczniesz swobodną sesję burzy mózgów z modelem Haiku – korzystając z jego błyskawicznych odpowiedzi – możesz przenieść rozmowę na model Opus, gdy dyskusja przejdzie w fazę rygorystycznej realizacji technicznej. Kontekst zostaje zachowany. AI pamięta, co powiedziałeś trzy kroki temu, niezależnie od tego, czy to napisałeś, czy wypowiedziałeś, oraz czy rozmawiałeś z szybkim, czy z zaawansowanym modelem.
Ta płynność ma znaczenie, ponieważ prawdziwa praca rzadko jest liniowa. Niektóre problemy wymagają szybkości, inne głębi. Stworzenie jednego interfejsu, w którym użytkownicy mogą przełączać się między tymi trybami, zmniejsza obciążenie poznawcze. Zapobiega to uciążliwości związanej z otwieraniem nowych kart, kopiowaniem promptów czy ponownym wyjaśnianiem kontekstu.
Mówienie w językach świata
Ekspansja nie ogranicza się tylko do osób anglojęzycznych. Anthropic zakończyło fazę beta ograniczoną do języka angielskiego, dodając oficjalne wsparcie dla dziewięciu dodatkowych języków:
- Języki europejskie: francuski, niemiecki, włoski, hiszpański i portugalski.
- Języki azjatyckie: hindi, indonezyjski, japoński i koreański.
To nie jest tylko odhaczenie punktu „lokalizacja”. Zaawansowana głosowa asystencja oparta na rozumowaniu w języku koreańskim czy hindi zmienia krąg osób, które mogą korzystać z tych narzędzi w pracy zawodowej. Założyciel startupu w Dżakarcie może dyktować aktualizację dla inwestorów w języku indonezyjskim. Analityk produkcji w Turynie może analizować dane dotyczące łańcucha dostaw w języku włoskim. Moc poznawcza modelu Opus staje się dostępna dla każdego, kto naturalniej myśli w swoim ojczystym języku niż po angielsku.
Na szerszym rynku asystentów AI to wielojęzyczne wdrożenie – w połączeniu z możliwościami rozumowania modeli najwyższej klasy – wzmacnia przewagę konkurencyjną Claude. Większość asystentów głosowych historycznie traktowała rynki pozaanglojęzyczne jako kwestię drugorzędną, nakładając tłumaczenie na powierzchowne rozumowanie. Anthropic zdaje się zakładać, że globalni użytkownicy chcą takiej samej głębi myślenia w swoich językach, jakiej oczekują użytkownicy języka angielskiego.
