Asisten suara telah lama mengalami batasan yang membuat frustrasi. Anda bisa bertanya tentang cuaca, menyetel pengatur waktu, atau menyusun daftar putar lagu. Namun, saat percakapan beralih ke sesuatu yang kompleks—seperti melakukan debugging kode, menyusun kesepakatan bisnis, atau menguji ketahanan strategi produk—interaksi tersebut akan berantakan. Asisten tersebut mungkin mendengar Anda dengan benar, tetapi ia kekurangan kedalaman penalaran untuk memikirkan masalah tersebut bersama Anda.

Anthropic sedang mencoba memperbaiki hal itu. Perusahaan ini telah memperluas mode suara di Claude, dari model Haiku yang merupakan tingkat dasar hingga sistemnya yang paling mumpuni, Opus dan Sonnet. Langkah ini menandakan sesuatu yang lebih menarik daripada sekadar peluncuran fitur biasa. Anthropic bertaruh bahwa pekerjaan serius dapat dilakukan melalui percakapan lisan, bukan hanya melalui papan ketik.

Mengapa Mode Suara Membutuhkan Kecerdasan

Sebelumnya, mode suara Claude berjalan secara eksklusif pada Haiku. Model tersebut memprioritaskan kecepatan dan latensi rendah. Untuk pertanyaan cepat—"Apa ibu kota Estonia?" atau "Ringkas email ini?"—pertukaran tersebut masuk akal. Haiku memberikan jawaban dengan cepat. Namun, Anthropic menyadari bahwa pengguna terus mendorong fitur ini lebih keras daripada kemampuan yang dirancang untuk Haiku. Orang-orang mencoba menggunakan suara untuk pekerjaan substantif, dan model tersebut sering kali gagal memenuhi jenis penalaran mendalam yang dibutuhkan tugas-tugas tersebut.

Menyertakan Opus dan Sonnet mengubah dinamika percakapan. Model-model ini adalah pekerja keras Anthropic untuk tugas-tugas kognitif yang sulit. Opus, sebagai model andalan, menangani analisis mendalam, rantai penalaran yang panjang, dan sintesis kreatif. Sonnet berada di tengah, menawarkan penalaran yang kuat dengan kecepatan yang lebih tinggi daripada Opus. Dengan lapisan suara di atasnya, Anda sekarang dapat mendiskusikan arsitektur teknis yang rumit atau model keuangan yang bernuansa dan mengharapkan AI untuk mengikuti logikanya, menemukan ketidakkonsistenan, dan memberikan tanggapan balik dengan pertanyaan yang relevan.

Berpikir dengan Bersuara

Perbedaannya bersifat kualitatif. Dengan suara Haiku, interaksi terasa transaksional. Anda bertanya; ia menjawab. Dengan Opus dan Sonnet, interaksi menjadi kolaboratif.

Bayangkan Anda adalah seorang manajer produk yang sedang menyetir pulang. Anda mendiktekan ide yang belum matang tentang alur onboarding baru. Alih-alih menerima respons generik seperti "Itu menarik," Claude Sonnet mulai menggali lebih dalam. Ia bertanya apakah Anda telah mempertimbangkan kasus-kasus ekstrem (edge cases) untuk pengguna perusahaan. Ia menarik kesejajaran dengan pola onboarding yang pernah ia lihat dalam konteks lain. Pada saat Anda sampai di halaman rumah, Anda telah menguji ketahanan ide tersebut dari tiga sudut pandang yang belum sempat Anda pertimbangkan.

Atau bayangkan seorang insinyur yang sedang menangani kegagalan sistem terdistribusi sambil melihat log di layar kedua. Dengan berbicara kepada Claude Opus, ia dapat mendeskripsikan gejala dalam bahasa sederhana, membacakan pesan kesalahan dengan lantang, dan mendiskusikan hipotesis tanpa harus berhenti untuk mengetik. Model tersebut mengikuti alur percakapan melalui beberapa giliran, mengingat jalur mana yang sudah dikesampingkan, dan menyarankan perubahan konfigurasi berdasarkan diagnosis yang berkembang. Ini bukan sekadar transkripsi dengan mesin pencari yang terlampir. Ini adalah penalaran yang dilakukan secara real-time melalui ucapan.

Dari Berbicara Menjadi Bertindak

Mungkin pergeseran yang paling signifikan adalah bahwa model-model canggih ini dapat bertindak, bukan sekadar mengobrol. Anthropic membingkai pembaruan mode suara ini sebagai antarmuka agentic. Karena Opus dan Sonnet memiliki kapasitas penalaran untuk menafsirkan niat secara akurat, mereka dapat mengubah percakapan lisan menjadi hasil yang konkret.

Contoh yang ditawarkan Anthropic sangat sederhana namun bermakna. Seorang pengguna mendiskusikan ide bisnis melalui suara, lalu menyuruh Claude untuk mengubah percakapan yang bertele-tele tersebut menjadi sebuah pitch satu halaman yang terstruktur. Model tersebut mengurai dialog yang tidak terstruktur, mengidentifikasi proposisi nilai inti, audiens, dan asumsi keuangan, lalu menghasilkan dokumen yang terformat. Tanpa mengetik ulang. Tanpa menyalin log obrolan ke templat terpisah.

Lapisan agentic ini meluas ke alat produktivitas. Anthropic menghubungkan pengalaman suara ke Gmail, Slack, dan Canva. Itu berarti Anda dapat mendiktekan ringkasan proyek kepada Claude, memintanya membuat dek slide di Canva, memasukkan ringkasan ke saluran Slack tim Anda, dan menyusun draf email tindak lanjut di Gmail—semuanya dari sesi suara yang sama. Model ini menjadi seorang koordinator, menerjemahkan niat lisan menjadi tindakan di berbagai aplikasi yang berbeda.

Berpindah Topik Tanpa Kehilangan Alur

Anthropic juga telah merancang pengalaman ini untuk meruntuhkan hambatan antara berbagai mode interaksi. Pengguna kini dapat berpindah antara teks dan suara dalam percakapan yang sama tanpa kehilangan konteks. Anda mungkin mulai mengetik pertanyaan teknis di meja kerja, beralih ke suara saat berjalan menuju rapat, lalu kembali ke teks untuk menempelkan cuplikan kode.

Sistem ini juga memungkinkan peralihan antar tingkatan model di tengah jalan. Jika Anda memulai sesi curah pendapat santai dengan Haiku—memanfaatkan responsnya yang cepat—Anda dapat meningkatkan percakapan ke Opus saat diskusi beralih ke eksekusi teknis yang mendalam. Konteksnya akan ikut berpindah. AI tersebut mengingat apa yang Anda katakan tiga putaran sebelumnya, terlepas dari apakah Anda mengetiknya atau mengucapkannya, atau apakah Anda sedang berbicara dengan model yang cepat atau yang mendalam.

Fluiditas ini penting karena pekerjaan nyata jarang bersifat linear. Beberapa masalah membutuhkan kecepatan; yang lain membutuhkan kedalaman. Membangun satu antarmuka di mana pengguna dapat berpindah di antara mode-mode tersebut menghemat beban kognitif. Hal ini mencegah gesekan seperti membuka tab baru, menyalin perintah, atau menjelaskan kembali konteks.

Berbicara dalam Berbagai Bahasa di Dunia

Ekspansi ini tidak terbatas pada penutur bahasa Inggris saja. Anthropic telah mengakhiri masa beta khusus bahasa Inggris, dengan menambahkan dukungan resmi untuk sembilan bahasa tambahan:

  • Bahasa Eropa: Prancis, Jerman, Italia, Spanyol, dan Portugis.
  • Bahasa Asia: Hindi, Indonesia, Jepang, dan Korea.

Ini bukan sekadar centang lokalisasi. Asisten suara dengan penalaran tinggi dalam bahasa Korea atau Hindi mengubah siapa saja yang dapat menggunakan alat ini untuk pekerjaan profesional. Seorang pendiri startup di Jakarta dapat menyusun draf pembaruan investor melalui suara dalam bahasa Indonesia. Seorang analis manufaktur di Turin dapat menginterogasi data rantai pasokan dalam bahasa Italia. Kekuatan kognitif Opus menjadi dapat diakses oleh siapa saja yang berpikir lebih alami dalam bahasa ibu mereka daripada dalam bahasa Inggris.

Dalam pasar asisten AI yang lebih luas, peluncuran multibahasa ini—yang dipadukan dengan kemampuan penalaran dari model tingkat atas—mempertajam keunggulan kompetitif Claude. Sebagian besar asisten suara secara historis memperlakukan pasar non-Inggris sebagai sekadar tambahan, dengan hanya menumpuk terjemahan di atas penalaran yang dangkal. Anthropic tampaknya bertaruh bahwa pengguna global menginginkan kedalaman pemikiran yang sama dalam bahasa mereka sendiri seperti yang diharapkan oleh penutur bahasa Inggris.

Sudut Pandang Nyata