Pembantu suara telah lama menghadapi had yang mengecewakan. Anda boleh bertanya tentang cuaca, menetapkan pemasa, atau menyusun senarai main. Namun, sebaik sahaja perbualan beralih kepada sesuatu yang kompleks—seperti debugging kod, menyusun struktur perjanjian perniagaan, atau menguji tekanan strategi produk—interaksi tersebut akan gagal. Pembantu tersebut mungkin mendengar anda dengan betul, tetapi ia kekurangan kedalaman penaakulan untuk berfikir bersama anda bagi menyelesaikan masalah tersebut.

Anthropic sedang cuba memperbaiki perkara itu. Syarikat tersebut telah memperluas mod suara dalam Claude, daripada model Haiku peringkat permulaan kepada sistemnya yang paling berupaya, Opus dan Sonnet. Langkah ini menandakan sesuatu yang lebih menarik daripada sekadar pelancaran ciri baharu. Anthropic bertaruh bahawa kerja-kerja serius boleh dilakukan melalui perbualan lisan, bukan sekadar melalui papan kekunci.

Mengapa Suara Memerlukan Kuasa Minda

Sebelum ini, mod suara Claude dijalankan secara eksklusif pada Haiku. Model tersebut mengutamakan kelajuan dan kependaman rendah. Untuk soalan pantas—"Apakah ibu negara Estonia?" atau "Ringkaskan e-mel ini?"—pertukaran tersebut adalah masuk akal. Haiku memberikan jawapan dengan pantas. Namun, Anthropic menyedari bahawa pengguna terus menggunakan ciri tersebut dengan lebih mendalam daripada apa yang mampu ditangani oleh Haiku. Orang ramai cuba menggunakan suara untuk kerja yang substantif, dan model tersebut sering kali gagal memenuhi jenis penaakulan panjang yang diperlukan oleh tugasan tersebut.

Membawa Opus dan Sonnet ke dalam ekosistem ini mengubah dinamika perbualan. Model-model ini adalah nadi utama Anthropic untuk tugasan kognitif yang sukar. Opus, model utamanya, mengendalikan analisis terperinci, rantaian penaakulan yang panjang, dan sintesis kreatif. Sonnet pula berada di tengah-tengah, menawarkan penaakulan yang kuat pada kelajuan yang lebih tinggi daripada Opus. Dengan lapisan suara di atasnya, anda kini boleh berbincang tentang seni bina teknikal yang kompleks atau model kewangan yang teliti dan menjangkakan AI tersebut dapat menjejaki logik, mengesan ketidakkonsistenan, dan memberikan maklum balas dengan soalan yang relevan.

Berfikir Secara Lisan

Perbezaannya adalah dari segi kualitatif. Dengan suara Haiku, interaksi terasa bersifat transaksional. Anda bertanya; ia menjawab. Dengan Opus dan Sonnet, interaksi menjadi kolaboratif.

Bayangkan anda seorang pengurus produk yang sedang memandu pulang. Anda mendiktekan idea yang belum lengkap tentang aliran onboarding yang baharu. Bukannya menerima jawapan generik seperti "Itu menarik," Claude Sonnet mula meneroka lebih mendalam. Ia bertanya sama ada anda telah mempertimbangkan kes terpencil (edge cases) untuk pengguna perusahaan. Ia membuat persamaan dengan corak onboarding yang pernah dilihatnya dalam konteks lain. Menjelang masa anda sampai ke halaman rumah, anda telah menguji tekanan idea tersebut dari tiga sudut yang tidak pernah anda pertimbangkan sebelum ini.

Atau bayangkan seorang jurutera yang sedang menyelesaikan masalah kegagalan sistem teragih sambil menyemak log pada skrin kedua. Dengan bercakap kepada Claude Opus, dia boleh menerangkan simptom dalam bahasa biasa, membaca mesej ralat dengan kuat, dan membincangkan hipotesis tanpa perlu berhenti untuk menaip. Model tersebut menjejaki aliran perbualan merentasi pelbagai pusingan, mengingati saluran mana yang telah diketepikan, dan mencadangkan perubahan konfigurasi berdasarkan diagnosis yang sedang berkembang. Ini bukan sekadar transkripsi dengan enjin carian yang disertakan. Ia adalah penaakulan yang dilakukan dalam masa nyata, melalui pertuturan.

Daripada Bercakap kepada Melakukan

Mungkin peralihan yang paling ketara ialah model-model canggih ini boleh bertindak, bukan sekadar berbual. Anthropic membingkai mod suara yang dikemas kini ini sebagai antaramuka ejenik. Oleh kerana Opus dan Sonnet memiliki kapasiti penaakulan untuk mentafsir niat dengan tepat, mereka boleh menukar perbualan lisan kepada output yang konkrit.

Contoh yang diberikan oleh Anthropic adalah ringkas tetapi bermakna. Seorang pengguna membincangkan idea perniagaan melalui suara, kemudian memberitahu Claude untuk menukar perbualan yang meleret itu kepada pembentangan (pitch) satu halaman yang berstruktur. Model tersebut menganalisis dialog tidak berstruktur, mengenal pasti cadangan nilai teras, audiens, dan andaian kewangan, lalu menghasilkan dokumen yang telah diformat. Tiada penaipan semula. Tiada penyalinan log sembang ke dalam templat berasingan.

Lapisan ejenik ini meluas ke dalam alatan produktiviti. Anthropic sedang menyambungkan pengalaman suara kepada Gmail, Slack, dan Canva. Ini bermakna anda boleh mendiktekan taklimat projek kepada Claude, memintanya menjana set slaid di Canva, memasukkan ringkasan ke dalam saluran Slack pasukan anda, dan merangka e-mel susulan di Gmail—semuanya daripada sesi suara yang sama. Model tersebut menjadi penyelaras, menterjemah niat lisan kepada tindakan merentasi aplikasi yang berbeza.

Anthropic juga telah mereka bentuk pengalaman ini untuk meruntuhkan halangan antara mod interaksi yang berbeza. Pengguna kini boleh beralih antara teks dan suara dalam perbualan yang sama tanpa kehilangan konteks. Anda mungkin mula menaip pertanyaan teknikal di meja kerja, beralih ke suara semasa berjalan ke mesyuarat, kemudian kembali ke teks untuk menampal petikan kod.

Sistem ini juga membolehkan pertukaran antara peringkat model secara langsung. Jika anda memulakan sesi sumbang saran santai dengan Haiku—mengambil kesempatan atas responsnya yang pantas—anda boleh meningkatkan perbualan kepada Opus apabila perbincangan beralih kepada pelaksanaan teknikal yang rapi. Konteks tersebut dipindahkan. AI tersebut mengingati apa yang anda katakan tiga pusingan yang lalu, tidak kira sama ada anda menaipnya atau menyuarakannya, atau sama ada anda sedang bercakap dengan model yang pantas atau model yang mendalam.

Kelancaran ini penting kerana kerja sebenar jarang bersifat linear. Sesetengah masalah memerlukan kelajuan; yang lain memerlukan kedalaman. Membina satu antara muka tunggal di mana pengguna boleh beralih antara mod tersebut dapat menjimatkan beban kognitif. Ia mengelakkan kesulitan seperti membuka tab baharu, menyalin arahan, atau menjelaskan semula konteks.

Bertutur dalam Bahasa-bahasa Dunia

Pengembangan ini tidak terhad kepada penutur bahasa Inggeris sahaja. Anthropic telah menamatkan fasa beta bahasa Inggeris sahaja, dengan menambah sokongan rasmi untuk sembilan bahasa tambahan:

  • Bahasa Eropah: Perancis, Jerman, Itali, Sepanyol, dan Portugis.
  • Bahasa Asia: Hindi, Indonesia, Jepun, dan Korea.

Ini bukan sekadar memenuhi syarat lokalisasi. Bantuan suara dengan penaakulan tinggi dalam bahasa Korea atau Hindi mengubah siapa yang boleh menggunakan alatan ini untuk kerja profesional. Seorang pengasas syarikat pemula di Jakarta boleh merangka draf kemas kini pelabur melalui suara dalam bahasa Indonesia. Seorang penganalisis pembuatan di Turin boleh meneliti data rantaian bekalan dalam bahasa Itali. Kuasa kognitif Opus menjadi boleh diakses oleh sesiapa sahaja yang berfikir dengan lebih semula jadi dalam bahasa ibunda mereka berbanding bahasa Inggeris.

Dalam pasaran pembantu AI yang lebih luas, pelancaran pelbagai bahasa ini—yang digabungkan dengan keupayaan penaakulan model tahap tertinggi—mempertajamkan kelebihan daya saing Claude. Kebanyakan pembantu suara secara sejarahnya menganggap pasaran bukan bahasa Inggeris sebagai perkara sampingan, dengan hanya meletakkan lapisan terjemahan pada penaakulan yang cetek. Anthropic nampaknya bertaruh bahawa pengguna global mahukan kedalaman pemikiran yang sama dalam bahasa mereka sendiri seperti yang diharapkan oleh penutur bahasa Inggeris.

Pandangan Sebenar