دستیارهای صوتی مدتهاست که با یک سقف محدودکننده و ناامیدکننده دستوپنجه نرم میکنند. شما میتوانستید از آنها درباره وضعیت آبوهوا بپرسید، تایمر تنظیم کنید یا یک لیست پخش را اجرا کنید. اما به محض اینکه گفتگو به سمت موضوعی پیچیده میرفت — مانند عیبیابی کد، ساختاردهی به یک قرارداد تجاری یا آزمون فشار بر یک استراتژی محصول — تعامل از هم میپاشید. دستیار ممکن بود حرف شما را درست بشنود، اما فاقد عمق استدلالی بود که بتواند همراه با شما درباره آن مسئله فکر کند.
Anthropic در تلاش است تا این مشکل را حل کند. این شرکت حالت صوتی Claude را از مدل سطح پایه Haiku به قدرتمندترین سیستمهای خود، یعنی Opus و Sonnet، گسترش داده است. این حرکت نشاندهنده چیزی فراتر از یک عرضه سادهی ویژگی جدید است. Anthropic شرط میبندد که کارهای جدی را میتوان از طریق مکالمه صوتی انجام داد، نه فقط از طریق صفحهکلید.
چرا قابلیت صوتی به قدرت پردازش ذهنی نیاز دارد
پیش از این، حالت صوتی Claude منحصراً بر پایه Haiku اجرا میشد. آن مدل سرعت و تأخیر کم را در اولویت قرار میدهد. برای سوالات سریع — مانند «پایتخت استونی کجاست؟» یا «این ایمیل را خلاصه کن؟» — این موازنه منطقی بود. Haiku پاسخها را با سرعت بالا ارائه میدهد. اما Anthropic متوجه شد که کاربران مدام از این ویژگی فراتر از تواناییهای Haiku استفاده میکنند. مردم سعی میکردند از حالت صوتی برای کارهای اساسی استفاده کنند، و این مدل اغلب در انجام آن نوع استدلالهای طولانی که این وظایف میطلبند، ناتوان بود.
وارد کردن Opus و Sonnet به این چرخه، ماهیت مکالمه را تغییر میدهد. این مدلها اسبهای بارکش Anthropic برای وظایف شناختی دشوار هستند. Opus که مدل پرچمدار است، تحلیلهای پیچیده، زنجیرههای استدلال طولانی و ترکیب خلاقانه را مدیریت میکند. Sonnet در جایگاهی میانی قرار دارد و استدلال قوی را با سرعتی بیشتر از Opus ارائه میدهد. با لایهی صوتی که بر روی این مدلها قرار گرفته، اکنون میتوانید درباره یک معماری فنی پیچیده یا یک مدل مالی دقیق صحبت کنید و انتظار داشته باشید که هوش مصنوعی منطق را دنبال کند، تناقضها را شناسایی کند و با پرسیدن سوالات مرتبط، بحث را پیش ببرد.
با صدای بلند فکر کردن
تفاوت در اینجا کیفی است. با صدای Haiku، تعامل حالت معاملاتی داشت؛ شما میپرسیدید و او پاسخ میداد. اما با Opus و Sonnet، تعامل به یک همکاری تبدیل میشود.
تصور کنید مدیر محصولی هستید که در حال رانندگی به سمت خانه است. شما یک ایده نیمهکاره درباره جریان ورود کاربر (onboarding) جدید را دیکته میکنید. به جای دریافت یک پاسخ کلیشهای مثل «جالب است»، Claude Sonnet شروع به کاوش میکند. او میپرسد که آیا موارد مرزی (edge cases) برای کاربران سازمانی را در نظر گرفتهاید یا خیر. او شباهتهایی با الگوهای ورود کاربری که در زمینههای دیگر دیده است، پیدا میکند. تا زمانی که به در ورودی خانه برسید، ایده خود را از سه زاویه که قبلاً به آنها فکر نکرده بودید، مورد آزمون قرار دادهاید.
یا مهندسی را تصور کنید که در حال عیبیابی خرابی یک سیستم توزیعشده است و همزمان در صفحه دوم در حال بررسی لاگهاست. او با صحبت کردن با Claude Opus، میتواند علائم را به زبان ساده توصیف کند، پیامهای خطا را با صدای بلند بخواند و بدون توقف برای تایپ کردن، درباره فرضیهها بحث کند. مدل رشته گفتگو را در چندین مرحله دنبال میکند، به خاطر میآورد که کدام مسیرها قبلاً رد شدهاند و بر اساس تشخیص در حال تکامل، تغییرات پیکربندی را پیشنهاد میدهد. این صرفاً تبدیل گفتار به متن با یک موتور جستجوی متصل نیست؛ بلکه استدلال است که در لحظه و از طریق گفتار انجام میشود.
از صحبت کردن تا انجام دادن
شاید مهمترین تغییر این باشد که این مدلهای پیشرفته میتوانند عمل کنند، نه اینکه صرفاً چت کنند. Anthropic حالت صوتی بهروزشده را به عنوان یک رابط کاربری عاملمحور (agentic) معرفی میکند. از آنجایی که Opus و Sonnet دارای ظرفیت استدلالی برای تفسیر دقیق نیت کاربر هستند، میتوانند یک مکالمه صوتی را به خروجیهای ملموس تبدیل کنند.
مثالی که Anthropic ارائه میدهد ساده اما گویا است. کاربری درباره یک ایده تجاری از طریق صدا صحبت میکند و سپس به Claude میگوید که آن مکالمه پراکنده را به یک ارائه (pitch) ساختاریافته در یک صفحه تبدیل کند. مدل گفتگوی بدون ساختار را تجزیه کرده، ارزش پیشنهادی اصلی، مخاطبان و فرضیات مالی را شناسایی میکند و یک سند قالببندی شده تولید میکند. بدون نیاز به تایپ مجدد و بدون کپی کردن لاگهای چت در یک قالب جداگانه.
این لایه عاملمحور به ابزارهای بهرهوری نیز گسترش مییابد. Anthropic در حال متصل کردن تجربه صوتی به Gmail، Slack و Canva است. این بدان معناست که شما میتوانید خلاصه یک پروژه را برای Claude دیکته کنید، از او بخواهید مجموعه اسلایدها را در Canva بسازد، خلاصهای را در کانال Slack تیم خود قرار دهید و پیشنویس ایمیل پیگیری را در Gmail بنویسید — همه اینها تنها در یک جلسه صوتی. مدل به یک هماهنگکننده تبدیل میشود که قصد و نیت صوتی را به اقدامات عملی در برنامههای مختلف ترجمه میکند.
تغییر مسیر بدون از دست دادن رشته کلام
Anthropic has also designed the experience to break down barriers between different modes of interaction. Users can now jump between text and voice within the same conversation without losing context. You might start typing a technical query at your desk, switch to voice while walking to a meeting, then return to text to paste a code snippet.
The system also allows switching between model tiers midstream. If you begin a casual brainstorming session with Haiku—taking advantage of its snappy responses—you can escalate the conversation to Opus when the discussion turns to rigorous technical execution. The context transfers over. The AI remembers what you said three turns ago, regardless of whether you typed it or spoke it, or whether you were talking to the fast model or the deep one.
This fluidity matters because real work is rarely linear. Some problems need speed; others need depth. Building a single interface where users can move between those gears saves cognitive overhead. It prevents the friction of opening new tabs, copying prompts, or re-explaining context.
Speaking the World's Languages
The expansion is not limited to English speakers. Anthropic has ended the English-only beta, adding official support for nine additional languages:
- European languages: French, German, Italian, Spanish, and Portuguese.
- Asian languages: Hindi, Indonesian, Japanese, and Korean.
This is not merely a localization checkbox. High-reasoning voice assistance in Korean or Hindi changes who can use these tools for professional work. A startup founder in Jakarta can voice-draft an investor update in Indonesian. A manufacturing analyst in Turin can interrogate supply-chain data in Italian. The cognitive power of Opus becomes accessible to anyone who thinks more naturally in their native tongue than in English.
In the broader market for AI assistants, this multilingual rollout—paired with the reasoning capabilities of the top-tier models—sharpens Claude's competitive edge. Most voice assistants have historically treated non-English markets as afterthoughts, layering translation onto shallow reasoning. Anthropic seems to be betting that global users want the same depth of thought in their own languages that English speakers have come to expect.
