دستیارهای صوتی مدت‌هاست که با یک سقف محدودکننده و ناامیدکننده دست‌وپنجه نرم می‌کنند. شما می‌توانستید از آن‌ها درباره وضعیت آب‌وهوا بپرسید، تایمر تنظیم کنید یا یک لیست پخش را اجرا کنید. اما به محض اینکه گفتگو به سمت موضوعی پیچیده می‌رفت — مانند عیب‌یابی کد، ساختاردهی به یک قرارداد تجاری یا آزمون فشار بر یک استراتژی محصول — تعامل از هم می‌پاشید. دستیار ممکن بود حرف شما را درست بشنود، اما فاقد عمق استدلالی بود که بتواند همراه با شما درباره آن مسئله فکر کند.

Anthropic در تلاش است تا این مشکل را حل کند. این شرکت حالت صوتی Claude را از مدل سطح پایه Haiku به قدرتمندترین سیستم‌های خود، یعنی Opus و Sonnet، گسترش داده است. این حرکت نشان‌دهنده چیزی فراتر از یک عرضه ساده‌ی ویژگی جدید است. Anthropic شرط می‌بندد که کارهای جدی را می‌توان از طریق مکالمه صوتی انجام داد، نه فقط از طریق صفحه‌کلید.

چرا قابلیت صوتی به قدرت پردازش ذهنی نیاز دارد

پیش از این، حالت صوتی Claude منحصراً بر پایه Haiku اجرا می‌شد. آن مدل سرعت و تأخیر کم را در اولویت قرار می‌دهد. برای سوالات سریع — مانند «پایتخت استونی کجاست؟» یا «این ایمیل را خلاصه کن؟» — این موازنه منطقی بود. Haiku پاسخ‌ها را با سرعت بالا ارائه می‌دهد. اما Anthropic متوجه شد که کاربران مدام از این ویژگی فراتر از توانایی‌های Haiku استفاده می‌کنند. مردم سعی می‌کردند از حالت صوتی برای کارهای اساسی استفاده کنند، و این مدل اغلب در انجام آن نوع استدلال‌های طولانی که این وظایف می‌طلبند، ناتوان بود.

وارد کردن Opus و Sonnet به این چرخه، ماهیت مکالمه را تغییر می‌دهد. این مدل‌ها اسب‌های بارکش Anthropic برای وظایف شناختی دشوار هستند. Opus که مدل پرچم‌دار است، تحلیل‌های پیچیده، زنجیره‌های استدلال طولانی و ترکیب خلاقانه را مدیریت می‌کند. Sonnet در جایگاهی میانی قرار دارد و استدلال قوی را با سرعتی بیشتر از Opus ارائه می‌دهد. با لایه‌ی صوتی که بر روی این مدل‌ها قرار گرفته، اکنون می‌توانید درباره یک معماری فنی پیچیده یا یک مدل مالی دقیق صحبت کنید و انتظار داشته باشید که هوش مصنوعی منطق را دنبال کند، تناقض‌ها را شناسایی کند و با پرسیدن سوالات مرتبط، بحث را پیش ببرد.

با صدای بلند فکر کردن

تفاوت در اینجا کیفی است. با صدای Haiku، تعامل حالت معاملاتی داشت؛ شما می‌پرسیدید و او پاسخ می‌داد. اما با Opus و Sonnet، تعامل به یک همکاری تبدیل می‌شود.

تصور کنید مدیر محصولی هستید که در حال رانندگی به سمت خانه است. شما یک ایده نیمه‌کاره درباره جریان ورود کاربر (onboarding) جدید را دیکته می‌کنید. به جای دریافت یک پاسخ کلیشه‌ای مثل «جالب است»، Claude Sonnet شروع به کاوش می‌کند. او می‌پرسد که آیا موارد مرزی (edge cases) برای کاربران سازمانی را در نظر گرفته‌اید یا خیر. او شباهت‌هایی با الگوهای ورود کاربری که در زمینه‌های دیگر دیده است، پیدا می‌کند. تا زمانی که به در ورودی خانه برسید، ایده خود را از سه زاویه که قبلاً به آن‌ها فکر نکرده بودید، مورد آزمون قرار داده‌اید.

یا مهندسی را تصور کنید که در حال عیب‌یابی خرابی یک سیستم توزیع‌شده است و همزمان در صفحه دوم در حال بررسی لاگ‌هاست. او با صحبت کردن با Claude Opus، می‌تواند علائم را به زبان ساده توصیف کند، پیام‌های خطا را با صدای بلند بخواند و بدون توقف برای تایپ کردن، درباره فرضیه‌ها بحث کند. مدل رشته گفتگو را در چندین مرحله دنبال می‌کند، به خاطر می‌آورد که کدام مسیرها قبلاً رد شده‌اند و بر اساس تشخیص در حال تکامل، تغییرات پیکربندی را پیشنهاد می‌دهد. این صرفاً تبدیل گفتار به متن با یک موتور جستجوی متصل نیست؛ بلکه استدلال است که در لحظه و از طریق گفتار انجام می‌شود.

از صحبت کردن تا انجام دادن

شاید مهم‌ترین تغییر این باشد که این مدل‌های پیشرفته می‌توانند عمل کنند، نه اینکه صرفاً چت کنند. Anthropic حالت صوتی به‌روزشده را به عنوان یک رابط کاربری عامل‌محور (agentic) معرفی می‌کند. از آنجایی که Opus و Sonnet دارای ظرفیت استدلالی برای تفسیر دقیق نیت کاربر هستند، می‌توانند یک مکالمه صوتی را به خروجی‌های ملموس تبدیل کنند.

مثالی که Anthropic ارائه می‌دهد ساده اما گویا است. کاربری درباره یک ایده تجاری از طریق صدا صحبت می‌کند و سپس به Claude می‌گوید که آن مکالمه پراکنده را به یک ارائه (pitch) ساختاریافته در یک صفحه تبدیل کند. مدل گفتگوی بدون ساختار را تجزیه کرده، ارزش پیشنهادی اصلی، مخاطبان و فرضیات مالی را شناسایی می‌کند و یک سند قالب‌بندی شده تولید می‌کند. بدون نیاز به تایپ مجدد و بدون کپی کردن لاگ‌های چت در یک قالب جداگانه.

این لایه عامل‌محور به ابزارهای بهره‌وری نیز گسترش می‌یابد. Anthropic در حال متصل کردن تجربه صوتی به Gmail، Slack و Canva است. این بدان معناست که شما می‌توانید خلاصه یک پروژه را برای Claude دیکته کنید، از او بخواهید مجموعه اسلایدها را در Canva بسازد، خلاصه‌ای را در کانال Slack تیم خود قرار دهید و پیش‌نویس ایمیل پیگیری را در Gmail بنویسید — همه این‌ها تنها در یک جلسه صوتی. مدل به یک هماهنگ‌کننده تبدیل می‌شود که قصد و نیت صوتی را به اقدامات عملی در برنامه‌های مختلف ترجمه می‌کند.

تغییر مسیر بدون از دست دادن رشته کلام

Anthropic has also designed the experience to break down barriers between different modes of interaction. Users can now jump between text and voice within the same conversation without losing context. You might start typing a technical query at your desk, switch to voice while walking to a meeting, then return to text to paste a code snippet.

The system also allows switching between model tiers midstream. If you begin a casual brainstorming session with Haiku—taking advantage of its snappy responses—you can escalate the conversation to Opus when the discussion turns to rigorous technical execution. The context transfers over. The AI remembers what you said three turns ago, regardless of whether you typed it or spoke it, or whether you were talking to the fast model or the deep one.

This fluidity matters because real work is rarely linear. Some problems need speed; others need depth. Building a single interface where users can move between those gears saves cognitive overhead. It prevents the friction of opening new tabs, copying prompts, or re-explaining context.

Speaking the World's Languages

The expansion is not limited to English speakers. Anthropic has ended the English-only beta, adding official support for nine additional languages:

  • European languages: French, German, Italian, Spanish, and Portuguese.
  • Asian languages: Hindi, Indonesian, Japanese, and Korean.

This is not merely a localization checkbox. High-reasoning voice assistance in Korean or Hindi changes who can use these tools for professional work. A startup founder in Jakarta can voice-draft an investor update in Indonesian. A manufacturing analyst in Turin can interrogate supply-chain data in Italian. The cognitive power of Opus becomes accessible to anyone who thinks more naturally in their native tongue than in English.

In the broader market for AI assistants, this multilingual rollout—paired with the reasoning capabilities of the top-tier models—sharpens Claude's competitive edge. Most voice assistants have historically treated non-English markets as afterthoughts, layering translation onto shallow reasoning. Anthropic seems to be betting that global users want the same depth of thought in their own languages that English speakers have come to expect.

The Real Take