Anthropic قابلیت حالت صوتی Claude را به مدل‌های Opus و Sonnet گسترش می‌دهد

Anthropic با آوردن حالت صوتی Claude به پیشرفته‌ترین مدل‌های استدلالی خود، قابلیت‌های گفتگوی خود را به‌طور قابل‌توجهی ارتقا داده است. این گسترش، این ویژگی را از یک ابزار کاربردی ساده به یک دستیار با هوش بالا تبدیل می‌کند که قادر است وظایف پیچیده را در پلتفرم‌های موبایل، دسکتاپ و وب انجام دهد.

تامین قدرت صوتی با هوش Opus و Sonnet

پیش از این، حالت صوتی Claude به مدل سبک Haiku محدود بود که سرعت را بر استدلال عمیق اولویت می‌داد. در یک تغییر ساختاری بزرگ، Anthropic اکنون به کاربران اجازه می‌دهد تعاملات صوتی را روی مدل‌های پرچم‌دار Opus و Sonnet خود اجرا کنند. این بدان معناست که کاربران به جای تعاملات ساده‌ی «دستور و کنترل»، می‌توانند تنها با استفاده از صدای خود، در طوفان فکری سطح بالا، حل مسائل پیچیده و استدلال‌های ظریف شرکت کنند.

نکته حیاتی این است که Anthropic انعطاف‌پذیری مدل را معرفی کرده است که به کاربران اجازه می‌دهد در میان یک گفتگو، بین مدل‌های مختلف سوئیچ کنند. این امر یک جریان کاری بی‌وقفه را ممکن می‌سازد که در آن کاربر می‌تواند وظیفه‌ای را با یک مدل سریع شروع کند و سپس برای اصلاح یک مفهوم پیچیده، بدون ترک رابط کاربری صوتی، به مدل توانمندتر Opus تغییر وضعیت دهد.

پشتیبانی از چندین زبان و ادغام با ابزارها

حالت صوتی به‌روزرسانی‌شده تنها یک بهبود محدود به یک منطقه نیست، بلکه یک بهبود جهانی است که از یازده زبان مختلف پشتیبانی می‌کند. با این حال، تمایز واقعی Anthropic در اتصال به اکوسیستم آن نهفته است. برخلاف بسیاری از رقبا که صرفاً بر روانی گفتگو تمرکز دارند، Claude از طریق ادغام با ابزارها، به‌شدت به سمت رفتارهای «عاملی» (agentic) متمایل شده است.

کاربران می‌توانند به Claude اجازه دسترسی به ابزارهای بهره‌وری خارجی مانند Gmail، Google Calendar و Slack را بدهند. این امر یک تجربه کاربردی و بدون نیاز به دست (hands-free) را فراهم می‌کند: کاربر می‌تواند به‌صورت شفاهی یک به‌روزرسانی پیچیده پروژه را دیکته کند، از Claude بخواهد آن را خلاصه کند و سپس به هوش مصنوعی دستور دهد تا یک ایمیل را از طریق Gmail نوشته و ارسال کند. Anthropic در حال حاضر در این بخش خاص دارای مزیت رقابتی است و تنها ارائه‌دهنده‌ای است که کاربران را قادر می‌سازد ایمیل‌ها را مستقیماً از طریق رابط صوتی نوشته و ذخیره کنند.

چشم‌انداز رقابتی: Claude در برابر OpenAI و Google

تکامل هوش مصنوعی صوتی در حال حاضر یک رقابت سه‌جانبه بین Anthropic، OpenAI و Google است که هر کدام رویکرد فنی متفاوتی را اتخاذ کرده‌اند. GPT-Live متعلق به OpenAI از صدای full-duplex استفاده می‌کند که به آن اجازه می‌دهد به‌طور همزمان گوش دهد و صحبت کند تا جریانی شبیه به انسان داشته باشد. Gemini Live از Google نیز فلسفه مشابهی را دنبال می‌کند، اما عمدتاً به محیط‌های گوشی‌های هوشمند محدود مانده است.

در مقابل، Claude از یک سیستم مبتنی بر نوبت (turn-based) استفاده می‌کند که در آن مدل قبل از پاسخ دادن، منتظر می‌ماند تا کاربر صحبت کردن خود را تمام کند. اگرچه این ممکن است نسبت به مدل‌های full-duplex کمی کمتر «روان» به نظر برسد، اما Anthropic شرط می‌بندد که کاربردی بودن بر تقلید صرف از گفتگو پیروز خواهد شد. Claude با تمرکز بر ادغام استدلال LLM با ابزارهای نرم‌افزاری دنیای واقعی، در حال فاصله گرفتن از یک چت‌بات ساده و حرکت به سمت تبدیل شدن به یک عامل بهره‌وری فعال با صدا است.

نکات کلیدی

  • ارتقای مدل‌ها: حالت صوتی Claude دیگر به Haiku محدود نیست؛ اکنون از مدل‌های بسیار توانمند Opus و Sonnet در وب، دسکتاپ و موبایل پشتیبانی می‌کند.
  • هوش عملیاتی: Anthropic از طریق ادغام عمیق با ابزارها، خود را متمایز می‌کند و به کاربران اجازه می‌دهد Gmail، Google Calendar و Slack را از طریق فرمان‌های صوتی مدیریت کنند.
  • چرخش استراتژیک: در حالی که OpenAI از طریق صدای full-duplex در «طبیعی بودن» گفتگو پیشتاز است، Anthropic بر کاربرد «عاملی» جریان‌های کاری مبتنی بر صدا تمرکز کرده است.