Anthropic قابلیت حالت صوتی Claude را به مدلهای Opus و Sonnet گسترش میدهد
Anthropic با آوردن حالت صوتی Claude به پیشرفتهترین مدلهای استدلالی خود، قابلیتهای گفتگوی خود را بهطور قابلتوجهی ارتقا داده است. این گسترش، این ویژگی را از یک ابزار کاربردی ساده به یک دستیار با هوش بالا تبدیل میکند که قادر است وظایف پیچیده را در پلتفرمهای موبایل، دسکتاپ و وب انجام دهد.
تامین قدرت صوتی با هوش Opus و Sonnet
پیش از این، حالت صوتی Claude به مدل سبک Haiku محدود بود که سرعت را بر استدلال عمیق اولویت میداد. در یک تغییر ساختاری بزرگ، Anthropic اکنون به کاربران اجازه میدهد تعاملات صوتی را روی مدلهای پرچمدار Opus و Sonnet خود اجرا کنند. این بدان معناست که کاربران به جای تعاملات سادهی «دستور و کنترل»، میتوانند تنها با استفاده از صدای خود، در طوفان فکری سطح بالا، حل مسائل پیچیده و استدلالهای ظریف شرکت کنند.
نکته حیاتی این است که Anthropic انعطافپذیری مدل را معرفی کرده است که به کاربران اجازه میدهد در میان یک گفتگو، بین مدلهای مختلف سوئیچ کنند. این امر یک جریان کاری بیوقفه را ممکن میسازد که در آن کاربر میتواند وظیفهای را با یک مدل سریع شروع کند و سپس برای اصلاح یک مفهوم پیچیده، بدون ترک رابط کاربری صوتی، به مدل توانمندتر Opus تغییر وضعیت دهد.
پشتیبانی از چندین زبان و ادغام با ابزارها
حالت صوتی بهروزرسانیشده تنها یک بهبود محدود به یک منطقه نیست، بلکه یک بهبود جهانی است که از یازده زبان مختلف پشتیبانی میکند. با این حال، تمایز واقعی Anthropic در اتصال به اکوسیستم آن نهفته است. برخلاف بسیاری از رقبا که صرفاً بر روانی گفتگو تمرکز دارند، Claude از طریق ادغام با ابزارها، بهشدت به سمت رفتارهای «عاملی» (agentic) متمایل شده است.
کاربران میتوانند به Claude اجازه دسترسی به ابزارهای بهرهوری خارجی مانند Gmail، Google Calendar و Slack را بدهند. این امر یک تجربه کاربردی و بدون نیاز به دست (hands-free) را فراهم میکند: کاربر میتواند بهصورت شفاهی یک بهروزرسانی پیچیده پروژه را دیکته کند، از Claude بخواهد آن را خلاصه کند و سپس به هوش مصنوعی دستور دهد تا یک ایمیل را از طریق Gmail نوشته و ارسال کند. Anthropic در حال حاضر در این بخش خاص دارای مزیت رقابتی است و تنها ارائهدهندهای است که کاربران را قادر میسازد ایمیلها را مستقیماً از طریق رابط صوتی نوشته و ذخیره کنند.
چشمانداز رقابتی: Claude در برابر OpenAI و Google
تکامل هوش مصنوعی صوتی در حال حاضر یک رقابت سهجانبه بین Anthropic، OpenAI و Google است که هر کدام رویکرد فنی متفاوتی را اتخاذ کردهاند. GPT-Live متعلق به OpenAI از صدای full-duplex استفاده میکند که به آن اجازه میدهد بهطور همزمان گوش دهد و صحبت کند تا جریانی شبیه به انسان داشته باشد. Gemini Live از Google نیز فلسفه مشابهی را دنبال میکند، اما عمدتاً به محیطهای گوشیهای هوشمند محدود مانده است.
در مقابل، Claude از یک سیستم مبتنی بر نوبت (turn-based) استفاده میکند که در آن مدل قبل از پاسخ دادن، منتظر میماند تا کاربر صحبت کردن خود را تمام کند. اگرچه این ممکن است نسبت به مدلهای full-duplex کمی کمتر «روان» به نظر برسد، اما Anthropic شرط میبندد که کاربردی بودن بر تقلید صرف از گفتگو پیروز خواهد شد. Claude با تمرکز بر ادغام استدلال LLM با ابزارهای نرمافزاری دنیای واقعی، در حال فاصله گرفتن از یک چتبات ساده و حرکت به سمت تبدیل شدن به یک عامل بهرهوری فعال با صدا است.
نکات کلیدی
- ارتقای مدلها: حالت صوتی Claude دیگر به Haiku محدود نیست؛ اکنون از مدلهای بسیار توانمند Opus و Sonnet در وب، دسکتاپ و موبایل پشتیبانی میکند.
- هوش عملیاتی: Anthropic از طریق ادغام عمیق با ابزارها، خود را متمایز میکند و به کاربران اجازه میدهد Gmail، Google Calendar و Slack را از طریق فرمانهای صوتی مدیریت کنند.
- چرخش استراتژیک: در حالی که OpenAI از طریق صدای full-duplex در «طبیعی بودن» گفتگو پیشتاز است، Anthropic بر کاربرد «عاملی» جریانهای کاری مبتنی بر صدا تمرکز کرده است.
