Anthropic توسع وضع الصوت في Claude ليشمل نموذجي Opus و Sonnet

قامت Anthropic بترقية قدراتها الحوارية بشكل كبير من خلال نقل وضع الصوت في Claude إلى أكثر نماذج الاستدلال تقدماً لديها. وينقل هذا التوسع الميزة من مجرد أداة أساسية إلى مساعد عالي الذكاء قادر على التعامل مع المهام المعقدة عبر منصات الهاتف المحمول، وسطح المكتب، والويب.

تعزيز الصوت بذكاء Opus و Sonnet

في السابق، كان وضع الصوت في Claude مقتصرًا على نموذج Haiku خفيف الوزن، الذي كان يعطي الأولوية للسرعة على حساب الاستدلال العميق. وفي تحول معماري كبير، تسمح Anthropic الآن للمستخدمين بإجراء تفاعلات صوتية باستخدام نموذجيها الرائدين Opus و Sonnet. وهذا يعني أنه بدلاً من التفاعلات البسيطة القائمة على الأوامر والتحكم، يمكن للمستخدمين الانخراط في جلسات عصف ذهني رفيعة المستوى، وحل المشكلات المعقدة، والاستدلال الدقيق باستخدام أصواتهم فقط.

والأهم من ذلك، قدمت Anthropic مرونة في النماذج، مما يسمح للمستخدمين بالتبديل بين نماذج مختلفة في منتصف المحادثة. وهذا يتيح سير عمل سلس حيث يمكن للمستخدم بدء مهمة باستخدام نموذج سريع ثم الانتقال إلى نموذج Opus الأكثر قدرة لصقل مفهوم متطور، كل ذلك دون مغادرة واجهة الصوت.

دعم لغات متعددة وتكامل الأدوات

لا يعد وضع الصوت المحدث مجرد تحسين محلي بل هو تحسين عالمي، حيث يدعم إحدى عشرة لغة مختلفة. ومع ذلك، فإن الميزة الحقيقية التي تميز Anthropic تكمن في اتصال منظومتها البرمجية. فخلافاً للعديد من المنافسين الذين يركزون فقط على سلاسة المحادثة، يتجه Claude بقوة نحو السلوك "الوكيل" (agentic) من خلال تكامل الأدوات.

يمكن للمستخدمين منح Claude إمكانية الوصول إلى أدوات الإنتاجية الخارجية مثل Gmail و Google Calendar و Slack. وهذا يتيح تجربة عملية للغاية دون استخدام اليدين: حيث يمكن للمستخدم إملاء تحديث معقد للمشروع شفهياً، وطلب تلخيصه من Claude، ثم إصدار أمر للذكاء الاصطناعي بصياغة وإرسال بريد إلكتروني عبر Gmail. تمتلك Anthropic حالياً ميزة تنافسية في هذا المجال المحدد، كونها المزود الوحيد الذي يمكن المستخدمين من صياغة وحفظ رسائل البريد الإلكتروني مباشرة من واجهة الصوت.

المشهد التنافسي: Claude مقابل OpenAI و Google

يتطور الذكاء الاصطناعي الصوتي حالياً في سباق ثلاثي بين Anthropic و OpenAI و Google، حيث يتبع كل منها نهجاً تقنياً مختلفاً. يستخدم GPT-Live من OpenAI تقنية الصوت ثنائي الاتجاه الكامل (full-duplex)، مما يسمح له بالاستماع والتحدث في آن واحد لتدفق أكثر شبهاً بالبشر. ويتبع Gemini Live من Google فلسفة مماثلة ولكنه يظل محصوراً إلى حد كبير في بيئات الهواتف الذكية.

في المقابل، يستخدم Claude نظاماً قائماً على الأدوار (turn-based)، حيث ينتظر النموذج انتهاء المستخدم من الكلام قبل الرد. وبينما قد يبدو هذا أقل "سلاسة" قليلاً من النماذج ثنائية الاتجاه الكاملة، تراهن Anthropic على أن المنفعة ستتفوق على مجرد محاكاة المحادثة. ومن خلال التركيز على دمج استدلال النماذج اللغوية الكبيرة (LLM) مع أدوات البرمجيات في العالم الحقيقي، ينتقل Claude من كونه مجرد روبوت دردشة إلى التحول نحو كونه وكيلاً للإنتاجية يتم تفعيله بالصوت.

النقاط الرئيسية

  • ترقيات النماذج: لم يعد وضع الصوت في Claude مقتصرًا على Haiku؛ بل أصبح يدعم الآن نموذجي Opus و Sonnet عالي القدرة عبر الويب وسطح المكتب والهاتف المحمول.
  • ذكاء قابل للتنفيذ: تميز Anthropic نفسها من خلال التكامل العميق للأدوات، مما يسمح للمستخدمين بإدارة Gmail و Google Calendar و Slack عبر الأوامر الصوتية.
  • تحول استراتيجي: بينما تتصدر OpenAI في "طبيعية" المحادثة من خلال الصوت ثنائي الاتجاه الكامل، تركز Anthropic على المنفعة "الوكيلية" (agentic) لسير العمل المدفوع بالصوت.