لطالما عانت المساعدات الصوتية من سقف محدود ومحبط. كان بإمكانك سؤالها عن الطقس، أو ضبط مؤقت، أو تشغيل قائمة أغاني. ولكن في اللحظة التي ينحرف فيها الحوار نحو شيء معقد — مثل تصحيح الأكواد البرمجية، أو هيكلة صفقة تجارية، أو اختبار استراتيجية منتج — ينهار التفاعل. قد تسمعك المساعدة بشكل صحيح، لكنها تفتقر إلى عمق التفكير اللازم لمناقشة المشكلة معك.
تحاول Anthropic إصلاح ذلك. فقد وسعت الشركة وضع الصوت في Claude من نموذج Haiku المبتدئ إلى أنظمتها الأكثر قدرة، Opus و Sonnet. تشير هذه الخطوة إلى شيء أكثر إثارة للاهتمام من مجرد طرح ميزة جديدة؛ إذ تراهن Anthropic على أن العمل الجاد يمكن أن يتم من خلال المحادثة الصوتية، وليس فقط عبر لوحة المفاتيح.
لماذا يحتاج الصوت إلى قدرات ذهنية
في السابق، كان وضع الصوت في Claude يعمل حصريًا على Haiku. يعطي هذا النموذج الأولوية للسرعة وزمن الاستجابة المنخفض. وبالنسبة للأسئلة السريعة — "ما هي عاصمة إستونيا؟" أو "لخص هذا البريد الإلكتروني؟" — كانت هذه المقايضة منطقية، فنموذج Haiku يقدم الإجابات بسرعة. لكن Anthropic لاحظت أن المستخدمين استمروا في دفع الميزة إلى حدود تتجاوز ما صُمم Haiku للتعامل معه. حاول الناس استخدام الصوت في أعمال جوهرية، وغالبًا ما كان النموذج يقصر عن تقديم نوع الاستدلال الممتد الذي تتطلبه تلك المهام.
إن إشراك Opus و Sonnet يغير "فيزياء" المحادثة. فهذه النماذج هي محركات العمل لدى Anthropic للمهام المعرفية الصعبة. يتولى Opus، وهو النموذج الرائد، التحليلات المعقدة، وسلاسل الاستدلال الممتدة، والتركيب الإبداعي. أما Sonnet فيقع في المنتصف، حيث يوفر استدلالًا قويًا بسرعة أكبر من Opus. ومع إضافة الصوت فوق ذلك، يمكنك الآن التحدث حول بنية تقنية معقدة أو نموذج مالي دقيق وتوقع أن يتبع الذكاء الاصطناعي المنطق، ويكتشف التناقضات، ويطرح أسئلة ذات صلة.
التفكير بصوت عالٍ
الفرق هو فرق نوعي. مع صوت Haiku، كان التفاعل يبدو إجرائيًا؛ تسأل، فيجيب. أما مع Opus و Sonnet، فيصبح التفاعل تعاونيًا.
تخيل أنك مدير منتج تقود سيارتك إلى المنزل. تقوم بإملاء فكرة غير مكتملة حول تدفق عملية انضمام مستخدمين (onboarding flow) جديدة. بدلاً من تلقي رد عام مثل "هذا مثير للاهتمام"، يبدأ Claude Sonnet في الاستقصاء؛ يسألك عما إذا كنت قد فكرت في الحالات الاستثنائية لمستخدمي المؤسسات، ويربط الفكرة بأنماط الانضمام التي رآها في سياقات أخرى. وبحلول الوقت الذي تصل فيه إلى مدخل منزلك، ستكون قد اختبرت الفكرة من ثلاث زوايا لم تكن قد وضعتها في الحسبان.
أو تخيل مهندسة تعالج فشل نظام موزع أثناء مراجعة السجلات (logs) على شاشة ثانية. من خلال التحدث إلى Claude Opus، يمكنها وصف الأعراض بلغة بسيطة، وقراءة رسائل الخطأ بصوت عالٍ، ومناقشة الفرضيات دون التوقف للكتابة. يتتبع النموذج سياق الحديث عبر جولات متعددة، ويتذكر المسارات التي تم استبعادها بالفعل، ويقترح تغييرات في الإعدادات بناءً على التشخيص المتطور. هذا ليس مجرد تحويل الكلام إلى نص مع محرك بحث ملحق به؛ بل هو استدلال يتم في الوقت الفعلي من خلال الكلام.
من التحدث إلى التنفيذ
ربما يكون التحول الأبرز هو أن هذه النماذج المتقدمة يمكنها "الفعل"، وليس مجرد الدردشة. تصف Anthropic وضع الصوت المحدث بأنه واجهة "وكيلة" (agentic interface). ولأن Opus و Sonnet يمتلكان القدرة الاستدلالية لتفسير القصد بدقة، فيمكنهما تحويل المحادثة الصوتية إلى مخرجات ملموسة.
المثال الذي تقدمه Anthropic مباشر ولكنه بليغ. يناقش مستخدم فكرة تجارية عبر الصوت، ثم يطلب من Claude تحويل تلك المحادثة المرتجلة إلى عرض تقديمي (pitch) مهيكل في صفحة واحدة. يقوم النموذج بتحليل الحوار غير المنظم، وتحديد القيمة الجوهرية، والجمهور، والافتراضات المالية، وينتج مستندًا منسقًا. لا حاجة لإعادة الكتابة، ولا حاجة لنسخ سجلات الدردشة إلى قالب منفصل.
تمتد هذه الطبقة "الوكيلة" إلى أدوات الإنتاجية. تقوم Anthropic بربط تجربة الصوت بـ Gmail و Slack و Canva. وهذا يعني أنه يمكنك إملاء ملخص مشروع لـ Claude، وطلب إنشاء عرض تقديمي في Canva، وإرسال ملخص إلى قناة فريقك في Slack، وصياغة بريد المتابعة في Gmail — كل ذلك من نفس الجلسة الصوتية. يصبح النموذج منسقًا، يترجم القصد المنطوق إلى أفعال عبر تطبيقات منفصلة.
تغيير المسار دون فقدان سياق الحديث
صممت Anthropic التجربة أيضًا لكسر الحواجز بين أوضاع التفاعل المختلفة. يمكن للمستخدمين الآن التنقل بين النص والصوت ضمن المحادثة نفسها دون فقدان السياق. قد تبدأ في كتابة استفسار تقني على مكتبك، ثم تنتقل إلى الصوت أثناء توجهك إلى اجتماع، ثم تعود إلى النص للصق مقتطف برمجي.
يسمح النظام أيضًا بالتبديل بين مستويات النماذج في منتصف العملية. إذا بدأت جلسة عصف ذهني عفوية باستخدام Haiku — مستفيدًا من استجاباته السريعة — يمكنك تصعيد المحادثة إلى Opus عندما يتحول النقاش إلى تنفيذ تقني دقيق. ينتقل السياق معك؛ حيث يتذكر الذكاء الاصطناعي ما قلته قبل ثلاث جولات، بغض النظر عما إذا كنت قد كتبته أو نطقت به، أو ما إذا كنت تتحدث مع النموذج السريع أو النموذج العميق.
تكمن أهمية هذه المرونة في أن العمل الحقيقي نادرًا ما يكون خطيًا. فبعض المشكلات تتطلب السرعة، بينما تتطلب مشكلات أخرى العمق. إن بناء واجهة واحدة تتيح للمستخدمين التنقل بين هذه "التروس" يقلل من العبء المعرفي، ويمنع الاحتكاك الناتج عن فتح علامات تبويب جديدة، أو نسخ الأوامر، أو إعادة شرح السياق.
التحدث بلغات العالم
لا يقتصر هذا التوسع على المتحدثين باللغة الإنجليزية فقط، فقد أنهت Anthropic المرحلة التجريبية المقتصرة على الإنجليزية، وأضافت دعمًا رسميًا لتسع لغات إضافية:
- اللغات الأوروبية: الفرنسية، والألمانية، والإيطالية، والإسبانية، والبرتغالية.
- اللغات الآسيوية: الهندية، والإندونيسية، واليابانية، والكورية.
هذا ليس مجرد إجراء روتيني لتعريب المنتج. إن المساعدة الصوتية ذات القدرة العالية على الاستنتاج باللغة الكورية أو الهندية تغير من يمكنه استخدام هذه الأدوات في العمل المهني. فبإمكان مؤسس شركة ناشئة في جاكرتا صياغة مسودة تحديث للمستثمرين صوتيًا باللغة الإندونيسية. ويمكن لمحلل تصنيع في تورين استجواب بيانات سلاسل التوريد باللغة الإيطالية. وبذلك تصبح القوة المعرفية لـ Opus متاحة لأي شخص يفكر بلغته الأم بشكل طبيعي أكثر من الإنجليزية.
وفي السوق الأوسع للمساعدين القائمين على الذكاء الاصطناعي، فإن هذا الإطلاق متعدد اللغات — المقترن بقدرات الاستنتاج للنماذج رفيعة المستوى — يعزز الميزة التنافسية لـ Claude. فمن الناحية التاريخية، كانت معظم المساعدات الصوتية تتعامل مع الأسواق غير الناطقة بالإنجليزية كأمر ثانوي، حيث تكتفي بإضافة طبقة ترجمة فوق استنتاج سطحي. ويبدو أن Anthropic تراهن على أن المستخدمين العالميين يريدون نفس العمق في التفكير بلغاتهم الخاصة الذي اعتاد المتحدثون بالإنجليزية توقعه.
