الوكيل الصوتي الذي كنا على وشك إطلاقه كان يستمر في مقاطعة المتصلين، مما رفع معدل الانقطاع إلى 18% وأجبرنا على إعادة كتابة منطق "نهاية الدور" (end-of-turn logic) قبل عشرة أيام فقط من الإطلاق. ومن خلال إضافة فحوصات القواعد النحوية واكتشاف الاستجابات الجانبية (back-channel detection) إلى قاعدة مهلة الصمت، نجحنا في خفض المقاطعات إلى 3% والقضاء على فترات الصمت الطويلة والميتة التي كانت تجعل النظام يبدو غير مستجيب.
لماذا لم تكن مهلة الصمت الواحدة كافية
كان تصميمنا الأصلي يعامل أي توقف لمدة 700 مللي ثانية كإشارة على أن المستخدم قد انتهى من الكلام. في العروض التوضيحية المحكومة — حيث يتحدث متحدث واحد بجمل كاملة في غرفة هادئة — تعمل هذه القاعدة بشكل جيد. ومع ذلك، فإن المتصلين الحقيقيين يتوقفون للتفكير، ويقسمون الأرقام إلى مجموعات، ويستخدمون عبارات مثل "أجل" أو "همم" لإظهار أنهم يستمعون. وكان الوكيل يفسر كل توقف من هذه التوقفات على أنه نهاية للدور.
كشف تحليل 312 مكالمة فعلية عن مشكلتين. أولاً، كان الوكيل يقاطع المتحدث بينما كان لا يزال يصيغ العبارة التالية، مما أدى إلى إفساد 18% من الأدوار. ثانياً، عندما رفعنا المهلة إلى 1500 مللي ثانية لإيقاف المقاطعات، أصبح النظام بطيئاً وبدأ في التعليق على الخطوط الصاخبة؛ حيث كانت الضوضاء الخلفية تعيد ضبط عداد الصمت باستمرار، مما يمنع الوكيل من تحديد ما إذا كان المستخدم قد انتهى أم لا.
ثلاث إشارات بدلاً من رقم واحد
ابتعدنا عن المهلة الثابتة وبنينا "آلة حالة" (state machine) صغيرة تراقب ثلاث إشارات:
- مدة الصمت – المدة التي ظل فيها المستخدم صامتاً.
- القواعد النحوية – هل ينتهي النص المكتوب بوحدة نحوية كاملة أم بكلمة معلقة مثل "الـ" أو "و"؟
- اكتشاف الاستجابات الجانبية (back-channel detection) – هل كان الصوت الأخير دوراً حقيقياً (مثل إجابة منطوقة) أم مجرد تأكيد قصير مثل "أجل"؟
بناءً على هذه الإشارات، حددنا ميزانيتين للصمت:
- النص المكتمل – عندما يبدو النص المحلل مكتملاً، نطبق مهلة قصيرة قدرها 550 مللي ثانية، مما يجعل الوكيل سريع الاستجابة ويرد فوراً.
- النص غير المكتمل – عندما يشير الرمز الأخير إلى أن المستخدم في منتصف الجملة، نقوم بتمديد المهلة إلى 1300 مللي ثانية، مما يمنح المتحدث مساحة للمتابعة.
كما وضعنا حارسين إضافيين لمنع المقاطعات الخاطئة:
- الحد الأدنى لمدّة الكلام – عبارة "همم" القصيرة لا تُحتسب كدور كامل، لذا ينتظر الوكيل عبارة أطول قبل اتخاذ القرار.
- الحد الأقصى الصارم – بغض النظر عن الضوضاء الخلفية، يفرض حد الصمت الأقصى على الوكيل الاستجابة بعد فترة معقولة، لتجنب التعليق اللانهائي.
النتائج وما تعنيه للذكاء الاصطناعي الصوتي
بعد نشر نظام الإشارات الثلاث، انخفض معدل الانقطاع من 18% إلى 3%. لم يعد المتصلون يسمعون الوكيل وهو يتحدث فوق أصواتهم، واختفت مشكلة "الصمت المطبق" السابقة. أصبح الوكيل يبدو مستجيباً ومهذباً في آن واحد، مما يماثل الطريقة التي يدير بها البشر أدوار المحادثة.
بالنسبة للمطورين الذين يبنون المساعدات الصوتية، الدرس واضح: لا يمكن لثابت واحد في ملف الإعدادات أن يستوعب الفروق الدقيقة في التفاعل الصوتي. إن استخدام آلة حالة خفيفة الوزن تقيم طول الصمت، والاكتمال النحوي، وإشارات الاستجابة الجانبية يمكن أن يحسن دقة تبادل الأدوار بشكل كبير دون إضافة عبء حوسبي ثقيل.
العيوب المحتملة والأسئلة المفتوحة
تضيف عملية تحليل القواعد النحوية وتصنيف الاستجابات الجانبية خطوات إضافية للمعالجة. يجب على الفرق التحقق من أن زمن الاستجابة (latency) الإضافي لا يلغي المكاسب المحققة في سلاسة المحادثة. كما يعتمد هذا النهج على نص مكتوب دقيق بدرجة معقولة؛ ففي البيئات الصاخبة أو مع الكلام بلكنات مختلفة، قد تخطئ الإشارات النحوية، مما يضطر النظام إلى العودة إلى مهل زمنية أطول.
يمكن أن يستكشف العمل المستقبلي عتبات مهلة تكيفية تتعلم من عادات كل متصل على حدة، أو دمج السمات العروضية (مثل طبقة الصوت والطاقة) لتعزيز كاشف الاستجابات الجانبية. وسيكون من الضروري مراقبة كيفية تأثير هذه التحسينات على المقاييس الرئيسية — مثل رضا العملاء، ووقت إكمال المكالمة، ومعدلات الخطأ — قبل توسيع نطاق هذه التقنية في عمليات النشر الكبيرة في مراكز الاتصال.
الخلاصة: إن التعامل مع إتمام الدور كقرار متعدد الإشارات، وليس كمجرد مؤقت صمت واحد، يقلل أخطاء المقاطعة بمقدار عشرة أضعاف ويعيد التدفق الطبيعي الذي يتوقعه المستخدمون من الوكلاء الصوتيين.
