عامل صوتی که در آستانه عرضه بود، مدام تماس‌گیرندگان را قطع می‌کرد و نرخ قطع شدن (truncation rate) را به ۱۸٪ می‌رساند؛ این موضوع ما را مجبور کرد درست ده روز قبل از عرضه، منطق پایان نوبت (end-of-turn logic) را بازنویسی کنیم. با افزودن بررسی‌های دستور زبانی (grammar checks) و تشخیص پاسخ‌های کوتاه (back-channel detection) به قانون زمان انتظار سکوت (silence-timeout rule)، میزان قطع شدن را به ۳٪ کاهش دادیم و سکوت‌های طولانی و بی‌معنایی را که باعث می‌شد سیستم غیرپاسخگو به نظر برسد، از بین بردیم.

چرا یک زمان انتظار سکوت واحد کافی نبود

طراحی اولیه ما هر مکثی با مدت ۷۰۰ میلی‌ثانیه را به عنوان نشانه‌ای از پایان صحبت کاربر در نظر می‌گرفت. در یک دمو در محیط کنترل‌شده — جایی که یک گوینده جملات کامل را در اتاقی ساکت بیان می‌کند — این قانون به خوبی کار می‌کند. با این حال، تماس‌گیرندگان واقعی برای فکر کردن مکث می‌کنند، اعداد را به گروه‌های مختلف تقسیم می‌کنند و برای نشان دادن اینکه در حال گوش دادن هستند، از کلماتی مثل «آهان» یا «اوهوم» استفاده می‌کنند. عامل صوتی هر یک از این مکث‌ها را به عنوان پایان نوبت تفسیر می‌کرد.

تحلیل ۳۱۲ تماس واقعی نشان‌دهنده دو مشکل بود. اول اینکه، عامل صوتی زمانی که گوینده هنوز در حال تنظیم عبارت بعدی بود، وسط حرف او می‌پرید و باعث از بین رفتن ۱۸٪ از نوبت‌ها می‌شد. دوم اینکه، وقتی زمان انتظار را به ۱۵۰۰ میلی‌ثانیه افزایش دادیم تا جلوی قطع شدن‌ها را بگیریم، سیستم کند شد و در خطوط پر سر و صدا دچار تعلیق (hang) می‌شد. نویز پس‌زمینه باعث می‌شد شمارنده سکوت مدام بازنشانی شود، بنابراین عامل صوتی هرگز نمی‌توانست تشخیص دهد که کار کاربر تمام شده است.

سه سیگنال جایگزین یک عدد واحد می‌شوند

ما از زمان انتظار ثابت فاصله گرفتیم و یک ماشین حالت (state machine) کوچک ساختیم که سه نشانه را زیر نظر می‌گیرد:

  • مدت زمان سکوت – مدت زمانی که کاربر ساکت بوده است.
  • دستور زبان (Grammar) – آیا متن پیاده‌سازی شده (transcript) با یک واحد نحوی کامل تمام می‌شود یا با یک کلمه نیمه‌تمام مانند «که» یا «و»؟
  • تشخیص پاسخ‌های کوتاه (Back-channel detection) – آیا آخرین صدا یک نوبت واقعی (مثلاً یک پاسخ گفتاری) بود یا یک تأیید کوتاه مانند «آره»؟

با این سیگنال‌ها، دو بودجه زمانی برای سکوت تعریف کردیم:

  1. متن کامل – وقتی متن تجزیه‌شده کامل به نظر می‌رسد، یک زمان انتظار کوتاه ۵۵۰ میلی‌ثانیه‌ای اعمال می‌کنیم. در این حالت عامل صوتی سریع عمل کرده و بلافاصله پاسخ می‌دهد.
  2. متن نیمه‌تمام – وقتی آخرین توکن (token) نشان می‌دهد که کاربر در میان جمله است، زمان انتظار را به ۱۳۰۰ میلی‌ثانیه افزایش می‌دهیم تا به گوینده فرصت ادامه دادن داده شود.

دو لایه حفاظتی اضافی نیز برای جلوگیری از قطع شدن‌های اشتباه اضافه کردیم:

  • حداقل مدت زمان گفتار – یک «اوهوم» کوتاه به عنوان یک نوبت کامل محسوب نمی‌شود، بنابراین عامل صوتی قبل از تصمیم‌گیری، منتظر یک عبارت طولانی‌تر می‌ماند.
  • سقف ثابت (Hard cap) – صرف‌نظر از نویز پس‌زمینه، یک حد حداکثری برای سکوت باعث می‌شود عامل صوتی پس از یک دوره معقول پاسخ دهد و از تعلیق‌های بی‌پایان جلوگیری شود.

نتایج و معنای آن برای هوش مصنوعی صوتی

پس از پیاده‌سازی سیستم سه-سیگنالی، نرخ قطع شدن از ۱۸٪ به ۳٪ کاهش یافت. تماس‌گیرندگان دیگر احساس نمی‌کردند که عامل صوتی وسط حرفشان می‌پرد و مشکل قبلی «سکوت مطلق» نیز از بین رفت. عامل صوتی هم پاسخگو و هم مؤدب به نظر می‌رسد و با نحوه مدیریت نوبت‌های گفتگو توسط انسان‌ها مطابقت دارد.

برای توسعه‌دهندگانی که دستیارهای صوتی می‌سازند، درس واضح است: یک مقدار ثابت در یک فایل تنظیمات (config file) نمی‌تواند ظرافت‌های تعامل گفتاری را درک کند. یک ماشین حالت سبک که طول سکوت، کامل بودن دستور زبانی و نشانه‌های پاسخ کوتاه را ارزیابی می‌کند، می‌تواند بدون افزودن بار محاسباتی سنگین، دقت نوبت‌گیری را به طرز چشمگیری بهبود بخشد.

معایب احتمالی و سوالات بی‌پاسخ

افزودن تجزیه دستور زبانی و طبقه‌بندی پاسخ‌های کوتاه، مراحل پردازش را افزایش می‌دهد. تیم‌ها باید اطمینان حاصل کنند که تأخیر (latency) اضافی، مزایای روانیِ گفتگو را از بین نمی‌برد. این رویکرد همچنین به یک متن پیاده‌سازی شده نسبتاً دقیق وابسته است؛ در محیط‌های پر سر و صدا یا در صورت وجود لهجه، نشانه‌های دستور زبانی ممکن است دچار خطا شوند و سیستم را مجبور کنند که به زمان‌های انتظار طولانی‌تر بازگردد.

کارهای آینده می‌تواند شامل بررسی آستانه‌های زمان انتظار تطبیقی باشد که از عادت‌های هر تماس‌گیرنده یاد می‌گیرند، یا ادغام ویژگی‌های عروض (prosodic features) مانند pitch و انرژی برای تقویت تشخیص‌دهنده پاسخ‌های کوتاه. نظارت بر اینکه این اصلاحات چگونه بر معیارهای کلیدی — رضایت مشتری، زمان تکمیل تماس و نرخ خطا — تأثیر می‌گذارند، پیش از گسترش این تکنیک در مراکز تماس بزرگتر، ضروری خواهد بود.

نکته اصلی: برخورد با تکمیل نوبت به عنوان یک تصمیم مبتنی بر چندین سیگنال (و نه صرفاً یک تایمر سکوت واحد)، خطاهای قطع شدن را تا چندین برابر کاهش داده و جریان طبیعی مورد انتظار کاربران از عامل‌های صوتی را بازیابی می‌کند.