عامل صوتی که در آستانه عرضه بود، مدام تماسگیرندگان را قطع میکرد و نرخ قطع شدن (truncation rate) را به ۱۸٪ میرساند؛ این موضوع ما را مجبور کرد درست ده روز قبل از عرضه، منطق پایان نوبت (end-of-turn logic) را بازنویسی کنیم. با افزودن بررسیهای دستور زبانی (grammar checks) و تشخیص پاسخهای کوتاه (back-channel detection) به قانون زمان انتظار سکوت (silence-timeout rule)، میزان قطع شدن را به ۳٪ کاهش دادیم و سکوتهای طولانی و بیمعنایی را که باعث میشد سیستم غیرپاسخگو به نظر برسد، از بین بردیم.
چرا یک زمان انتظار سکوت واحد کافی نبود
طراحی اولیه ما هر مکثی با مدت ۷۰۰ میلیثانیه را به عنوان نشانهای از پایان صحبت کاربر در نظر میگرفت. در یک دمو در محیط کنترلشده — جایی که یک گوینده جملات کامل را در اتاقی ساکت بیان میکند — این قانون به خوبی کار میکند. با این حال، تماسگیرندگان واقعی برای فکر کردن مکث میکنند، اعداد را به گروههای مختلف تقسیم میکنند و برای نشان دادن اینکه در حال گوش دادن هستند، از کلماتی مثل «آهان» یا «اوهوم» استفاده میکنند. عامل صوتی هر یک از این مکثها را به عنوان پایان نوبت تفسیر میکرد.
تحلیل ۳۱۲ تماس واقعی نشاندهنده دو مشکل بود. اول اینکه، عامل صوتی زمانی که گوینده هنوز در حال تنظیم عبارت بعدی بود، وسط حرف او میپرید و باعث از بین رفتن ۱۸٪ از نوبتها میشد. دوم اینکه، وقتی زمان انتظار را به ۱۵۰۰ میلیثانیه افزایش دادیم تا جلوی قطع شدنها را بگیریم، سیستم کند شد و در خطوط پر سر و صدا دچار تعلیق (hang) میشد. نویز پسزمینه باعث میشد شمارنده سکوت مدام بازنشانی شود، بنابراین عامل صوتی هرگز نمیتوانست تشخیص دهد که کار کاربر تمام شده است.
سه سیگنال جایگزین یک عدد واحد میشوند
ما از زمان انتظار ثابت فاصله گرفتیم و یک ماشین حالت (state machine) کوچک ساختیم که سه نشانه را زیر نظر میگیرد:
- مدت زمان سکوت – مدت زمانی که کاربر ساکت بوده است.
- دستور زبان (Grammar) – آیا متن پیادهسازی شده (transcript) با یک واحد نحوی کامل تمام میشود یا با یک کلمه نیمهتمام مانند «که» یا «و»؟
- تشخیص پاسخهای کوتاه (Back-channel detection) – آیا آخرین صدا یک نوبت واقعی (مثلاً یک پاسخ گفتاری) بود یا یک تأیید کوتاه مانند «آره»؟
با این سیگنالها، دو بودجه زمانی برای سکوت تعریف کردیم:
- متن کامل – وقتی متن تجزیهشده کامل به نظر میرسد، یک زمان انتظار کوتاه ۵۵۰ میلیثانیهای اعمال میکنیم. در این حالت عامل صوتی سریع عمل کرده و بلافاصله پاسخ میدهد.
- متن نیمهتمام – وقتی آخرین توکن (token) نشان میدهد که کاربر در میان جمله است، زمان انتظار را به ۱۳۰۰ میلیثانیه افزایش میدهیم تا به گوینده فرصت ادامه دادن داده شود.
دو لایه حفاظتی اضافی نیز برای جلوگیری از قطع شدنهای اشتباه اضافه کردیم:
- حداقل مدت زمان گفتار – یک «اوهوم» کوتاه به عنوان یک نوبت کامل محسوب نمیشود، بنابراین عامل صوتی قبل از تصمیمگیری، منتظر یک عبارت طولانیتر میماند.
- سقف ثابت (Hard cap) – صرفنظر از نویز پسزمینه، یک حد حداکثری برای سکوت باعث میشود عامل صوتی پس از یک دوره معقول پاسخ دهد و از تعلیقهای بیپایان جلوگیری شود.
نتایج و معنای آن برای هوش مصنوعی صوتی
پس از پیادهسازی سیستم سه-سیگنالی، نرخ قطع شدن از ۱۸٪ به ۳٪ کاهش یافت. تماسگیرندگان دیگر احساس نمیکردند که عامل صوتی وسط حرفشان میپرد و مشکل قبلی «سکوت مطلق» نیز از بین رفت. عامل صوتی هم پاسخگو و هم مؤدب به نظر میرسد و با نحوه مدیریت نوبتهای گفتگو توسط انسانها مطابقت دارد.
برای توسعهدهندگانی که دستیارهای صوتی میسازند، درس واضح است: یک مقدار ثابت در یک فایل تنظیمات (config file) نمیتواند ظرافتهای تعامل گفتاری را درک کند. یک ماشین حالت سبک که طول سکوت، کامل بودن دستور زبانی و نشانههای پاسخ کوتاه را ارزیابی میکند، میتواند بدون افزودن بار محاسباتی سنگین، دقت نوبتگیری را به طرز چشمگیری بهبود بخشد.
معایب احتمالی و سوالات بیپاسخ
افزودن تجزیه دستور زبانی و طبقهبندی پاسخهای کوتاه، مراحل پردازش را افزایش میدهد. تیمها باید اطمینان حاصل کنند که تأخیر (latency) اضافی، مزایای روانیِ گفتگو را از بین نمیبرد. این رویکرد همچنین به یک متن پیادهسازی شده نسبتاً دقیق وابسته است؛ در محیطهای پر سر و صدا یا در صورت وجود لهجه، نشانههای دستور زبانی ممکن است دچار خطا شوند و سیستم را مجبور کنند که به زمانهای انتظار طولانیتر بازگردد.
کارهای آینده میتواند شامل بررسی آستانههای زمان انتظار تطبیقی باشد که از عادتهای هر تماسگیرنده یاد میگیرند، یا ادغام ویژگیهای عروض (prosodic features) مانند pitch و انرژی برای تقویت تشخیصدهنده پاسخهای کوتاه. نظارت بر اینکه این اصلاحات چگونه بر معیارهای کلیدی — رضایت مشتری، زمان تکمیل تماس و نرخ خطا — تأثیر میگذارند، پیش از گسترش این تکنیک در مراکز تماس بزرگتر، ضروری خواهد بود.
نکته اصلی: برخورد با تکمیل نوبت به عنوان یک تصمیم مبتنی بر چندین سیگنال (و نه صرفاً یک تایمر سکوت واحد)، خطاهای قطع شدن را تا چندین برابر کاهش داده و جریان طبیعی مورد انتظار کاربران از عاملهای صوتی را بازیابی میکند.
