یک تیم هوش مصنوعی صوتی اعلام کرد که تأخیر پاسخ پایان‌به‌پایان (end-to-end) در تماس‌های تلفنی واقعی را به زیر ۱.۸ ثانیه رسانده است که نشان‌دهنده کاهش ۵۵ درصدی نسبت به اولین نمونه اولیه است. جریان‌های پردازشی هم‌پوشان، آشکارساز عصبی فعالیت صوتی، سنتز متن به گفتار جریانی و پیش‌فراخوانی حدسی قصد (speculative intent pre-fetching)، عامل اصلی این پیشرفت و افزایش تقریباً ۳۰ درصدی نرخ تبدیل قرار ملاقات‌ها بوده‌اند.

چرا تأخیر برای دستیارهای صوتی اهمیت دارد

مکث‌های طولانی باعث می‌شود تماس‌گیرندگان شک کنند که آیا سیستم هنوز در حال گوش دادن است یا خیر. در آزمایش‌های اولیه، نمونه اولیه ۲.۹ ثانیه قبل از پاسخ دادن منتظر می‌ماند. تماس‌گیرندگان حرف خود را تکرار می‌کردند یا تماس را قطع می‌کردند، که نشانه‌ای واضح از شکستن جریان گفتگو بر اثر تأخیر بود. برای هر نوع خدمت بی‌درنگ (real-time)—از پشتیبانی مشتریان گرفته تا رزرو و جستجوی اطلاعات—هر ثانیه سکوت باعث از بین رفتن اعتماد و کاهش نرخ تبدیل می‌شود.

اصلاحات فنی که یک ثانیه را کاهش داد

تیم از خط لوله (pipeline) کاملاً متوالی دست کشید و اجازه داد هر مرحله به صورت موازی اجرا شود و به محض اینکه داده‌های کافی به دست آورد، مرحله بعدی را تغذیه کند.

  • آشکارسازی عصبی فعالیت صوتی (VAD). یک مدل عصبی کوچک جریان صوتی را زیر نظر می‌گیرد و زمان پایان جمله گوینده را پیش‌بینی می‌کند، که پنجره آشکارسازی را از حدود ۸۰۰ میلی‌ثانیه به ۲۸۰ میلی‌ثانیه کاهش می‌دهد.
  • متن به گفتار جریانی (TTS). سیستم به جای انتظار برای پاسخ متنی کامل، اولین عبارت را بلافاصله به سنتزکننده ارسال (stream) می‌کند، بنابراین صوت در حالی که بقیه پاسخ هنوز در حال تولید است، شروع می‌شود.
  • پیش‌فراخوانی حدسی قصد (Speculative intent pre-fetching). در حالی که کاربر هنوز در حال صحبت است، مدل قصد احتمالی او را پیش‌بینی کرده و از قبل از بخش بک‌اند (backend) پرس‌وجو می‌کند. اگر حدس درست باشد، پاسخ در لحظه پایان صحبت کاربر آماده است؛ اگر اشتباه باشد، پاسخ جایگزین (fallback) همچنان سریع ارائه می‌شود.

اعداد چه می‌گویند و در آینده باید به چه چیزی توجه کرد

با طراحی هم‌پوشان، زمان کل پاسخ به زیر ۱.۸ ثانیه کاهش یافت و نرخ تبدیل قرار ملاقات ۳۰ درصد افزایش یافت.

این رویکرد پیچیدگی را افزایش می‌دهد: جریان‌های موازی و پرس‌وجوهای حدسی، منابع محاسباتی بیشتری مصرف می‌کنند و در صورت اشتباه بودن پیش‌بینی‌ها، نیازمند مدیریت خطای دقیق هستند. تیم‌هایی که به دنبال مسیر مشابهی هستند، باید هزینه سخت‌افزار را در برابر افزایش مورد انتظار در تعامل کاربر بسنجند.