একটি ভয়েস-AI টিম ঘোষণা করেছে যে তারা বাস্তব ফোন কলে এন্ড-টু-এন্ড রেসপন্স ল্যাটেন্সি ১.৮ সেকেন্ডের নিচে নামিয়ে এনেছে—যা তাদের প্রথম প্রোটোটাইপের তুলনায় ৫৫% কম। ওভারল্যাপিং প্রসেসিং স্ট্রিম, একটি নিউরাল ভয়েস-অ্যাক্টিভিটি ডিটেক্টর, স্ট্রিমিনং টেক্সট-টু-স্পিচ সিন্থেসিস এবং স্পেকুলেটিভ ইনটেন্ট প্রি-ফেচিং এই উন্নতি ঘটিয়েছে এবং অ্যাপয়েন্টমেন্ট কনভার্সন রেট প্রায় ৩০% বৃদ্ধি করেছে।

ভয়েস অ্যাসিস্ট্যান্টের জন্য ল্যাটেন্সি কেন গুরুত্বপূর্ণ

দীর্ঘ বিরতি কলকারীদের মনে সংশয় তৈরি করে যে সিস্টেমটি এখনও শুনছে কি না। প্রাথমিক পরীক্ষাগুলোতে প্রোটোটাইপটি উত্তর দেওয়ার আগে ২.৯ সেকেন্ড অপেক্ষা করত। কলকারীরা কথা পুনরাবৃত্তি করত অথবা ফোন কেটে দিত, যা একটি স্পষ্ট লক্ষণ ছিল যে এই বিলম্ব কথোপকথনের প্রবাহকে ব্যাহত করছিল। যেকোনো রিয়েল-টাইম সার্ভিসের ক্ষেত্রে—যেমন কাস্টমার সাপোর্ট, বুকিং বা তথ্য অনুসন্ধান—প্রতিটি সেকেন্ডের নীরবতা বিশ্বাসযোগ্যতা কমায় এবং কনভার্সন কমিয়ে দেয়।

প্রযুক্তিগত পরিবর্তন যা এক সেকেন্ড কমিয়ে এনেছে

টিমটি কঠোরভাবে সিকোয়েন্সিয়াল পাইপলাইন বাদ দিয়ে প্রতিটি ধাপকে সমান্তরালভাবে (parallel) চালানোর ব্যবস্থা করেছে, যাতে পর্যাপ্ত ডেটা পাওয়া মাত্রই পরবর্তী ধাপে তা পাঠানো যায়।

  • নিউরল ভয়েস-অ্যাক্টিভিটি ডিটেকশন (VAD)। একটি ছোট নিউরাল মডেল অডিও স্ট্রিম পর্যবেক্ষণ করে এবং বক্তা কখন একটি বাক্য শেষ করছেন তা অনুমান করে, যা ডিটেকশন উইন্ডো প্রায় ৮০০ মিলি-সেকেন্ড থেকে কমিয়ে ২৮০ মিলি-সেকেন্ডে নিয়ে এসেছে।
  • স্ট্রিমিনং টেক্সট-টু-স্পিচ (TTS)। সম্পূর্ণ টেক্সট উত্তরের জন্য অপেক্ষা না করে, সিস্টেমটি প্রথম শব্দগুচ্ছটি অবিলম্বে সিন্থেসাইজারের কাছে পাঠিয়ে দেয়, ফলে উত্তরের বাকি অংশ তৈরি হওয়ার সময়ই অডিও শোনা যেতে শুরু করে।
  • স্পেকুলেটিভ ইনটেন্ট প্রি-ফেচিং। ব্যবহারকারী যখন কথা বলছেন, মডেলটি সম্ভাব্য ইনটেন্ট অনুমান করে এবং আগেভাগেই ব্যাকএন্ডে কুয়েরি পাঠায়। যদি অনুমানটি সঠিক হয়, তবে কথা শেষ হওয়ার মুহূর্তেই উত্তরটি প্রস্তুত থাকে; আর যদি ভুল হয়, তবুও বিকল্প উত্তরটি দ্রুত চলে আসে।

পরিসংখ্যান কী বলছে এবং পরবর্তীতে কী লক্ষ্য রাখতে হবে

ওভারল্যাপিং ডিজাইনের ফলে মোট রেসপন্স টাইম ১.৮ সেকেন্ডের নিচে নেমে এসেছে এবং অ্যাপয়েন্টমেন্ট কনভার্সন রেট ৩০% বৃদ্ধি পেয়েছে।

এই পদ্ধতিটি জটিলতা বাড়িয়ে দেয়: সমান্তরাল স্ট্রিম এবং স্পেকুলেটিভ কুয়েরিগুলো বেশি কম্পিউটেশনাল ক্ষমতা ব্যবহার করে এবং অনুমান ভুল হলে সতর্কতার সাথে এরর হ্যান্ডলিং করার প্রয়োজন হয়। যারা একই পথ অনুসরণ করতে চান, তাদের হার্ডওয়্যার খরচ এবং ব্যবহারকারীর সম্পৃক্ততা (user engagement) বৃদ্ধির প্রত্যাশিত সুবিধার মধ্যে ভারসাম্য বজায় রাখতে হবে।