تتقلص الفجوة بين المحادثة البشرية والتفاعل مع الذكاء الاصطناعي، لكن زمن الاستجابة (latency) لا يزال يشكل عائقًا رئيسيًا أمام الانغماس الحقيقي. تعمل Smallest.ai على معالجة هذا التحدي من خلال الابتعاد عن نماذج LLM الضخمة والبطيئة والتوجه نحو نماذج صوتية صغيرة متخصصة وفائقة السرعة مصممة لمحاكاة الأنماط المعرفية البشرية.

تجاوز زمن الاستجابة في نماذج اللغة الكبيرة

غالبًا ما تعاني وكلاء الصوت المعتمدون على الذكاء الاصطناعي حاليًا من تأخير "الأمر ثم المعالجة". ففي سير عمل LLM القياسي، ينتظر النظام مقطعًا صوتيًا كاملاً، ثم يعالج النص، وبعد ذلك ينشئ ردًا. وكما يشير Sudarshan Kamath، المؤسس والرئيس التنفيذي لشركة Smallest.ai، فإن هذه الوقفة هي دليل قاطع على أن المستخدم يتحدث إلى آلة.

تحاكي منهجية Smallest.ai البيولوجيا العصبية البشرية: الاستماع والتفكير والتحدث في آن واحد. وقد صُمم نموذجها الصوتي الصغير المملوك لها للتعامل مع الذكاء في الوقت الفعلي مع انعدام زمن استجابة تقريبًا. ومن خلال التركيز على النماذج الصغيرة المتخصصة بدلاً من النماذج التأسيسية الضخمة، تهدف الشركة الناشئة إلى تمكين المقاطعات وتدفق المحادثة الطبيعي، بهدف فعلي لـ "اجتياز اختبار تورينج" من خلال السرعة والدقة.

بنية ثنائية النماذج لذكاء المؤسسات

تقترح Smallest.ai معيارًا جديدًا لبنية وكلاء الذكاء الاصطناعي. فبدلاً من إجبار نموذج واحد كبير على التعامل مع كل شيء، تدعو الشركة إلى نظام ثنائي المستويات:

  1. النموذج الصوتي الصغير: طبقة ذكاء في الوقت الفعلي تدير الفروق الدقيقة للمحادثة الفورية والسلسة، بما في ذلك اللهجات واللغات المتنوعة والبيئات الصاخبة.
  2. نموذج LLM "غير المتصل" (Offline): نموذج تأسيسي أكبر يتم استدعاؤه فقط عندما يخرج الاستعلام عن قاعدة المعرفة المحددة للنموذج الصغير.

عندما يواجه النموذج الصغير مشكلة معقدة، فإنه يحاكي الوكيل البشري من خلال وضع المتصل على "الانتظار" لفترة وجيزة للبحث في المشكلة عبر نموذج LLM الأكبر. يضمن هذا النهج الهجين بقاء تجربة المحادثة سلسة حتى عندما يتطلب الأمر تفكيرًا عالي المستوى.

التموضع في السوق والمشهد التنافسي

من خلال جولة تمويل من الفئة A (Series A) بقيمة 13 مليون دولار بقيادة Seligman Ventures — مما يرفع إجمالي التمويل إلى أكثر من 21 مليون دولار — تضع Smallest.ai نفسها كبنية تحتية أساسية لاقتصاد الذكاء الاصطناعي الصوتي. لا تسعى الشركة الناشئة إلى بناء منصات دعم عملاء متكاملة؛ وبدلاً من ذلك، فهي توفر الطبقة الصوتية المتخصصة التي تستخدمها بالفعل شركات مثل RingCentral و Truecaller.

وبينما يركز المنافسون مثل ElevenLabs بشكل كبير على الدبلجة الصوتية والبودكاست، ويستهدف آخرون مثل Cartesia أو Sarvam فئات إقليمية محددة، تركز Smallest.ai بشكل دقيق على وكلاء المحادثة للمؤسسات في الوقت الفعلي. ويجادل Kamath بأن الشركات الناشئة في مجال دعم العملاء مثل Sierra و Decagon، يمثل إتقان الصوت عالي الدقة ومنخفض زمن الاستجابة تشتيتًا عن عملها الأساسي، مما يجعل نموذج Smallest.ai المتخصص القابل للتشغيل الفوري "plug-and-play" ضرورة استراتيجية.

النقاط الرئيسية

  • الكفاءة المتخصصة: تستخدم Smallest.ai نماذج صوتية صغيرة ومخصصة لتحقيق زمن استجابة يقترب من الصفر، متجنبة التأخيرات المتأصلة في نماذج LLM التقليدية واسعة النطاق.
  • الذكاء الهجين: تعتمد الشركة استراتيجية ثنائية النماذج، حيث تستخدم نماذج صغيرة سريعة للتفاعل في الوقت الفعلي ونماذج LLM أكبر لمهام التفكير العميق والمعقدة.
  • التركيز على البنية التحتية: بدلاً من التنافس المباشر مع منصات دعم العملاء، توفر Smallest.ai طبقة تكنولوجيا الصوت الحيوية التي تمكن وكلاء ذكاء اصطناعي أكثر طبيعية وشبه بشرية.

الخلاصة

يمول مبلغ الـ 13 مليون دولار الذي جمعته Smallest.ai مكدس (stack) ذكاء اصطناعي صوتي ثنائي المستويات ومصمم خصيصًا، والذي يستبدل الشمولية التي توفرها نماذج LLM الضخمة بسرعة النماذج الصغيرة المركزة على المهام. الوعد واضح: جعل محادثات الذكاء الاصطناعي تبدو طبيعية مثل التحدث إلى إنسان من خلال القضاء على الوقفة المحرجة التي تحدد حاليًا معظم المساعدات الصوتية. وسيتضح ما إذا كانت الفوائد تفوق الأعباء الهندسية الإضافية عندما تبدأ المؤسسات في دمج هذه التكنولوجيا في تدفقات المكالمات في العالم الحقيقي.