मानवी संभाषण आणि AI संवाद यातील अंतर कमी होत आहे, परंतु लेटन्सी (latency) हा खऱ्या अनुभवासाठी (immersion) एक मोठा अडथळा आहे. Smallest.ai या आव्हानाचा सामना करण्यासाठी मोठ्या आणि संथ LLMs ऐवजी मानवी संज्ञानात्मक पद्धतींचे (cognitive patterns) अनुकरण करण्यासाठी डिझाइन केलेल्या विशेष, अतिशय वेगवान लहान व्हॉइस मॉडेल्सचा वापर करत आहे.
Large Language Models च्या लेटन्सीच्या पलीकडे जाणे
सध्याचे AI व्हॉइस एजंट्स अनेकदा "प्रॉम्प्ट-देन-प्रोसेस" (prompt-then-process) विलंबाचा सामना करतात. एका मानक LLM वर्कफ्लोमध्ये, सिस्टम पूर्ण ऑडिओ क्लिपची प्रतीक्षा करते, मजकुरावर प्रक्रिया करते आणि नंतर प्रतिसाद तयार करते. Smallest.ai चे संस्थापक आणि CEO सुदर्शन कामथ यांच्या मते, हा विराम वापरकर्ता मशीनशी बोलत आहे हे स्पष्टपणे दर्शवतो.
Smallest.ai चा दृष्टिकोन मानवी न्यूरोबायोलॉजीचे अनुकरण करतो: एकाच वेळी ऐकणे, विचार करणे आणि बोलणे. त्यांचे मालकीचे (proprietary) लहान व्हॉइस मॉडेल प्रतिसादामध्ये जवळजवळ शून्य विलंब (zero response lag) राखून रिअल-टाइम इंटेलिजन्स हाताळण्यासाठी डिझाइन केलेले आहे. मोठ्या पायाभूत (foundational) मॉडेल्सऐवजी लहान, विशेष मॉडेल्सवर लक्ष केंद्रित करून, हे स्टार्टअप अडथळा न येता (interruptions) आणि नैसर्गिक संभाषणाचा प्रवाह सक्षम करण्याचे उद्दिष्ट ठेवत आहे, ज्याचा प्रभावी उद्देश वेग आणि सूक्ष्मतेद्वारे "ट्युरिंग टेस्ट" (Turing test) पार करणे हा आहे.
एंटरप्राइझ इंटेलिजन्ससाठी दुहेरी-मॉडेल आर्किटेक्चर
Smallest.ai AI एजंट आर्किटेक्चरसाठी एक नवीन मानक प्रस्तावित करत आहे. सर्व काही हाताळण्यासाठी एकाच मोठ्या मॉडेलवर अवलंबून राहण्याऐवजी, कंपनी दोन-स्तरीय प्रणालीचा पुरस्कार करते:
- The Small Voice Model: एक रिअल-टाइम इंटेलिजन्स लेयर जो उच्चार (accents), विविध भाषा आणि गोंगाट असलेल्या वातावरणासह तात्काळ आणि प्रवाही संभाषणाचे बारकावे व्यवस्थापित करतो.
- The "Offline" LLM: एक मोठे पायाभूत मॉडेल, ज्याचा वापर केवळ तेव्हाच केला जातो जेव्हा प्रश्न लहान मॉडेलच्या विशिष्ट ज्ञानकोशाच्या (knowledge base) बाहेर असतो.
जेव्हा लहान मॉडेलला एखादी जटिल समस्या येते, तेव्हा ते मोठ्या LLM द्वारे समस्येचा शोध घेण्यासाठी कॉल करणाऱ्याला थोड्या वेळासाठी "होल्ड" (hold) वर ठेवून मानवी एजंटप्रमाणे वागते. हा हायब्रिड दृष्टिकोन उच्च-स्तरीय तर्काची (reasoning) आवश्यकता असतानाही संभाषणाचा अनुभव अखंड ठेवण्याची खात्री देतो.
मार्केट पोझिशनिंग आणि स्पर्धात्मक परिदृश्य
Seligman Ventures च्या नेतृत्वाखालील $13 दशलक्षच्या Series A राउंडसह—ज्यामुळे एकूण निधी $21 दशलक्षाहून अधिक झाला आहे—Smallest.ai स्वतःला व्हॉइस AI अर्थव्यवस्थेसाठी आवश्यक पायाभूत सुविधा (infrastructure) म्हणून प्रस्थापित करत आहे. हे स्टार्टअप एंड-टू-एंड ग्राहक सेवा प्लॅटफॉर्म तयार करण्याच्या शोधात नाही; त्याऐवजी, ते विशेष व्हॉइस लेयर प्रदान करते ज्याचा वापर RingCentral आणि Truecaller सारख्या कंपन्या आधीच करत आहेत.
ElevenLabs सारखे स्पर्धक ऑडिओ डबिंग आणि पॉडकास्टिंगवर मोठ्या प्रमाणावर लक्ष केंद्रित करतात, तर Cartesia किंवा Sarvam सारखे इतर स्पर्धक विशिष्ट प्रादेशिक क्षेत्रांना लक्ष्य करतात, परंतु Smallest.ai रिअल-टाइम एंटरप्राइझ कन्वर्सेशनल एजंट्सवर पूर्णपणे लक्ष केंद्रित करत आहे. कामथ यांचा असा युक्तिवाद आहे की Sierra आणि Decagon सारख्या ग्राहक सेवा स्टार्टअप्ससाठी, हाय-फिडेलिटी आणि लो-लेटन्सी व्हॉइस पूर्ण करणे हे त्यांच्या मुख्य व्यवसायापासून त्यांचे लक्ष विचलित करणारे आहे, ज्यामुळे Smallest.ai चे विशेष "plug-and-play" मॉडेल एक धोरणात्मक गरज ठरते.
मुख्य निष्कर्ष
- विशेष कार्यक्षमता (Specialized Efficiency): Smallest.ai जवळजवळ शून्य लेटन्सी प्राप्त करण्यासाठी लहान, समर्पित व्हॉइस मॉडेल्सचा वापर करते, ज्यामुळे पारंपारिक मोठ्या प्रमाणावरील LLMs मधील अंगभूत विलंब टाळता येतो.
- हायब्रिड इंटेलिजन्स (Hybrid Intelligence): कंपनी दुहेरी-मॉडेल धोरण अवलंबते, ज्यामध्ये रिअल-टाइम संवादासाठी वेगवान लहान मॉडेल्स आणि जटिल, सखोल तर्कासाठी मोठ्या LLMs चा वापर केला जातो.
- पायाभूत सुविधांवर लक्ष (Infrastructure Focus): ग्राहक सेवा प्लॅटफॉर्मशी थेट स्पर्धा करण्याऐवजी, Smallest.ai महत्त्वपूर्ण व्हॉइस तंत्रज्ञान लेयर प्रदान करते जो अधिक नैसर्गिक, मानवासारखे AI एजंट सक्षम करतो.
सारांश
Smallest.ai कडून उभारण्यात आलेले $13 दशलक्ष हे एका विशिष्ट, दोन-स्तरीय व्हॉइस-AI स्टॅकसाठी वापरले जातील, जो मोठ्या LLMs च्या सार्वत्रिकतेऐवजी लहान, कार्य-केंद्रित मॉडेल्सच्या वेगाला प्राधान्य देतो. याचे आश्वासन स्पष्ट आहे: सध्या बहुतेक व्हॉइस असिस्टंट्समध्ये आढळणारा विचित्र विराम काढून टाकून, AI संवाद मानवाशी बोलण्याइतका नैसर्गिक बनवणे. या तंत्रज्ञानामुळे मिळणारे फायदे वाढीव इंजिनिअरिंग ओव्हरहेडपेक्षा जास्त आहेत की नाही, हे एंटरप्राइजेस जेव्हा या तंत्रज्ञानाचा वापर वास्तविक कॉल फ्लोमध्ये करण्यास सुरुवात करतील तेव्हा स्पष्ट होईल.
