માનવ સંવાદ અને AI વચ્ચેનો તફાવત ઓછો થઈ રહ્યો છે, પરંતુ સાચી ઇમર્સન (immersion) માટે લેટન્સી (latency) હજુ પણ એક મોટો અવરોધ છે. Smallest.ai વિશાળ અને ધીમા LLMs ને બદલે માનવ જ્ઞાનાત્મક પેટર્નને અનુકરણ કરવા માટે રચાયેલ વિશિષ્ટ, અત્યંત ઝડપી સ્મોલ વોઇસ મોડલ્સ તરફ વળીને આ પડકારનો સામનો કરી રહ્યું છે.

Large Language Models ની લેટન્સીથી આગળ વધવું

વર્તમાન AI વોઇસ એજન્ટ્સ ઘણીવાર "પ્રોમ્પ્ટ-ધેન-પ્રોસેસ" (prompt-then-process) વિલંબથી પીડાતા હોય છે. પ્રમાણભૂત LLM વર્કફ્લોમાં, સિસ્ટમ સંપૂર્ણ ઓડિયો ક્લિપની રાહ જુએ છે, ટેક્સ્ટને પ્રોસેસ કરે છે અને પછી પ્રતિસાદ જનરેટ કરે છે. Smallest.ai ના સ્થાપક અને CEO સુદર્શન કામથ નોંધે છે તેમ, આ વિરામ એ સ્પષ્ટ સંકેત છે કે વપરાશકર્તા મશીન સાથે વાત કરી રહ્યો છે.

Smallest.ai નો અભિગમ માનવ ન્યુરોબાયોલોજીનું અનુકરણ કરે છે: સાંભળવું, વિચારવું અને બોલવું તે એકસાથે. તેમનું પ્રોપ્રાયટરી સ્મોલ વોઇસ મોડલ લગભગ શૂન્ય પ્રતિસાદ લેગ સાથે રીઅલ-ટાઇમ ઇન્ટેલિજન્સ હેન્ડલ કરવા માટે રચાયેલ છે. વિશાળ ફાઉન્ડેશનલ મોડલ્સને બદલે નાના, વિશિષ્ટ મોડલ્સ પર ધ્યાન કેન્દ્રિત કરીને, સ્ટાર્ટઅપનો ઉદ્દેશ્ય વિક્ષેપો (interruptions) અને કુદરતી સંવાદ પ્રવાહને સક્ષમ કરવાનો છે, જે અસરકારક રીતે ઝડપ અને સૂક્ષ્મતા દ્વારા "ટ્યુરિંગ ટેસ્ટને તોડવાનું" લક્ષ્ય રાખે છે.

એન્ટરપ્રાઇઝ ઇન્ટેલિજન્સ માટે ડ્યુઅલ-મોડલ આર્કિટેક્ચર

Smallest.ai AI એજન્ટ આર્કિટેક્ચર માટે એક નવો ધોરણ પ્રસ્તાવિત કરી રહ્યું છે. બધું હેન્ડલ કરવા માટે સિંગલ લાર્જ મોડલ પર દબાણ કરવાને બદલે, કંપની બે-સ્તરીય (two-tier) સિસ્ટમની હિમાયત કરે છે:

  1. The Small Voice Model: એક રીઅલ-ટાઇમ ઇન્ટેલિજન્સ લેયર જે લહેકો (accents), વિવિધ ભાષાઓ અને ઘોંઘાટવાળા વાતાવરણ સહિત તાત્કાલિક, પ્રવાહી સંવાદની સૂક્ષ્મતાનું સંચાલન કરે છે.
  2. The "Offline" LLM: એક મોટું ફાઉન્ડેશનલ મોડલ જેને ફક્ત ત્યારે જ બોલાવવામાં આવે છે જ્યારે ક્વેરી સ્મોલ મોડલના વિશિષ્ટ નોલેજ બેઝની બહાર હોય.

જ્યારે સ્મોલ મોડલ કોઈ જટિલ સમસ્યાનો સામનો કરે છે, ત્યારે તે મોટા LLM દ્વારા સમસ્યા પર સંશોધન કરવા માટે કોલરને ક્ષણિક રીતે "હોલ્ડ" પર રાખીને માનવ એજન્ટનું અનુકરણ કરે છે. આ હાઇબ્રિડ અભિગમ સુનિશ્ચિત કરે છે કે જ્યારે ઉચ્ચ-સ્તરીય તર્ક (high-level reasoning) જરૂરી હોય ત્યારે પણ સંવાદનો અનુભવ અવિરત રહે.

માર્કેટ પોઝિશનિંગ અને સ્પર્ધાત્મક લેન્ડસ્કેપ

Seligman Ventures ના નેતૃત્વમાં $13 મિલિયનના સીરીઝ A રાઉન્ડ સાથે — જે કુલ ફંડિંગ $21 મિલિયનથી વધુ લાવે છે — Smallest.ai પોતાને વોઇસ AI ઇકોનોમી માટે આવશ્યક ઇન્ફ્રાસ્ટ્રક્ચર તરીકે સ્થાપિત કરી રહ્યું છે. સ્ટાર્ટઅપ એન્ડ-ટુ-એન્ડ કસ્ટમર સપોર્ટ પ્લેટફોર્મ બનાવવા માંગતું નથી; તેના બદલે, તે વિશિષ્ટ વોઇસ લેયર પૂરું પાડે છે જેનો ઉપયોગ RingCentral અને Truecaller જેવી કંપનીઓ પહેલેથી જ કરી રહી છે.

જ્યારે ElevenLabs જેવા સ્પર્ધકો ઓડિયો ડબિંગ અને પોડકાસ્ટિંગ પર વધુ ધ્યાન કેન્દ્રિત કરે છે, અને Cartesia અથવા Sarvam જેવા અન્ય ચોક્કસ પ્રાદેશિક ક્ષેત્રોને લક્ષ્ય બનાવે છે, ત્યારે Smallest.ai રીઅલ-ટાઇમ એન્ટરપ્રાઇઝ કન્વર્સેશનલ એજન્ટ્સ પર ધ્યાન કેન્દ્રિત કરે છે. કામથ દલીલ કરે છે કે Sierra અને Decagon જેવા કસ્ટમર સપોર્ટ સ્ટાર્ટઅપ્સ માટે, હાઇ-ફિડેલિટી, લો-લેટન્સી વોઇસને સંપૂર્ણ બનાવવું એ તેમના મુખ્ય વ્યવસાયથી વિચલિત થવા જેવું છે, જે Smallest.ai ના વિશિષ્ટ "પ્લગ-એન્ડ-પ્લે" મોડલને વ્યૂહાત્મક જરૂરિયાત બનાવે છે.

મુખ્ય મુદ્દાઓ

  • Specialized Efficiency: Smallest.ai લગભગ શૂન્ય લેટન્સી પ્રાપ્ત કરવા માટે નાના, સમર્પિત વોઇસ મોડલ્સનો ઉપયોગ કરે છે, જે પરંપરાગત મોટા પાયાના LLMs ના આંતરિક વિલંબને ટાળે છે.
  • Hybrid Intelligence: કંપની ડ્યુઅલ-મોડલ વ્યૂહરચના અપનાવે છે, જે રીઅલ-ટાઇમ ઇન્ટરેક્શન માટે ઝડપી સ્મોલ મોડલ્સ અને જટિલ, ઊંડા તર્ક માટે મોટા LLMs નો ઉપયોગ કરે છે.
  • Infrastructure Focus: કસ્ટમર સપોર્ટ પ્લેટફોર્મ સાથે સીધી સ્પર્ધા કરવાને બદલે, Smallest.ai મહત્વપૂર્ણ વોઇસ ટેકનોલોજી લેયર પૂરું પાડે છે જે વધુ કુદરતી, માનવ જેવી AI એજન્ટ્સને સક્ષમ બનાવે છે.

નિષ્કર્ષ

Smallest.ai નું $13 મિલિયનનું ફંડિંગ હેતુપૂર્વક નિર્મિત, બે-સ્તરીય વોઇસ-AI સ્ટેક માટે નાણાં પૂરા પાડે છે જે વિશાળ LLMs ની સાર્વત્રિકતાના બદલે નાના, કાર્ય-કેન્દ્રિત મોડલ્સની ઝડપ પર ધ્યાન કેન્દ્રિત કરે છે. વચન સ્પષ્ટ છે: હાલમાં મોટાભાગના વોઇસ આસિસ્ટન્ટ્સને વ્યાખ્યાયિત કરતા અજીબ વિરામને દૂર કરીને AI સંવાદોને માનવ સાથે વાત કરવા જેટલા કુદરતી બનાવો. તેના ફાયદા વધારાના એન્જિનિયરિંગ ઓવરહેડ કરતા વધુ છે કે નહીં તે એન્ટરપ્રાઇઝ જ્યારે વાસ્તવિક દુનિયાના કોલ ફ્લોમાં આ ટેકનોલોજીને સામેલ કરવાનું શરૂ કરશે ત્યારે સ્પષ્ટ થશે.