മനുഷ്യ സംഭാഷണങ്ങളും AI ഇടപെടലുകളും തമ്മിലുള്ള അകലം കുറഞ്ഞുവരികയാണെങ്കിലും, യഥാർത്ഥമായ സ്വാഭാവികതയ്ക്ക് (immersion) കാലതാമസം (latency) ഇപ്പോഴും ഒരു വലിയ തടസ്സമാണ്. വൻതോതിലുള്ള, സാവധാനത്തിലുള്ള LLM-കൾക്ക് പകരം മനുഷ്യന്റെ ചിന്താ രീതികളെ അനുകരിക്കുന്ന പ്രത്യേകതരം, അതിവേഗത്തിലുള്ള ചെറിയ വോയ്‌സ് മോഡലുകളിലേക്ക് മാറിക്കൊണ്ട് Smallest.ai ഈ വെല്ലുവിളി നേരിടുന്നു.

Large Language Models-ന്റെ കാലതാമസം മറികടക്കുന്നു

നിലവിലെ AI വോയ്‌സ് ഏജന്റുകൾ പലപ്പോഴും "പ്രോംപ്റ്റ്-എന്നിട്ട്-പ്രോസസ്സ്" (prompt-then-process) എന്ന രീതിയിലുള്ള കാലതാമസം നേരിടാറുണ്ട്. ഒരു സാധാരണ LLM പ്രവർത്തനരീതിയിൽ, സിസ്റ്റം ഒരു ഓഡിയോ ക്ലിപ്പ് പൂർത്തിയാകുന്നത് വരെ കാത്തിരിക്കുകയും, തുടർന്ന് ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യുകയും, അതിനുശേഷം മറുപടി നൽകുകയും ചെയ്യുന്നു. Smallest.ai സ്ഥാപകനും CEOയുമായ സുദർശൻ കാമത്ത് നിരീക്ഷിക്കുന്നത് പോലെ, ഈ ഇടവേള ഒരു ഉപയോക്താവ് സംസാരിക്കുന്നത് ഒരു മെഷീനോടാണെന്ന് വ്യക്തമാക്കുന്ന ഒന്നാണ്.

Smallest.ai-യുടെ സമീപനം മനുഷ്യന്റെ നാഡീവ്യവസ്ഥയെ (neurobiology) അനുകരിക്കുന്നു: ഒരേസമയം കേൾക്കുക, ചിന്തിക്കുക, സംസാരിക്കുക എന്നിവയാണ് ഇതിന്റെ രീതി. അവരുടെ ഉടമസ്ഥതയിലുള്ള ചെറിയ വോയ്‌സ് മോഡൽ, മറുപടി നൽകുന്നതിൽ പ്രായോഗികമായി കാലതാമസം ഇല്ലാതെ തത്സമയ ബുദ്ധിശക്തി (real-time intelligence) കൈകാര്യം ചെയ്യാൻ രൂപകൽപ്പന ചെയ്തിട്ടുള്ളതാണ്. വൻതോതിലുള്ള ഫൗണ്ടേഷണൽ മോഡലുകൾക്ക് പകരം ചെറിയ, പ്രത്യേകതരം മോഡലുകളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നതിലൂടെ, സംഭാഷണത്തിനിടയിൽ തടസ്സങ്ങൾ വരുത്താനും സ്വാഭാവികമായ സംഭാഷണ ഒഴുക്ക് നിലനിർത്താനും ഈ സ്റ്റാർട്ടപ്പ് ലക്ഷ്യമിടുന്നു. വേഗതയിലൂടെയും സൂക്ഷ്മതയിലൂടെയും "ട്യൂറിംഗ് ടെസ്റ്റ്" (Turing test) മറികടക്കുക എന്നതാണ് ഇവരുടെ ലക്ഷ്യം.

എന്റർപ്രൈസ് ഇന്റലിജൻസിനായി ഒരു ഡ്യുവൽ-മോഡൽ ആർക്കിടെക്ചർ

AI ഏജന്റ് ആർക്കിടെക്ചറിനായി Smallest.ai ഒരു പുതിയ മാനദണ്ഡം നിർദ്ദേശിക്കുന്നു. എല്ലാ കാര്യങ്ങളും കൈകാര്യം ചെയ്യാൻ ഒരു വലിയ മോഡലിനെ നിർബന്ധിക്കുന്നതിന് പകരം, കമ്പനി ഒരു രണ്ട് തട്ടുകളുള്ള (two-tier) സംവിധാനത്തിനായി വാദിക്കുന്നു:

  1. The Small Voice Model: സംസാരശൈലികൾ (accents), വിവിധ ഭാഷകൾ, ശബ്ദകോലാഹലമുള്ള സാഹചര്യങ്ങൾ എന്നിവയുൾപ്പെടെയുള്ള തത്സമയ സംഭാഷണ സൂക്ഷ്മതകൾ കൈകാര്യം ചെയ്യുന്ന ഒരു റിയൽ-ടൈം ഇന്റലിജൻസ് ലെയർ.
  2. The "Offline" LLM: ഒരു ചോദ്യം ചെറിയ മോഡലിന്റെ അറിവിനും അപ്പുറമാണെങ്കിൽ മാത്രം ഉപയോഗിക്കുന്ന വലിയൊരു ഫൗണ്ടേഷണൽ മോഡൽ.

ചെറിയ മോഡലിന് ഒരു സങ്കീർണ്ണമായ പ്രശ്നം നേരിടേണ്ടി വരുമ്പോൾ, വലിയ LLM ഉപയോഗിച്ച് ആ വിഷയം ഗവേഷണം ചെയ്യുന്നതിനായി കോളർ ചെയ്യുന്ന വ്യക്തിയെ ഒരു നിമിഷം "ഹോൾഡിൽ" (hold) വെച്ചുകൊണ്ട് ഒരു മനുഷ്യ ഏജന്റിനെപ്പോലെ അത് പ്രവർത്തിക്കുന്നു. ഈ ഹൈബ്രിഡ് സമീപനം, ഉയർന്ന തലത്തിലുള്ള യുക്തിപരമായ ചിന്ത ആവശ്യമായി വരുമ്പോഴും സംഭാഷണ അനുഭവം തടസ്സമില്ലാതെ തുടരുന്നുവെന്ന് ഉറപ്പാക്കുന്നു.

മാർക്കറ്റ് പൊസിഷനിംഗും മത്സര സാഹചര്യവും

Seligman Ventures നയിച്ച 13 മില്യൺ ഡോളറിന്റെ സീരീസ് എ റൗണ്ട് വഴി ആകെ ഫണ്ടിംഗ് 21 മില്യൺ ഡോളറിലധികം എത്തിയിട്ടുള്ള Smallest.ai, വോയ്‌സ് AI സമ്പദ്‌വ്യവസ്ഥയുടെ അവിഭാജ്യമായ ഇൻഫ്രാസ്ട്രക്ചറായി സ്വയം മാറുകയാണ്. ഉപഭോക്തൃ സേവന പ്ലാറ്റ്‌ഫോമുകൾ (end-to-end customer support platforms) നിർമ്മിക്കുകയല്ല ഈ സ്റ്റാർട്ടപ്പ് ലക്ഷ്യമിടുന്നത്; പകരം RingCentral, Truecaller തുടങ്ങിയ കമ്പനികൾ നിലവിൽ ഉപയോഗിക്കുന്ന സവിശേഷമായ വോയ്‌സ് ലെയർ ആണ് ഇത് നൽകുന്നത്.

ElevenLabs പോലുള്ള എതിരാളികൾ ഓഡിയോ ഡബ്ബിംഗിലും പോഡ്കാസ്റ്റിംഗിലും ശ്രദ്ധ കേന്ദ്രീകരിക്കുമ്പോൾ, Cartesia അല്ലെങ്കിൽ Sarvam പോലുള്ളവ പ്രത്യേക പ്രാദേശിക മേഖലകളെ ലക്ഷ്യം വെക്കുമ്പോൾ, Smallest.ai തത്സമയ എന്റർപ്രൈസ് കൺവർസേഷണൽ ഏജന്റുകളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു. Sierra, Decagon തുടങ്ങിയ കസ്റ്റമർ സപ്പോർട്ട് സ്റ്റാർട്ടപ്പുകൾക്ക് ഉയർന്ന നിലവാരമുള്ളതും കുറഞ്ഞ കാലതാമസമുള്ളതുമായ വോയ്‌സ് സാങ്കേതികവിദ്യ വികസിപ്പിക്കുന്നത് അവരുടെ പ്രധാന ബിസിനസ്സിൽ നിന്ന് ശ്രദ്ധ തിരിക്കുന്നതിന് തുല്യമാണെന്നും, അതിനാൽ Smallest.ai-യുടെ "പ്ലഗ്-ആൻ-പ്ലേ" (plug-and-play) മോഡൽ ഒരു തന്ത്രപരമായ ആവശ്യമാണെന്നും കാമത്ത് വാദിക്കുന്നു.

പ്രധാന കാര്യങ്ങൾ

  • Specialized Efficiency: പരമ്പരാഗത വലിയ LLM-കളുടെ കാലതാമസം ഒഴിവാക്കി, ഏതാണ്ട് പൂജ്യം കാലതാമസം കൈവരിക്കുന്നതിനായി Smallest.ai ചെറിയ, പ്രത്യേകതരം വോയ്‌സ് മോഡലുകൾ ഉപയോഗിക്കുന്നു.
  • Hybrid Intelligence: തത്സമയ സംഭാഷണങ്ങൾക്കായി വേഗതയേറിയ ചെറിയ മോഡലുകളും, സങ്കീർണ്ണമായ കാര്യങ്ങൾക്കായി വലിയ LLM-കളും ഉപയോഗിച്ചുകൊണ്ട് കമ്പനി ഒരു ഡ്യുവൽ-മോഡൽ തന്ത്രം അവലംബിക്കുന്നു.
  • Infrastructure Focus: കസ്റ്റമർ സപ്പോർട്ട് പ്ലാറ്റ്‌ഫോമുകളുമായി നേരിട്ട് മത്സരിക്കുന്നതിന് പകരം, കൂടുതൽ സ്വാഭാവികവും മനുഷ്യസമാനവുമായ AI ഏജന്റുകളെ സാധ്യമാക്കുന്ന നിർണ്ണായകമായ വോയ്‌സ് ടെക്നോളജി ലെയർ ആണ് Smallest.ai നൽകുന്നത്.

ചുരുക്കത്തിൽ

Smallest.ai-യുടെ 13 മില്യൺ ഡോളറിന്റെ ഫണ്ടിംഗ്, വൻതോതിലുള്ള LLM-കളുടെ സാർവത്രികതയ്ക്ക് പകരം ചെറിയ, ദൗത്യങ്ങളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്ന മോഡലുകളുടെ വേഗതയ്ക്ക് മുൻഗണന നൽകുന്ന ഒരു പ്രത്യേക വോയ്‌സ്-AI സ്റ്റാക്കിനായി ഉപയോഗിക്കുന്നു. വാഗ്ദാനം വ്യക്തമാണ്: നിലവിൽ മിക്ക വോയ്‌സ് അസിസ്റ്റന്റുകളുടെയും പ്രത്യേകതയായി മാറിയ ആ അസ്വാഭാവികമായ ഇടവേളകൾ ഒഴിവാക്കി, AI സംഭാഷണങ്ങൾ ഒരു മനുഷ്യനോട് സംസാരിക്കുന്നത് പോലെ സ്വാഭാവികമാക്കുക. ഈ സാങ്കേതികവിദ്യ ഉപയോഗിക്കുന്നത് മൂല്യവർദ്ധിതമാണോ അതോ അധിക എഞ്ചിനീയറിംഗ് ചെലവ് വരുത്തുമോ എന്നത് സംരംഭങ്ങൾ ഇത് യഥാർത്ഥ ലോകത്തെ കോൾ ഫ്ലോകളിൽ (call flows) ഉൾപ്പെടുത്തുന്നതിലൂടെ വ്യക്തമാകും.