Spotify അതിന്റെ ആപ്പിൽ നേരിട്ട് അത്യാധുനിക AI വോയ്‌സ്, ടെക്സ്റ്റ് സൗകര്യങ്ങൾ ഉൾപ്പെടുത്തിക്കൊണ്ട് മ്യൂസിക് പ്ലെയറിനെ ഒരു സംഭാഷണ പങ്കാളിയാക്കി മാറ്റുകയാണ്. ഈ നീക്കം കേവലം പാട്ടുകൾ കേൾക്കുന്നതിൽ നിന്ന് സ്വാഭാവിക ഭാഷാ പ്രക്രിയയിലൂടെ (natural language processing) കൂടുതൽ ആഴത്തിലുള്ള ഇടപെടലുകൾ സാധ്യമാക്കുന്ന ഒരു സംഭാഷണ രീതിയിലേക്ക് അനുഭവം മാറ്റുന്നു.

ഓഡിയോയ്ക്കായുള്ള ഒരു സംഭാഷണ കമാൻഡ് സെന്റർ

ലളിതമായ "play", "pause" കമാൻഡുകൾക്ക് അപ്പുറം, Spotify-യുടെ പുതിയ ബീറ്റ (beta) പ്രീമിയം സബ്‌സ്‌ക്രൈബർമാർക്ക് "ഞാൻ ഇതുവരെ കേൾക്കാത്ത ചില കലാകാരന്മാരെ പ്ലേ ചെയ്യൂ," "ഇത് കുറച്ചുകൂടി ഉന്മേഷദായകമാക്കൂ," അല്ലെങ്കിൽ "അദ്ദേഹത്തിന്റെ പുതിയ പാട്ടുകൾ മാത്രം പ്ലേ ചെയ്യൂ" എന്നിങ്ങനെയുള്ള സൂക്ഷ്മമായ നിർദ്ദേശങ്ങൾ നൽകാൻ അനുവദിക്കുന്നു. ഉപയോക്താവിന്റെ ഉദ്ദേശ്യം മനസ്സിലാക്കാനും, ശൈലികൾ തിരിച്ചറിയാനും, പ്രത്യേക കലാകാരന്മാരെ കണ്ടെത്താനും ഈ ഫീച്ചർ Large Language Models (LLMs) ഉപയോഗിക്കുന്നു. പ്ലേബാക്ക് വ്യൂവിൽ തന്നെ ഇത് ലഭ്യമാക്കുന്നതിലൂടെ, സംഗീതത്തിന്റെ മൂഡും പുതിയ കണ്ടെത്തലുകളും മനസ്സിലാക്കുന്ന ഒരു പേഴ്സണൽ AI DJ ആയി Spotify തന്റെ ആപ്പിനെ മാറ്റുന്നു.

ലിസണിംഗ് ഹിസ്റ്ററിയുമായും പൊതുവിജ്ഞാനവുമായും ഉള്ള ആഴത്തിലുള്ള സംയോജനം

ഈ ഇന്റർഫേസ് പ്ലേബാക്ക് നിയന്ത്രിക്കുന്നതിലുപരി ഒരു വിജ്ഞാന എൻജിനായി പ്രവർത്തിക്കുന്നു. "ഞാൻ ഈ പാട്ട് ആദ്യമായി എപ്പോഴാണ് കേട്ടത്?" എന്നതുപോലുള്ള ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാൻ ഇത് ഉപയോക്താവിന്റെ ലിസണിംഗ് ഹിസ്റ്ററി ഉപയോഗിക്കുന്നു. വ്യക്തിഗത ഡാറ്റയും ജനറേറ്റീവ് AI-യും തമ്മിലുള്ള ഈ സംയോജനം മറ്റ് സ്ട്രീമിംഗ് സേവനങ്ങളിൽ ഇല്ലാത്ത ഒരു ഹൈപ്പർ-പേഴ്സണലൈസ്ഡ് സൗകര്യം ഒരുക്കുന്നു.

പൊതുവിജ്ഞാന സംബന്ധമായ ചോദ്യങ്ങളും ഈ AI കൈകാര്യം ചെയ്യുന്നു—"Odyssey എഴുതിയത് എന്നാണ്?" എന്ന് ചോദിച്ചാൽ ആപ്പിൽ തന്നെ ഉത്തരം ലഭിക്കും. എന്നാൽ, നിലവിലെ LLM-കളുടെ ഒരു വെല്ലുവിളിയായ AI ഹാലുസിനേഷൻസ് (AI hallucinations) വഴി തെറ്റായ വിവരങ്ങൾ നൽകാനുള്ള സാധ്യതയും ഇതിനോടൊപ്പമുണ്ട്.

AI-ജനറേറ്റഡ് കണ്ടന്റ് ഇക്കോസിസ്റ്റത്തിലൂടെയുള്ള യാത്ര

ജനറേറ്റീവ് ഓഡിയോയുമായി പ്ലാറ്റ്‌ഫോം പോരാടിക്കൊണ്ടിരിക്കുന്ന സാഹചര്യത്തിലാണ് Spotify സംഭാഷണ AI രംഗത്തേക്ക് കടന്നുവരുന്നത്. ഒരു വശത്ത്, ക്രിയേറ്റർമാർക്ക് ഉയർന്ന നിലവാരമുള്ള AI-ജനറേറ്റഡ് ശബ്ദങ്ങൾ ഉപയോഗിച്ച് ഓഡിയോബുക്കുകൾ പ്രസിദ്ധീകരിക്കാൻ ElevenLabs-മായി അവർ പങ്കാളികളാകുന്നു.

മറുവശത്ത്, റെക്കമെൻഡേഷൻസിന്റെ വിശ്വാസ്യതയെ ബാധിക്കുന്ന AI-ജനറേറ്റഡ് പാട്ടുകളുടെയും ബോട്ട് ഉപയോഗിച്ചുള്ള കൃത്രിമമായ ബൂസ്റ്റുകളുടെയും പ്രവാഹത്തോട് Spotify പോരാടുന്നു. ഔദ്യോഗികവും ഉപയോഗപ്രദവുമായ ഒരു വോയ്‌സ് ഫീച്ചർ നൽകുന്നതിലൂടെ, നിയന്ത്രണമില്ലാത്ത ഓട്ടോമേറ്റഡ് കണ്ടന്റുകൾക്ക് പകരം വിശ്വസനീയമായ AI ഇടപെടലുകളിലേക്ക് ഉപയോക്താക്കളെ Spotify നയിക്കുന്നു.

ഓഡിയോ ഡിസ്കവറിയുടെ ഭാവി വിപുലീകരിക്കൽ

യുണൈറ്റഡ് സ്റ്റേറ്റ്സ്, അയർലൻഡ്, സ്വീഡൻ എന്നിവിടങ്ങളിലെ 18 വയസ്സും അതിനുമുകളമുള്ള ഉപയോക്താക്കൾക്കായി ഈ ബീറ്റ ആരംഭിച്ചിരിക്കുന്നു. ആഗോളതലത്തിൽ പുറത്തിറക്കുന്നതിന് മുമ്പ് അതിന്റെ ലാംഗ്വേജ് മോഡലുകൾ പരിഷ്കരിക്കാൻ ഈ പരിമിതമായ വിന്യാസം Spotify-യെ സഹായിക്കുന്നു. വലിയ AI മേഖലയെ സംബന്ധിച്ചിടത്തോളം, ഉപഭോക്തൃ സാങ്കേതിക വമ്പന്മാർ എങ്ങനെയാണ് ഉപയോക്താക്കളെ നിലനിർത്തുന്നതിനായി നിലവിലുള്ള ഉൽപ്പന്നങ്ങളിൽ LLM-കൾ ഉൾപ്പെടുത്തുന്നത് എന്നതിന്റെ ഒരു പഠനമാണിത്.

പ്രധാന കാര്യങ്ങൾ

  • ഇന്ററാക്ടീവ് ഡിസ്കവറി: സ്വാഭാവിക ഭാഷയിലുള്ള നിർദ്ദേശങ്ങളിലൂടെ മൂഡ്, ജനറ, കലാകാരന്മാർ എന്നിവരനുസരിച്ച് പ്ലേബാക്ക് ക്രമീകരിക്കാൻ ഉപയോക്താക്കൾക്ക് സാധിക്കുന്നു.
  • പേഴ്സണലൈസ്ഡ് ഡാറ്റ ഇൻസൈറ്റുകൾ: കാലാനുസൃതമായ വിവരങ്ങൾ നൽകുന്നതിനായി AI ഉപയോക്താവിന്റെ ലിസണിംഗ് ഹിസ്റ്ററി പരിശോധിക്കുന്നു.
  • ഹൈബ്രിഡ് കണ്ടന്റ് സ്ട്രാറ്റജി: ക്രിയേറ്റർമാർക്കായി AI ടൂളുകളെ (ElevenLabs) സ്വീകരിക്കുന്നതോടൊപ്പം തന്നെ AI-ജനറേറ്റഡ് ബോട്ട് സ്പാം തടയാനും Spotify ശ്രമിക്കുന്നു.

യുണൈറ്റഡ് സ്റ്റേറ്റ്സ്, അയർലൻഡ്, സ്വീഡൻ എന്നിവിടങ്ങളിലെ പ്രീമിയം സബ്‌സ്‌ക്രൈബർമാർക്കായി Spotify ഒരു ബീറ്റ-ഒൺലി AI വോയ്‌സ് അസിസ്റ്റന്റ് പുറത്തിറക്കി. "ഞാൻ ഇതുവരെ കേൾക്കാത്ത എന്തെങ്കിലും പ്ലേ ചെയ്യൂ" അല്ലെങ്കിൽ "ഈ ട്രാക്ക് ഞാൻ ആദ്യമായി കേട്ടത് എപ്പോഴാണെന്ന് കാണിച്ചുതരാമോ" എന്നിങ്ങനെ ആപ്പോട് സംസാരിക്കാൻ ഈ ഫീച്ചർ ഉപയോക്താക്കളെ അനുവദിക്കുന്നു. മ്യൂസിക് സ്ട്രീമിംഗ് എന്നത് വെറുമൊരു ബട്ടൺ പ്രസ്സ് എന്നതിലുപരി ഒരു സംഭാഷണം പോലെ തോന്നിപ്പിക്കാനാണ് ഇത് ലക്ഷ്യമിടുന്നത്.

ഈ നീക്കം ഇപ്പോൾ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

ശ്രോതാക്കളെ ആപ്പിൽ നിലനിർത്താൻ Spotify കാലങ്ങളായി അൽഗോരിതമിക് പ്ലേലിസ്റ്റുകളെയും ലളിതമായ വോയ്‌സ് കമാൻഡുകളെയും ആണ് ആശ്രയിച്ചിരുന്നത്. പ്ലേബാക്ക് സ്ക്രീനിൽ നേരിട്ട് ഒരു ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) ഉൾപ്പെടുത്തുന്നത് ആ പാസീവ് ടൂളുകളെ സൂക്ഷ്മമായ ആവശ്യങ്ങൾ മനസ്സിലാക്കാൻ കഴിയുന്ന ഒരു conversational DJ ആയി മാറ്റുന്നു.

സംഭാഷണത്തിന് പിന്നിലെ സാങ്കേതികവിദ്യ

പ്രീമിയം പ്ലാൻ ഉപയോഗിക്കുന്ന 18 വയസ്സോ അതിനുമുകളിലോ പ്രായമുള്ള ഉപയോക്താക്കൾക്ക് മാത്രമാണ് ഈ ബീറ്റ ലഭ്യമാകുന്നത്. ഒരു ഉപയോക്താവ് ഒരു നിർദ്ദേശം സംസാരിക്കുകയോ ടൈപ്പ് ചെയ്യുകയോ ചെയ്യുമ്പോൾ, LLM അതിന്റെ ഉദ്ദേശ്യം വിശകലനം ചെയ്യുകയും വ്യക്തിഗത ലിസണിംഗ് ഹിസ്റ്ററിയുമായി താരതമ്യം ചെയ്യുകയും തുടർന്ന് ഒരു പ്ലേബാക്ക് ക്യൂവോ വസ്തുതാപരമായ ഉത്തരമോ നൽകുകയും ചെയ്യുന്നു. "ഞാൻ ഈ പാട്ട് ആദ്യമായി എപ്പോഴാണ് കേട്ടത്?" എന്നതുപോലുള്ള വ്യക്തിഗത ചോദ്യങ്ങൾക്കും "Odyssey എഴുതിയത് എന്നാണ്?" എന്നതുപോലുള്ള പൊതുവിജ്ഞാന ചോദ്യങ്ങൾക്കും ഈ മോഡലിന് ഉത്തരം നൽകാൻ കഴിയും. ഉപയോക്താക്കൾ സാധാരണയായി പ്ലേ, പോസ് അല്ലെങ്കിൽ സ്കിപ്പ് ബട്ടണുകൾ ഉപയോഗിക്കുന്ന അതേ സ്ക്രീനിൽ തന്നെ ഇതെല്ലാം സംഭവിക്കുന്നു.

ലളിതമായ കമാൻഡുകളിൽ നിന്ന് സന്ദർഭോചിതമായ കണ്ടെത്തലുകളിലേക്ക്

സ്ട്രീമിംഗ് പ്ലാറ്റ്‌ഫോമുകളിലെ മുൻപത്തെ വോയ്‌സ് ഇന്റഗ്രേഷനുകൾ "play — Taylor Swift" അല്ലെങ്കിൽ "skip" തുടങ്ങിയ കമാൻഡുകളിൽ പരിമിതമായിരുന്നു. Spotify-യുടെ പുതിയ അസിസ്റ്റന്റ് അതിനപ്പുറം പോകുന്നു: ഇതിന് മൂഡ് ക്രമീകരിക്കാനും ("make it more upbeat"), പരിചിതമല്ലാത്തവ ഫിൽട്ടർ ചെയ്യാനും ("play artists I haven't heard before"), പ്രത്യേക കാറ്റലോഗ് വിഭാഗങ്ങൾ കണ്ടെത്താനും ("just his recent stuff") സാധിക്കും. ഇത്തരം ബഹുതല നിർദ്ദേശങ്ങൾ വ്യാഖ്യാനിക്കുന്നതിലൂടെ, ഓരോ ഇടപെടലിൽ നിന്നും പഠിക്കുന്ന ഒരു പേഴ്സണൽ ക്യൂറേറ്ററായി AI പ്രവർത്തിക്കുന്നു.

ക്രിയേറ്റർമാർക്കും പ്ലാറ്റ്‌ഫോമിനും ലഭിക്കുന്ന ഗുണങ്ങൾ

ഓഡിയോബുക്കുകൾക്കായി AI ഉപയോഗിച്ച് നിർമ്മിച്ച വിവരണങ്ങൾ (narration) നൽകുന്ന ഒരു വോയ്‌സ്-സിന്തസിസ് കമ്പനിയുമായുള്ള പങ്കാളിത്തം Spotify ശക്തമാക്കുകയാണ്. ക്രിയേറ്റർമാർക്ക് കുറഞ്ഞ ചിലവിൽ വേഗത്തിൽ പ്രസിദ്ധീകരിക്കാൻ സഹായിക്കുന്ന ജനറേറ്റീവ് ഓഡിയോ ടൂളുകൾ സ്വീകരിക്കാൻ ഈ സേവനം തയ്യാറാണെന്ന് ഈ സഹകരണം കാണിക്കുന്നു. അതേസമയം, ഗുണനിലവാരമില്ലാത്ത AI-നിർമ്മിത ഗാനങ്ങളുടെയും, റെക്കമെൻഡേഷൻ എൻജിന്റെ വിശ്വാസ്യതയെ ബാധിക്കുന്ന ബോട്ട് അധിഷ്ഠിത "ആർട്ടിഫിഷ്യൽ ബൂസ്റ്റുകളുടെയും" (artificial boosts) പ്രവാഹത്തെ കമ്പനി നേരിട്ടുകൊണ്ടിരിക്കുകയാണ്. ഔദ്യോഗികവും ഉയർന്ന ഉപയോഗക്ഷമതയുള്ളതുമായ ഒരു AI ഫീച്ചർ നൽകുന്നത്, ഉപയോക്താക്കളെ വിശ്വസനീയമായ ഇടപെടലുകളിലേക്ക് നയിക്കാനും പരിശോധിക്കപ്പെടാത്ത സ്പാം ഉള്ളടക്കങ്ങളിൽ നിന്ന് അകറ്റാനും സഹായിക്കും.

അപകടസാധ്യതകളും ഹാളുസിനേഷൻ (hallucination) പ്രശ്നവും

LLM-കൾക്ക് "ഹാളുസിനേഷനുകൾ" (hallucinations) ഉണ്ടാക്കാൻ കഴിയും - അതായത് വസ്തുതാപരമായി തെറ്റായതും എന്നാൽ ആത്മവിശ്വാസത്തോടെ പറയുന്നതുമായ ഉത്തരങ്ങൾ. ഒരു ഉപയോക്താവ് ചരിത്രപരമായ ഒരു ചോദ്യം ചോദിക്കുമ്പോൾ, അസിസ്റ്റന്റ് തെറ്റായ തീയതിയോ അല്ലെങ്കിൽ തെറ്റായ വിവരമോ നൽകിയേക്കാം. ശ്രോതാക്കൾ വിവരങ്ങൾ വീണ്ടും പരിശോധിക്കാതെ സ്വീകരിച്ചേക്കാവുന്ന ഒരു മ്യൂസിക് ആപ്പിൽ ഈ അപകടസാധ്യത വർദ്ധിക്കുന്നു. ഇത്തരം തെറ്റുകൾ എങ്ങനെ ഫിൽട്ടർ ചെയ്യുമെന്നോ തിരുത്തുമെന്നോ Spotify വെളിപ്പെടുത്തിയിട്ടില്ല, ഇത് പെട്ടെന്നുള്ള അറിവ് നൽകുമെന്ന വാഗ്ദാനവും ഇടയ്ക്കിടെ ഉണ്ടാകുന്ന തെറ്റായ വിവരങ്ങളും തമ്മിലുള്ള ഒരു വിടവ് സൃഷ്ടിക്കുന്നു.

സ്റ്റേക്ക്‌ഹോൾഡർമാരുടെ മേലുള്ള സ്വാധീനം

  • പ്രീമിയം ഉപയോക്താക്കൾക്ക് അവരുടെ ലൈബ്രറികൾ കൂടുതൽ മികച്ച രീതിയിൽ പര്യവേക്ഷണം ചെയ്യാൻ കൂടുതൽ സംവേദനാത്മകമായ (interactive) മാർഗ്ഗങ്ങൾ ലഭിക്കുന്നു, ഇത് സംതൃപ്തി വർദ്ധിപ്പിക്കാനും സേവനം ഉപേക്ഷിക്കുന്നത് കുറയ്ക്കാനും സഹായിച്ചേക്കാം.
  • കലാകാരന്മാർക്കും അവകാശികൾക്കും (rights holders), ശ്രോതാവിന്റെ മൂഡിന് അനുയോജ്യമായ ഗാനങ്ങൾ AI കണ്ടെത്തി നൽകുകയാണെങ്കിൽ കൂടുതൽ കൃത്യമായ പ്രശസ്തി ലഭിച്ചേക്കാം, എന്നാൽ റോയൽറ്റി കണക്കുകൂട്ടലുകളെ ബാധിക്കുന്ന AI-നിർമ്മിത ഗാനങ്ങൾ അവർക്ക് വെല്ലുവിളിയായേക്കാം.
  • മത്സരാർത്ഥികൾക്ക്, ഉപഭോക്താക്കൾക്ക് നേരിട്ട് ഉപയോഗിക്കാവുന്ന ഉൽപ്പന്നങ്ങളിൽ LLM-കൾ എങ്ങനെ ഉൾപ്പെടുത്താം എന്നതിന് ഇപ്പോൾ ഒരു വ്യക്തമായ ഉദാഹരണം ലഭിച്ചിരിക്കുന്നു. ഇത് സ്റ്റാറ്റിക് മെനുകളിലോ പരിമിതമായ വോയ്‌സ് കമാൻഡുകളിലോ മാത്രം ആശ്രയിക്കുന്ന സേവനങ്ങൾക്ക് വലിയൊരു വെല്ലുവിളിയാണ്.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

Spotify-യുടെ ഈ സേവനം മൂന്ന് വിപണികളിൽ മാത്രമാണ് നിലവിൽ ലഭ്യമാക്കിയിരിക്കുന്നത്. ഇത് ഉപയോക്താക്കളുടെ ഉദ്ദേശ്യം തിരിച്ചറിയുന്നതിനും (intent detection), ഹാളുസിനേഷനുകൾ കുറയ്ക്കുന്നതിനും, അസിസ്റ്റന്റ് എത്രത്തോളം അധികം ശ്രവണ സമയം (listening time) വർദ്ധിപ്പിക്കുന്നു എന്ന് അളക്കുന്നതിനും കമ്പനിയെ സഹായിക്കുന്നു. ബീറ്റാ പതിപ്പ് മികച്ച ഫലം കാണിക്കുകയാണെങ്കിൽ, ഇത് ലോകമെമ്പാടും വ്യാപിപ്പിക്കാൻ സാധ്യതയുണ്ട്. വ്യക്തിഗത ഡാറ്റ ഉപയോഗവും AI അധിഷ്ഠിത പേഴ്സണലൈസേഷനും തമ്മിലുള്ള വ്യത്യാസം കുറഞ്ഞു വരുന്ന സാഹചര്യത്തിൽ റെഗുലേറ്റർമാരും ഇതിൽ താൽപ്പര്യം കാണിച്ചേക്കാം; ഏതൊരു പിഴവും സ്വകാര്യതാ പരിശോധനകൾക്ക് കാരണമായേക്കാം.

വിപരീത വാദം: സംഭാഷണ രീതി ശരിക്കും ആവശ്യമാണോ?

മിക്ക ശ്രോതാക്കൾക്കും സംഗീതം കണ്ടെത്താൻ നിലവിൽ കാര്യക്ഷമമായ മാർഗ്ഗങ്ങളുണ്ട് - പേഴ്സണലൈസ്ഡ് പ്ലേലിസ്റ്റുകൾ, ക്യൂറേറ്റഡ് എഡിറ്റോറിയൽ ലിസ്റ്റുകൾ, Spotify-യുമായി സംയോജിപ്പിച്ചിട്ടുള്ള തേർഡ് പാർട്ടി അസിസ്റ്റന്റുകൾ എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു എന്ന് വിമർശകർ വാദിക്കുന്നു. ടൈപ്പ് ചെയ്യുന്നതിനോ സംസാരിക്കുന്നതിനോ പകരം വേഗത്തിലുള്ള ടാപ്പുകൾ ഇഷ്ടപ്പെടുന്ന ഉപയോക്താക്കൾക്ക് ഒരു സംഭാഷണ രീതി (conversational layer) അനുഭവത്തെ സങ്കീർണ്ണമാക്കിയേക്കാം. കൂടാതെ, വലിയ തോതിൽ LLM-കൾ പ്രവർത്തിപ്പിക്കാനുള്ള കമ്പ്യൂട്ടേഷണൽ ചിലവ് പ്രവർത്തനച്ചെലവ് വർദ്ധിപ്പിക്കുകയും അത് ഒടുവിൽ സബ്‌സ്‌ക്രിപ്ഷൻ നിരക്കുകളെ ബാധിക്കുകയും ചെയ്തേക്കാം.

ചുരുക്കം

ഒരു സാധാരണ മ്യൂസിക് പ്ലെയറിനെ സംവേദനാത്മകമായ ഒരു ഡിസ്കവറി ടൂളായി മാറ്റാൻ ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ ഒരു കൺസ്യൂമർ ആപ്പിൽ ഉൾപ്പെടുത്താമെന്ന് Spotify-യുടെ AI വോയ്‌സ് അസിസ്റ്റന്റ് കാണിച്ചുതരുന്നു. ഈ പരീക്ഷണം, സംഭാഷണപരമായ ആഴം നൽകുന്നത് സാങ്കേതിക ചിലവിനും തെറ്റായ വിവരങ്ങൾ നൽകാനുള്ള സാധ്യതയ്ക്കും അർഹമാണോ എന്നും, തിരക്കേറിയ സ്ട്രീമിംഗ് വിപണിയിൽ ഇതൊരു സ്ഥിരമായ വ്യത്യാസമായി മാറുമോ എന്നും വെളിപ്പെടുത്തും.