اسپاتیفای با گنجاندن قابلیت‌های پیشرفته صوتی و متنی هوش مصنوعی مستقیماً در اپلیکیشن خود، در حال تبدیل پخش‌کننده موسیقی به یک همراه گفتگو‌محور است. این حرکت، تجربه کاربری را از شنیدن غیرفعال به یک گفتگوی تعاملی و پرسش‌محور تغییر می‌دهد که از طریق پردازش زبان طبیعی، تعامل کاربر را عمیق‌تر می‌کند.

یک مرکز فرماندهی گفتگو‌محور برای صدا

فراتر از دستورات ساده‌ای مانند «play» (پخش) و «pause» (توقف)، نسخه بتای جدید Spotify به مشترکین Premium اجازه می‌دهد تا دستورات ظریف‌تری مانند «آرتیست‌هایی را پخش کن که قبلاً نشنیده‌ام»، «ریتم را پرانرژی‌تر کن» یا «فقط کارهای اخیر او را پخش کن» صادر کنند. این قابلیت از مدل‌های زبانی بزرگ (LLMs) برای درک قصد کاربر، فهم ترجیحات سبک موسیقی و استخراج آرتیست‌های خاص استفاده می‌کند. Spotify با قرار دادن این قابلیت مستقیماً در نمای پخش، اپلیکیشن را به یک DJ هوش مصنوعی شخصی تبدیل می‌کند که حال و هوای موسیقی و کشف آثار جدید را درک می‌کند.

ادغام عمیق با تاریخچه شنیداری و دانش عمومی

این رابط کاربری فراتر از کنترل پخش عمل می‌کند؛ بلکه به عنوان یک موتور دانش عمل می‌کند. این سیستم از تاریخچه شنیداری کاربر برای پاسخ به سوالاتی مانند «اولین بار کی این آهنگ را گوش دادم؟» استفاده می‌کند. این ترکیب از داده‌های شخصی و هوش مصنوعی مولد، ابزاری فوق‌شخصی‌سازی‌شده ایجاد می‌کند که سایر سرویس‌های استریم فاقد آن هستند.

این هوش مصنوعی همچنین به پرسش‌های مربوط به دانش عمومی پاسخ می‌دهد؛ مثلاً بپرسید «ادیسه چه زمانی نوشته شد؟» و پاسخ را درون اپلیکیشن دریافت کنید. البته این راحتی با ریسک توهمات هوش مصنوعی (AI hallucinations) همراه است، جایی که مدل ممکن است حقایق نادرستی را بیان کند؛ چالشی که برای LLMهای فعلی شناخته شده است.

پیمایش در اکوسیستم محتوای تولیدشده توسط هوش مصنوعی

ورود Spotify به حوزه هوش مصنوعی گفتگو‌محور در حالی رخ می‌دهد که این پلتفرم با چالش‌های مربوط به صدای مولد (generative audio) دست‌وپنجه نرم می‌کند. از یک سو، این شرکت با ElevenLabs همکاری می‌کند تا به تولیدکنندگان اجازه دهد کتاب‌های صوتی را با استفاده از صداهای باکیفیت تولیدشده توسط هوش مصنوعی منتشر کنند.

از سوی دیگر، Spotify با سیل آهنگ‌های تولیدشده توسط هوش مصنوعی و افزایش‌های مصنوعی (artificial boosts) توسط ربات‌ها که سلامت سیستم پیشنهاددهنده را تهدید می‌کنند، مبارزه می‌کند. Spotify با ارائه یک قابلیت صوتی رسمی و کاربردی، کاربران را به سمت تعاملات قابل اعتماد با هوش مصنوعی سوق می‌دهد، به جای اینکه اجازه دهد محتوای خودکار و کنترل‌نشده غالب شود.

گسترش آینده‌ی کشف صدا

نسخه بتا برای کاربران ۱۸ سال به بالا در ایالات متحده، ایرلند و سوئد عرضه شده است. این عرضه محدود به Spotify اجازه می‌دهد تا پیش از عرضه جهانی، مدل‌های زبانی خود را دقیق‌تر تنظیم کند. برای عرصه گسترده‌تر هوش مصنوعی، این آزمایش به عنوان یک مطالعه موردی در مورد نحوه گنجاندن LLMها در محصولات موجود توسط غول‌های فناوری مصرف‌کننده برای افزایش وفاداری و ماندگاری کاربران عمل می‌کند.

نکات کلیدی

  • کشف تعاملی: دستورات به زبان طبیعی به کاربران اجازه می‌دهند حال و هوا، سبک و پخش آثار یک آرتیست خاص را شکل دهند.
  • بینش‌های داده‌ای شخصی‌سازی‌شده: هوش مصنوعی تاریخچه شنیداری کاربر را برای ارائه حقایق زمانی بررسی می‌کند.
  • استراتژی محتوای ترکیبی: Spotify ابزارهای هوش مصنوعی را برای تولیدکنندگان (ElevenLabs) می‌پذیرد و در عین حال در برابر اسپم‌های رباتیک تولیدشده توسط هوش مصنوعی دفاع می‌کند.

Spotify یک دستیار صوتی هوش مصنوعی (فقط در نسخه بتا) را برای مشترکین Premium در ایالات متحده، ایرلند و سوئد عرضه کرده است. این قابلیت به کاربران اجازه می‌دهد با اپلیکیشن گفتگو کنند — مثلاً از آن بخواهند «چیزی را پخش کن که قبلاً نشنیده‌ام» یا «اولین باری که این آهنگ را گوش دادم نشان بده» — و به عنوان راهی برای تبدیل استریم موسیقی از یک فشار دادن دکمه به یک گفتگو، معرفی شده است.

چرا این حرکت اکنون اهمیت دارد

Spotify مدت‌هاست که برای نگه داشتن شنوندگان در اپلیکیشن، به لیست‌های پخش الگوریتمی و دستورات صوتی ساده متکی بوده است. گنجاندن یک مدل زبانی بزرگ (LLM) مستقیماً در صفحه پخش، آن ابزارهای غیرفعال را به یک DJ گفتگو‌محور تبدیل می‌کند که می‌تواند درخواست‌های ظریف را تفسیر کند.

فناوری پشت این گفتگو

نسخه بتا فقط برای کاربران ۱۸ سال به بالا که اشتراک Premium دارند فعال است. وقتی کاربر درخواستی را می‌گوید یا تایپ می‌کند، LLM قصد کاربر را تجزیه کرده، با تاریخچه شنیداری فرد تطبیق می‌دهد و سپس یک لیست پخش یا یک پاسخ واقعی تولید می‌کند. این مدل می‌تواند به پرسش‌های شخصی مانند «اولین بار کی این آهنگ را گوش دادم؟» و سوالات دانش عمومی مانند «ادیسه چه زمانی نوشته شد؟» پاسخ دهد. تمام این‌ها در همان نمای مشاهده‌ای اتفاق می‌افتد که کاربران معمولاً در آن دکمه‌های play، pause یا skip را می‌زنند.

از دستورات ساده تا کشف زمینه‌ای

ادغام‌های صوتی قبلی در پلتفرم‌های استریم به دستوراتی مانند «play — Taylor Swift» یا «skip» محدود بودند. دستیار جدید Spotify فراتر می‌رود: می‌تواند حال و هوا را تنظیم کند («ریتم را پرانرژی‌تر کن»)، بر اساس میزان آشنایی فیلتر کند («آرتیست‌هایی را پخش کن که قبلاً نشنیده‌ام») و بخش‌های خاصی از کاتالوگ را فراخوانی کند («فقط کارهای اخیر او را پخش کن»). هوش مصنوعی با تفسیر این دستورالعمل‌های چند مرحله‌ای، به عنوان یک کیوریتور شخصی عمل می‌کند که از هر تعامل می‌آموزد.

مزایا برای تولیدکنندگان و پلتفرم

اسپاتیفای در حال تعمیق همکاری خود با یک شرکت سنتز صدا است که روایت‌های تولیدشده توسط هوش مصنوعی را برای کتاب‌های صوتی تأمین می‌کند. این همکاری نشان می‌دهد که این سرویس مایل به پذیرش ابزارهای صوتی مولد است که به تولیدکنندگان کمک می‌کند سریع‌تر و با هزینه کمتر آثار خود را منتشر کنند. همزمان، این شرکت با سیل عظیمی از آهنگ‌های بی‌کیفیت تولیدشده توسط هوش مصنوعی و «تقویت‌های مصنوعی» مبتنی بر ربات که یکپارچگی موتور پیشنهاددهنده آن را تهدید می‌کنند، در حال مبارزه است. ارائه یک قابلیت رسمی و پرکاربرد هوش مصنوعی، راهی برای هدایت کاربران به سمت تعاملات قابل اعتماد و دور نگه داشتن آن‌ها از محتوای کنترل‌نشده و اسپم است.

ریسک‌ها و مشکل توهم (hallucination)

مدل‌های زبانی بزرگ (LLMs) می‌توانند دچار «توهم» شوند؛ یعنی پاسخ‌هایی با لحن مطمئن که از نظر واقعیت اشتباه هستند. وقتی کاربر یک سوال تاریخی می‌پرسد، دستیار ممکن است تاریخ یا منبعی نادرست ارائه دهد. این ریسک در یک اپلیکیشن موسیقی که شنوندگان ممکن است پاسخ را بدون بررسی مجدد بپذیرند، تشدید می‌شود. اسپاتیفای فاش نکرده است که چگونه این خطاها را فیلتر یا اصلاح خواهد کرد، که این امر شکافی میان وعده‌ی دانش فوری و واقعیتِ اطلاعات نادرستِ گاه‌به‌گاه ایجاد می‌کند.

تأثیر بر ذینفعان

  • کاربران پرمیوم روشی غنی‌تر و تعاملی‌تر برای کاوش در کتابخانه‌های خود به دست می‌آورند که پتانسیل افزایش رضایت و کاهش ریزش کاربر را دارد.
  • هنرمندان و دارندگان حقوق اگر هوش مصنوعی قطعات کمتر شناخته‌شده‌ای را که با حال و هوای شنونده مطابقت دارد پیدا کند، ممکن است با مواجهه هدفمندتری روبرو شوند؛ اما آن‌ها همچنان در برابر قطعات تولیدشده توسط هوش مصنوعی که محاسبات حق امتیاز (royalty) را مختل می‌کنند، آسیب‌پذیر هستند.
  • رقبا اکنون نمونه‌ای ملموس از نحوه ادغام LLMها در یک محصول مشتری‌محور در اختیار دارند، که سطح انتظار را برای هر سرویسی که هنوز به منوهای ایستا یا دستورات صوتی محدود متکی است، بالا می‌برد.

آنچه باید در آینده زیر نظر داشت

عرضه اسپاتیفای به سه بازار محدود شده است که به شرکت مجموعه‌ای از داده‌ها را برای بهبود تشخیص قصد کاربر، کاهش توهمات و سنجش میزان زمان شنیدن اضافی که دستیار ایجاد می‌کند، می‌دهد. اگر نسخه بتا افزایش قابل‌اندازه‌گیری در میزان تعامل را نشان دهد، احتمال گسترش جهانی آن وجود دارد. همچنین ممکن است نهادهای نظارتی نیز به این موضوع علاقه‌مند شوند، زیرا مرز بین استفاده از داده‌های شخصی و شخصی‌سازی مبتنی بر هوش مصنوعی در حال کمرنگ شدن است؛ هرگونه لغزش می‌تواند منجر به بررسی‌های دقیق در زمینه حریم خصوصی شود.

دیدگاه مخالف: آیا واقعاً به گفتگو نیاز است؟

منتقدان استدلال می‌کنند که اکثر شنوندگان در حال حاضر روش‌های کارآمدی برای کشف موسیقی دارند؛ از لیست‌های پخش شخصی‌سازی‌شده و لیست‌های تحریریه‌ای منتخب گرفته تا دستیارهای شخص ثالث که از قبل با اسپاتیفای ادغام شده‌اند. افزودن یک لایه گفتگویی می‌تواند تجربه کاربرانی را که ضربه‌های سریع (tap) را به تایپ کردن یا صحبت کردن ترجیح می‌دهند، پیچیده کند. علاوه بر این، هزینه محاسباتی اجرای LLMها در مقیاس بزرگ ممکن است به هزینه‌های عملیاتی بالاتر منجر شود که در نهایت می‌تواند بر قیمت اشتراک تأثیر بگذارد.

جمع‌بندی

دستیار صوتی هوش مصنوعی اسپاتیفای نشان می‌دهد که مدل‌های زبانی بزرگ می‌توانند در یک اپلیکیشن مصرف‌کننده رایج تعبیه شوند تا یک پخش‌کننده موسیقی ایستا را به یک ابزار اکتشاف تعاملی تبدیل کنند. این آزمایش مشخص خواهد کرد که آیا عمق گفتگوی اضافه‌شده، هزینه‌های فنی و ریسک اطلاعات نادرست را توجیه می‌کند یا خیر، و آیا می‌تواند به یک عامل تمایزدهنده پایدار در بازار شلوغ استریم تبدیل شود یا نه.