تحول Spotify مشغل الموسيقى إلى رفيق حواري من خلال دمج قدرات متقدمة للصوت والنص عبر الذكاء الاصطناعي مباشرة في تطبيقها. تنقل هذه الخطوة التجربة من الاستماع السلبي إلى حوار تفاعلي قائم على الاستعلام، مما يعمق التفاعل من خلال معالجة اللغات الطبيعية.

مركز قيادة حواري للصوت

بعيداً عن أوامر "التشغيل" (play) و"الإيقاف المؤقت" (pause) البسيطة، تتيح نسخة بيتا الجديدة لمشتركي Premium إصدار مطالبات دقيقة مثل "شغّل بعض الفنانين الذين لم أسمع بهم من قبل"، أو "اجعل الإيقاع أكثر حيوية"، أو "فقط أعماله الأخيرة". تعتمد هذه الميزة على النماذج اللغوية الكبيرة (LLMs) لقراءة القصد، وفهم التفضيلات الأسلوبية، واستدعاء فنانين محددين. ومن خلال وضع هذه الميزة مباشرة في عرض التشغيل، تحول Spotify التطبيق إلى "دي جي" (DJ) شخصي يعمل بالذكاء الاصطناعي يستوعب الحالة المزاجية الموسيقية والاكتشاف.

تكامل عميق مع سجل الاستماع والمعرفة العامة

تفعل الواجهة أكثر من مجرد التحكم في التشغيل؛ فهي تعمل كمحرك معرفي. فهي تستمد المعلومات من سجل استماع المستخدم للإجابة على أسئلة مثل "متى استمعت إلى هذه الأغنية لأول مرة؟". هذا المزيج من البيانات الشخصية والذكاء الاصطناعي التوليدي يخلق أداة مخصصة للغاية تفتقر إليها خدمات البث الأخرى.

كما يتعامل الذكاء الاصطناعي مع استعلامات المعرفة العامة؛ اسأل "متى كُتبت الملحمة (Odyssey)؟" وستحصل على الإجابة داخل التطبيق. تأتي هذه الراحة مع خطر "هلوسة الذكاء الاصطناعي" (AI hallucinations)، حيث قد يطلق النموذج حقائق غير صحيحة، وهو تحدٍ معروف للنماذج اللغوية الكبيرة الحالية.

التنقل في منظومة المحتوى المُنشأ بواسطة الذكاء الاصطناعي

يأتي توجه Spotify نحو الذكاء الاصطناعي الحواري في وقت تصارع فيه المنصة مع الصوت التوليدي. فمن ناحية، تشارك شركة ElevenLabs للسماح للمبدعين بنشر الكتب الصوتية باستخدام أصوات عالية الجودة مُنشأة بواسطة الذكاء الاصطناعي.

ومن ناحية أخرى، تحارب Spotify فيضاً من الأغاني المُنشأة بواسطة الذكاء الاصطناعي والتعزيزات الاصطناعية التي تقودها البوتات والتي تهدد نزاهة التوصيات. ومن خلال تقديم ميزة صوتية رسمية وعالية الفائدة، توجه Spotify المستخدمين نحو تفاعلات الذكاء الاصطناعي الموثوقة بدلاً من المحتوى الآلي غير المنضبط.

توسيع نطاق مستقبل اكتشاف الصوت

تنطلق نسخة بيتا للمستخدمين الذين تبلغ أعمارهم 18 عاماً فأكثر في الولايات المتحدة وأيرلندا والسويد. يتيح هذا الإطلاق المحدود لـ Spotify ضبط نماذجها اللغوية بدقة قبل الإطلاق العالمي. وبالنسبة لميدان الذكاء الاصطناعي الأوسع، يعد هذا الاختبار دراسة حالة في كيفية دمج عمالقة التكنولوجيا الاستهلاكية للنماذج اللغوية الكبيرة (LLMs) في المنتجات الحالية لتعزيز الارتباط والاستبقاء.

النقاط الرئيسية

  • الاكتشاف التفاعلي: تتيح المطالبات باللغة الطبيعية للمستخدمين تشكيل الحالة المزاجية، والنوع الموسيقي، والتشغيل الخاص بفنان معين.
  • رؤى البيانات المخصصة: يستعلم الذكاء الاصطناعي من سجل استماع المستخدم لتقديم حقائق زمنية.
  • استراتيجية محتوى هجينة: تتبنى Spotify أدوات الذكاء الاصطناعي للمبدعين (ElevenLabs) بينما تدافع ضد رسائل البوتات المزعجة المُنشأة بواسطة الذكاء الاصطناعي.

أطلقت Spotify مساعداً صوتياً يعمل بالذكاء الاصطناعي (نسخة بيتا فقط) لمشتركي Premium في الولايات المتحدة وأيرلندا والسويد. تتيح الميزة للمستخدمين التحدث مع التطبيق — بطلب "تشغيل شيء لم أسمعه من قبل" أو "أرني المرة الأولى التي استمعت فيها إلى هذا المسار" — وتُطرح كوسيلة لجعل بث الموسيقى يبدو كحوار أكثر منه مجرد ضغطة زر.

لماذا تكتسب هذه الخطوة أهمية الآن

اعتمدت Spotify لفترة طويلة على قوائم التشغيل الخوارزمية والأوامر الصوتية البسيطة لإبقاء المستمعين داخل التطبيق. إن دمج نموذج لغوي كبير (LLM) مباشرة في شاشة التشغيل يحول تلك الأدوات السلبية إلى "دي جي" حواري يمكنه تفسير الطلبات الدقيقة.

التكنولوجيا الكامنة وراء المحادثة

تعمل نسخة بيتا فقط للمستخدمين الذين تبلغ أعمارهم 18 عاماً أو أكثر ممن يدفعون مقابل اشتراك Premium. عندما يتحدث المستخدم أو يكتب طلباً، يقوم النموذج اللغوي الكبير (LLM) بتحليل القصد، ومقارنته بسجل استماع الفرد، ثم إنشاء قائمة تشغيل أو إجابة واقعية. يمكن للنموذج الإجابة على الاستفسارات الشخصية مثل "متى استمعت إلى هذه الأغنية لأول مرة؟" وأسئلة المعرفة العامة مثل "متى كُتبت الملحمة (Odyssey)؟". يحدث كل هذا داخل نفس العرض حيث يضغط المستخدمون عادةً على تشغيل أو إيقاف مؤقت أو تخطي.

من الأوامر البسيطة إلى الاكتشاف السياقي

كانت عمليات دمج الصوت السابقة في منصات البث تقتصر على أوامر مثل "تشغيل — Taylor Swift" أو "تخطي". أما مساعد Spotify الجديد فيذهب إلى أبعد من ذلك: حيث يمكنه ضبط الحالة المزاجية ("اجعل الإيقاع أكثر حيوية")، والتصفية حسب درجة الألفة ("شغّل فنانين لم أسمع بهم من قبل")، واستدعاء أقسام محددة من الكتالوج ("فقط أعماله الأخيرة"). ومن خلال تفسير هذه التعليمات متعددة الخطوات، يعمل الذكاء الاصطناعي كمنسق شخصي يتعلم من كل تفاعل.

الفوائد للمبدعين والمنصة

تعمل Spotify على تعميق شراكتها مع شركة لتوليد الأصوات توفر سردًا صوتيًا تم إنشاؤه بواسطة الذكاء الاصطناعي للكتب الصوتية. ويظهر هذا التعاون استعداد الخدمة لتبني أدوات صوتية توليدية تساعد المبدعين على النشر بشكل أسرع وبتكلفة أقل. وفي الوقت نفسه، تواجه الشركة فيضًا من الأغاني منخفضة الجودة والمولدة بالذكاء الاصطناعي، و"التعزيزات الاصطناعية" التي تقودها الروبوتات، مما يهدد نزاهة محرك التوصيات الخاص بها. ويعد تقديم ميزة ذكاء اصطناعي رسمية وعالية الفائدة وسيلة لتوجيه المستخدمين نحو تفاعلات موثوقة والابتعاد عن المحتوى العشوائي غير المراقب.

المخاطر ومشكلة "الهلوسة"

يمكن للنماذج اللغوية الكبيرة (LLMs) إنتاج "هلوسات" – وهي إجابات تبدو واثقة ولكنها خاطئة من الناحية الواقعية. فعندما يطرح المستخدم سؤالاً تاريخياً، قد يقدم المساعد تاريخاً أو نسباً غير دقيق. وتتضاعف هذه المخاطر في تطبيق موسيقي حيث قد يقبل المستمعون الإجابة دون التحقق منها. لم تكشف Spotify عن كيفية تصفية أو تصحيح مثل هذه الأخطاء، مما يترك فجوة بين الوعد بالمعرفة الفورية وواقع المعلومات المضللة التي قد تظهر أحياناً.

التأثير على أصحاب المصلحة

  • مستخدمو Premium سيحصلون على طريقة أغنى وأكثر تفاعلية لاستكشاف مكتباتهم، مما قد يزيد من رضاهم ويقلل من معدل إلغاء الاشتراك.
  • الفنانون وأصحاب الحقوق قد يحظون بانتشار أكثر استهدافاً إذا نجح الذكاء الاصطناعي في إبراز الأغاني الأقل شهرة التي تناسب مزاج المستمع، لكنهم يظلون أيضاً عرضة للمسارات المولدة بالذكاء الاصطناعي التي تعقد حسابات العائدات.
  • المنافسون أصبح لديهم الآن مثال ملموس على كيفية دمج النماذج اللغوية الكبيرة في منتج موجه للمستهلك، مما يرفع سقف التوقعات لأي خدمة لا تزال تعتمد على القوائم الثابتة أو الأوامر الصوتية المحدودة.

ما يجب مراقبته لاحقاً

يقتصر إطلاق Spotify حالياً على ثلاث أسواق، مما يمنح الشركة مجموعة بيانات لتحسين اكتشاف النوايا، وتقليل الهلوسة، وقياس مقدار وقت الاستماع الإضافي الذي يولده المساعد. إذا أظهر الإصدار التجريبي زيادة ملموسة في التفاعل، فمن المرجح أن يتم التوسع عالمياً. قد يهتم المنظمون أيضاً بالأمر مع تلاشي الخط الفاصل بين استخدام البيانات الشخصية والتخصيص المدفوع بالذكاء الاصطناعي؛ فأي خطأ قد يثير تدقيقاً بشأن الخصوصية.

وجهة نظر معارضة: هل هناك حاجة فعلية للمحادثة؟

يرى النقاد أن معظم المستمعين لديهم بالفعل طرق فعالة لاكتشاف الموسيقى — مثل قوائم التشغيل المخصصة، والقوائم التحريرية المختارة، والمساعدين من جهات خارجية الذين يتكاملون بالفعل مع Spotify. قد يؤدي إضافة طبقة محادثة إلى تعقيد التجربة للمستخدمين الذين يفضلون النقر السريع على الكتابة أو التحدث. علاوة على ذلك، فإن التكلفة الحسابية لتشغيل النماذج اللغوية الكبيرة على نطاق واسع قد تترجم إلى نفقات تشغيل أعلى، مما قد يؤثر في النهاية على أسعار الاشتراكات.

الخلاصة

يظهر المساعد الصوتي المدعوم بالذكاء الاصطناعي من Spotify أن النماذج اللغوية الكبيرة يمكن دمجها في تطبيق استهلاكي واسع الانتشار لتحويل مشغل موسيقى ثابت إلى أداة اكتشاف تفاعلية. ستكشف هذه التجربة ما إذا كان العمق الحواري المضاف يبرر الأعباء التقنية ومخاطر المعلومات المضللة، وما إذا كان بإمكانه أن يصبح ميزة تنافسية مستدامة في سوق البث المزدحم.