غناء الأبجدية يجب أن يكون أسهل شيء يمكن لصوت الذكاء الاصطناعي القيام به. A-B-C-D-E-F-G. سبعة أصوات منفصلة، مألوفة لكل طفل على وجه الأرض. ومع ذلك، فإن أي شخص جرب توليد الموسيقى بالذكاء الاصطناعي يدرك أن الواقع أكثر تعقيداً. اطلب من النموذج غناء الأبجدية، وستجد أن الحروف L و M و N و O و P غالباً ما تنهار لتصبح مقطعاً صوتياً واحداً ضبابياً. "Elemmennopee" ليس حرفاً، بل هو عرض لمشكلة.

هذه هي مشكلة LMNOP، وهي تمتد إلى ما هو أبعد بكثير من أغاني الأطفال. أيام الأسبوع، التعليمات المرقمة، وأي نوع من القوائم المرتبة تكشف عن نفس الضعف. قام أحد المطورين مؤخراً باختبار ذلك من خلال توليد ثماني أغانٍ عبر مسار عمل (pipeline) للذكاء الاصطناعي وقياس المخرجات باستخدام mlx-whisper، وهي أداة للتعرف التلقائي على الكلام. وبدلاً من الاعتماد على الاستماع الذاتي، ترك برنامج النسخ (transcription) يقرر ما غناه الذكاء الاصطناعي بالضبط. كانت النتائج صارخة؛ فالتعداد يربك المغنين الاصطناعيين بطرق لا تفعلها اللغة العادية ببساطة.

لماذا تسبب القوائم تعثر أصوات الذكاء الاصطناعي

اللغة المنطوقة تحمل سياقاً. إذا تمتم شخص ما قائلاً: "سآخذ الكلب إلى الحديقة"، وفاتتك كلمة "الكلب"، فإن الجملة ستظل مفهومة، فالكلمات المحيطة تملأ الفجوات. لكن القوائم لا توفر هذه الشبكة الأمنية؛ فكل عنصر يقف بمفرده. إذا لم يفرق النموذج بين "B" و "D"، فلن يحصل المستمع على معنى جزئي، بل سيحصل على ضجيج.

في أغنية الأبجدية، تعتبر مجموعة LMNOP أوضح نقطة فشل. يعامل نموذج الصوت التسلسل ككتلة صوتية واحدة بدلاً من خمسة أحرف منفصلة. وبدون أدلة سياقية لترسيخ كل صوت، يخمن المُصنّع (synthesizer) الانتقالات بين الحروف الساكنة، وغالباً ما يخطئ في التخمين. يحدث الشيء نفسه مع أيام الأسبوع أو الخطوات المرقمة؛ حيث يسرع النموذج عبر التسلسل، ضاغطاً العناصر المتميزة في خليط غير واضح.

قياس حجم الضرر

لدراسة هذا الأمر بموضوعية، قام المطور بتوليد ثماني أغانٍ وتشغيلها عبر mlx-whisper لتقييم دقة الكلمات. كان مسار العمل مباشراً: كتابة أمر (prompt)، توليد الصوت، نسخ النتيجة، ومقارنة النص المنسوخ بالكلمات المقصودة.

بالنسبة للكلمات السردية القياسية، كانت المخرجات وفية للمحتوى بشكل معقول، حيث وقعت الكلمات في مكانها الصحيح. ولكن عندما تضمنت الأوامر قوائم أو أبجديات أو تعدادات، أعاد mlx-whisper كلاماً غير مفهوم. اختفت الحروف أو اندمجت، وتحولت الأرقام إلى مقاطع صوتية غير قابلة للتمييز. أكدت التجربة أن الكلمات المليئة بالقوائم تعاني من ضعف ملحوظ في الوضوح مقارنة بالنثر.

هندسة الأوامر التي تساعد

لا يمكنك الاعتماد على المعالجة اللاحقة لإصلاح قائمة مشوهة؛ يجب أن يحدث الإصلاح قبل توليد النوتة الأولى. يمكن لبناء الأمر الأول بعناية أن يجبر النموذج على النطق بوضوح أكبر. هذه التعديلات لا تكلف شيئاً، لكنها تغير طريقة تنفس النموذج وتوقفه.

  • قسم السلاسل الطويلة إلى مجموعات أصغر. بدلاً من A-B-C-D-E، قم بهيكلة السطر كـ A-B-C-D ثم E-F-G. تمنح إعادة الضبط الصغيرة بين المجموعات النموذج فرصة للوقوف على الحروف الساكنة الصحيحة بدلاً من دمجها معاً.

  • اكتب الأرقام بالحروف. استخدم "thirty" بدلاً من "30". الأرقام المكتوبة هي رموز مجردة؛ وأحياناً يضغطها النموذج إلى ضجيج مقطوع وغير مسموع. توفر الكلمة الإنجليزية الكاملة جوهراً صوتياً.

  • أدرج مسافات بصرية حول الحروف. اكتب "A - B - C" باستخدام الوصلات أو المسافات بدلاً من "ABC". يشير الفصل البصري إلى أن هذه عناصر مستقلة، وليست اختصاراً أو كلمة واحدة.

  • ثبّت عدد المقاطع الصوتية. اجعل كل سطر يتراوح بين ستة إلى عشرة مقاطع صوتية. التباين الكبير يجعل النموذج يسرع في الأسطر القصيرة ويمط الأسطر الطويلة. تتطلب القوائم دقة بالفعل؛ والإيقاع غير المتساوي يجعل الأداء الدقيق مستحيلاً تقريباً.

  • احذف كلمة "and" من القوائم. في الكلام الطبيعي، تعمل "and" كأداة ربط، ولكن في القائمة المغناة، تضيف مقطعاً صوتياً ناعماً غالباً ما يبتلع الحافة القوية للعنصر السابق. "Monday, Tuesday, Wednesday" تبدو أكثر وضوحاً من "Monday, Tuesday, and Wednesday".

فخ إعادة التوليد

هنا يأتي الدور الذي تنقلب فيه البديهة البشرية ضدنا. مع الكلمات العادية، عادة ما تؤدي الأوامر المتكررة إلى تحسين النتائج؛ حيث تسمع عبارة غير دقيقة، فتقوم بتعديل الصياغة وتوليدها مرة أخرى، فتظهر النسخة التالية بشكل أفضل. أظهر الاختبار أن هذا النهج يعمل مع الأغاني التي لا تحتوي على تعداد. ولكن بالنسبة للأغاني التي تحتوي على قوائم، فإن إعادة كتابة الأمر جعلت المخرجات أصعب في الفهم.

كانت البيانات واضحة لا لبس فيها. الأغاني غير المعتمدة على القوائم تحسنت بعد إصلاح الأوامر، بينما تدهورت الأغاني التي تحتوي على تعداد.

المتهم هو البذرة الصوتية (acoustic seed). في نماذج تحويل الكلمات إلى أغاني، لا يؤدي تغيير الأمر (prompt) ببساطة إلى تعديل الصوت الحالي، بل يعيد ترتيب الأساس التوليدي بالكامل. يعيد النموذج بناء الأداء من الصفر. بالنسبة للنصوص السردية، قد تسفر "رمية النرد" الجديدة عن نسخة أكثر وضوحاً. أما بالنسبة للقوائم، فأنت غالباً ما تفتح الباب لتعثر لفظي أسوأ. قد تنجح في ضبط التوقيت لحرف واحد فقط، لتشاهد النموذج وهو يبتلع الحروف "J" و"K" و"L" في المحاولة التالية. كانت النسخة الأصلية معيبة، لكن المراجعة غالباً ما استبدلت فوضى صوتية بأخرى.

سير عمل أذكى للكلمات الغنائية المليئة بالقوائم

نظرًا لأن إعادة التوليد تنطوي على مخاطرة بتدمير الوضوح، يجب أن تتغير طريقتك. توقف عن مطاردة إعادة الكتابة المثالية. بدلاً من ذلك، تعامل مع الأمر الأول وكأنه تجربة أداء (casting call).

قم بتوليد نسخ متعددة من نفس الأمر تماماً باستخدام بذور عشوائية (random seeds) مختلفة. لا تلمس النص. حافظ على ثبات الكلمات واترك النموذج يغير أداءه. أنت تجري تجربة أداء، ولست في جلسة تحرير.

ثم قم بتقييم كل نسخة مرشحة. قم بتشغيل كل نسخة عبر mlx-whisper أو أداة تفريغ صوتي مماثلة، وقس أي نسخة تطابق أمرك بأكبر قدر من الدقة. اختر الفائز بناءً على دقة الكلمات، حتى لو كانت الآلات الموسيقية أو النبرة الصوتية أقل صقلاً قليلاً. بالنسبة للمحتوى المليء بالقوائم، فإن وضوح النطق أهم من "الأجواء" (vibe).

والأهم من ذلك، قم بإجراء إصلاحاتك مسبقاً. طبق قواعد المسافات، وحدود المقاطع اللفظية، والتجميع قبل أن تضغط على زر التوليد. لا تكتب أغنية الحروف بالإنجليزية العادية ثم تحاول إصلاحها لاحقاً. النموذج أقل تسامحاً مع التعديلات اللاحقة عندما يتعلق الأمر بالقوائم. A