الوصف
Jukebox، التي طورتها OpenAI، هي شبكة عصبية متطورة مصممة لتوليد الموسيقى بالذكاء الاصطناعي. تنتج الموسيقى مباشرة كصوت خام، قادرة على تضمين الغناء البدائي وتقليد مجموعة متنوعة من الأنواع وأنماط الفنانين. يمثل هذا تقدمًا كبيرًا في النماذج التوليدية، متجاوزًا توليد الموسيقى الرمزية لالتقاط الفروق الدقيقة للصوت الخام.
في جوهرها، تستخدم Jukebox نموذج VQ-VAE (المُرمّز التلقائي المتغير المكمّم بالمتجهات) الهرمي لضغط الصوت الخام إلى مساحة منفصلة ذات أبعاد أقل. هذا الضغط ضروري للتعامل مع التسلسلات الطويلة للغاية المتأصلة في بيانات الصوت، مما يسمح للنموذج بتعلم هياكل دلالية عالية المستوى. يستلهم هيكل VQ-VAE من VQ-VAE-2، مع تعديلات لمعالجة انهيار دفتر الأكواد وتحسين جودة إعادة البناء، بما في ذلك إضافة خسارة طيفية. يستخدم النموذج ثلاثة مستويات من الضغط، ويقلل معدل عينات الصوت الخام 44 كيلو هرتز بمقدار 8x، 32x، و 128x، مع الاحتفاظ بالمعلومات الموسيقية الأساسية مثل النغمة، والرنين، والحجم.
بعد ضغط الصوت، يتم تدريب نماذج المحولات كنماذج أولية لتعلم توزيع أكواد الصوت المضغوطة هذه. تولد هذه النماذج الأولية الموسيقى في المساحة المنفصلة، حيث يلتقط النموذج الأولي عالي المستوى الهيكل طويل المدى وتضيف النماذج الأولية منخفضة المستوى تفاصيل موسيقية محلية. يتم تدريب النماذج بشكل تلقائي باستخدام شكل مبسط من Sparse Transformers، مع كل نموذج يتميز بـ 72 طبقة من الانتباه الذاتي المُجزّأ. يسمح هذا النهج الهرمي لـ Jukebox بتوليد مقطوعات موسيقية متماسكة بجودة صوت رائعة.
يمكن توجيه Jukebox بواسطة مدخلات مختلفة، بما في ذلك النوع، والفنان، وكلمات الأغاني. من خلال توفير هذه كمدخلات، يمكن للمستخدمين توجيه عملية التوليد لإنتاج موسيقى بأسلوب مرغوب فيه. تم تدريب النموذج على مجموعة بيانات كبيرة تضم 1.2 مليون أغنية، مقترنة بكلمات الأغاني والبيانات الوصفية من LyricWiki. تطلب التوجيه بكلمات الأغاني، على وجه الخصوص، تقنيات محاذاة متطورة لمطابقة المحتوى الغنائي مع مقاطع الصوت المقابلة، مما يعزز قدرة النموذج على توليد الغناء.
على الرغم من قدراتها، تواجه Jukebox قيودًا. قد تفتقر الأغاني المولدة إلى الهياكل الموسيقية الكبيرة المألوفة مثل الكورس المتكرر، وقد تؤدي عملية تقليل معدل العينات وزيادته إلى إدخال ضوضاء ملحوظة. عملية أخذ العينات بطيئة أيضًا، وتستغرق حوالي 9 ساعات لعرض دقيقة واحدة من الصوت، مما يجعلها غير مناسبة للتطبيقات التفاعلية. تهدف الأعمال المستقبلية إلى تحسين الموسيقية، وتقليل الضوضاء، وزيادة سرعة أخذ العينات، ربما من خلال التقطير إلى عيّنة متوازية. تخطط OpenAI أيضًا لتوسيع نطاق النموذج ليشمل أغاني من لغات ومناطق أخرى، مما يعزز التعاون بين الإنسان والآلة في إنشاء الموسيقى.
أبرز ملامح Jukebox
تولد الموسيقى كصوت خام
تتضمن قدرات غناء بدائية
تدعم التوجيه بالنوع، والفنان، وكلمات الأغاني
تقلد مجموعة متنوعة من الأنواع الموسيقية
تقلد أنماط فنانين مختلفة
تستخدم VQ-VAE هرمي لضغط الصوت
تستخدم نماذج المحولات لتوليد الأكواد
تم تدريبها على مجموعة بيانات كبيرة تضم 1.2 مليون أغنية
تم إصدار أوزان النموذج والتعليمات البرمجية علنًا
تتضمن أداة لاستكشاف العينات المولدة
تخرج الموسيقى بمستويات ضغط متعددة
تتعلم الهيكل الموسيقي طويل المدى
البدء مع Jukebox
الوصول إلى أوزان النموذج والتعليمات البرمجية: قم بتنزيل نموذج Jukebox المُصدر والتعليمات البرمجية المرتبطة به من مستودع GitHub المقدم.
إعداد بيانات الإدخال: اجمع معلومات النوع والفنان وكلمات الأغاني المطلوبة لتوليد الموسيقى.
تكوين معلمات التوليد: قم بتعيين المعلمات لجودة الصوت المطلوبة، والطول، ومدخلات التوجيه.
تشغيل عملية التوليد: قم بتنفيذ نموذج Jukebox لتوليد عينات موسيقية صوتية خام.
استكشاف العينات المولدة: استخدم الأداة المقدمة للاستماع إلى المخرجات وتحليلها.
التكامل في المشاريع: قم بتكييف التعليمات البرمجية المُصدرة لتطبيقات توليد الموسيقى المخصصة.
حالات استخدام Jukebox
- توليد الموسيقى بالذكاء الاصطناعي
- تقليد الأنماط الموسيقية
- توليف الغناء البدائي
- استكشاف الموسيقى الإبداعي
- تأليف الموسيقى التصويرية
- أبحاث الموسيقى




