الوصف
يمثل FastSpeech 2 تقدمًا كبيرًا في تقنية تحويل النص إلى كلام (TTS) غير التراجعية، بناءً على أساس سابقه FastSpeech. بينما قدم FastSpeech توليدًا أسرع مقارنة بالنماذج التراجعية، فقد اعتمد على خط أنابيب تقطير معقد ويستهلك وقتًا طويلاً بين المعلم والطالب. هذه العملية، جنبًا إلى جنب مع دقة التنبؤ بالمدة وفقدان المعلومات المحتمل أثناء تبسيط البيانات، حدت من جودة الصوت التي يمكن تحقيقها.
يعالج FastSpeech 2 هذه القيود من خلال اعتماد نهج تدريب مباشر أكثر. بدلاً من الاعتماد على المخرجات المقطرة من نموذج المعلم، فإنه يتدرب مباشرة مع بيانات الهدف الحقيقية. والأهم من ذلك، أنه يقدم معلومات تنوع إضافية كمدخلات شرطية، بما في ذلك درجة الصوت والطاقة وتنبؤات مدة أكثر دقة. تُستخدم هذه الميزات المستخرجة أثناء التدريب ويتم التنبؤ بها أثناء الاستدلال، مما يسمح للنموذج بالتقاط الفروق الدقيقة للكلام البشري بشكل أفضل وحل مشكلة التعيين واحد إلى متعدد المتأصلة في TTS، حيث يمكن أن يتوافق نص واحد مع تنوعات كلام متعددة.
يُرى المزيد من الابتكار في FastSpeech 2s، الذي رائد في التوليد المباشر لموجات الصوت من النص بطريقة متوازية. هذه القدرة الاستدلالية الشاملة تعزز سرعة التوليد بشكل كبير. تظهر النتائج التجريبية أن FastSpeech 2 يحقق زيادة ثلاثية في سرعة التدريب مقارنة بـ FastSpeech، مع توفير FastSpeech 2s استدلالًا أسرع. من حيث جودة الصوت، يتفوق كل من FastSpeech 2 و 2s على FastSpeech، مع تفوق FastSpeech 2 حتى على جودة النماذج التراجعية التقليدية.
تسمح بنية النموذج بالتكامل المباشر للميزات الصوتية، مما يؤدي إلى كلام أكثر تعبيرًا وطبيعية. هذا يجعله مناسبًا لمجموعة واسعة من التطبيقات التي تتطلب توليد كلام عالي الجودة وسريع. تفتح القدرة على التحكم في تنوعات درجة الصوت والطاقة والتنبؤ بها إمكانيات لمخرجات صوتية أكثر ديناميكية وتخصيصًا، تتجاوز توليد الكلام الثابت.
أبرز ملامح FastSpeech 2
توليد كلام شامل من النص إلى كلام
بنية نموذج غير تراجعية
تدريب مباشر مع أهداف حقيقية
يدمج درجة الصوت والطاقة كمدخلات شرطية
يتنبأ بالمدة ودرجة الصوت والطاقة للاستدلال
يحقق تسريع تدريب بمقدار 3 أضعاف مقارنة بـ FastSpeech
يوفر FastSpeech 2s توليد موجات صوت متوازية شاملة
يتفوق على FastSpeech في جودة الصوت
يمكن أن يتفوق على النماذج التراجعية في جودة الصوت
يستخدم Parallel WaveGAN (PWG) كـ vocoder لعينات الصوت
يقلل الضوضاء الخلفية باستخدام الطرح الطيفي
البدء مع FastSpeech 2
الوصول إلى النموذج: احصل على أوزان الكود الخاص بنموذج FastSpeech 2.
إعداد البيئة: قم بتكوين إطار التعلم العميق والتبعيات اللازمة.
إعداد البيانات: اجمع البيانات النصية والصوتية المقابلة وقم بمعالجتها مسبقًا.
تدريب النموذج: قم بتدريب FastSpeech 2 باستخدام الأهداف الحقيقية والميزات الصوتية المستخرجة.
التكامل عبر API: قم بتنفيذ النموذج المدرب للاستدلال في تطبيقك.
تحسين الاستدلال: استخدم FastSpeech 2s لتوليد كلام أسرع وشامل بالكامل.
حالات استخدام FastSpeech 2
- توليد كلام عالي الجودة
- تدريب TTS أسرع
- تطوير المساعد الصوتي
- إنشاء المحتوى
- أدوات إمكانية الوصول
- توليد الصوت في الوقت الفعلي



