الوصف
تم تطوير PEGASUS، وهو نموذج متطور لتلخيص النصوص التجريدي، بواسطة Google Research لمعالجة تحديات فهم المقاطع الطويلة، وضغط المعلومات، وتوليد ملخصات متماسكة. يعتمد هذا النموذج على بنية المشفر-المفكك (encoder-decoder) من نوع Transformer، والتي أصبحت مفضلة لفعاليتها في التعامل مع التسلسلات الطويلة.
ما يميز PEGASUS هو هدف التدريب المسبق المبتكر ذاتي الإشراف، والذي يُطلق عليه توليد الجمل المفقودة. بدلاً من التدريب المسبق العام، يتم تدريب PEGASUS على استعادة جمل كاملة تم حذفها من المستندات. هذه المهمة الصعبة تجبر النموذج على التعلم بعمق عن اللغة، والمعرفة العالمية، وتقطير المعلومات، مما يعكس متطلبات التلخيص التجريدي. يسمح نهج الإشراف الذاتي هذا بإنشاء بيانات تدريب وفيرة دون الحاجة إلى تعليقات بشرية، وهو عنق زجاجة شائع في التعلم المراقب.
تتضمن عملية التدريب المسبق إخفاء الجمل "المهمة"، والتي يتم تحديدها باستخدام مقياس ROUGE، من مجموعة كبيرة من المستندات التي تم جمعها من الويب. بعد ذلك، يتم ضبط النموذج بدقة على 12 مجموعة بيانات تلخيص متنوعة، بما في ذلك المقالات الإخبارية والأوراق العلمية والمستندات القانونية. يحقق PEGASUS نتائج متطورة جديدة على مجموعات البيانات هذه مع استخدام عدد أقل بكثير من المعلمات مقارنة بالنماذج المماثلة مثل T5.
أحد النتائج الرئيسية هو الكفاءة الاستثنائية للعينات في PEGASUS. يمكن للنموذج تحقيق أداء قريب من المتطور باستخدام 1000 مثال فقط للضبط الدقيق، متفوقًا على خطوط الأساس القوية التي استخدمت بيانات مراقبة أكثر بكثير. هذا يقلل بشكل كبير من التكلفة والجهد المرتبطين بجمع البيانات لمهام التلخيص.
تؤكد التقييمات البشرية قدرات PEGASUS بشكل أكبر. لم يتمكن المقيمون البشريون من التمييز باستمرار بين الملخصات التي تم إنشاؤها بواسطة PEGASUS (حتى مع الضبط الدقيق المحدود) وتلك التي كتبها البشر. يُظهر النموذج أداءً شبيهًا بالبشر على مجموعات بيانات مثل XSum و CNN/DailyMail، مما يفتح العديد من التطبيقات منخفضة التكلفة. يُظهر النموذج أيضًا قدرة بدائية على "عد" العناصر في قائمة، مما يشير إلى شكل محدود من الاستدلال الرمزي، على الرغم من أنه لا يعمم بشكل مثالي على الأرقام الأكبر.
لتعزيز البحث وقابلية التكرار، أصدرت Google Research كود PEGASUS ونقاط فحص النموذج على GitHub، بما في ذلك نصوص الضبط الدقيق للتكيف مع مجموعات بيانات التلخيص الجديدة.
أبرز ملامح نموذج PEGASUS لتلخيص النصوص
تلخيص النصوص التجريدي المتطور
هدف تدريب مسبق مبتكر لتوليد الجمل المفقودة
بنية المشفر-المفكك من نوع Transformer
يحقق نتائج متطورة على 12 مجموعة بيانات تلخيص متنوعة
كفاءة استثنائية في العينات مع الحد الأدنى من بيانات الضبط الدقيق
جودة ملخص شبيهة بالبشر تم إثباتها في التقييمات
يُظهر قدرات بدائية في العد والاستدلال الرمزي
كود ونقاط فحص النموذج مفتوحة المصدر متاحة على GitHub
قابل للتكيف مع أنواع المستندات المختلفة بما في ذلك الأخبار والأوراق العلمية والمستندات القانونية
يحقق أداءً عاليًا بمعلمات أقل مقارنة بالنماذج الأخرى
التعلم ذاتي الإشراف يقلل الاعتماد على التعليقات البشرية
البدء مع نموذج PEGASUS لتلخيص النصوص
الوصول إلى النموذج: احصل على إمكانية الوصول إلى نقاط فحص نموذج PEGASUS والكود.
إعداد البيئة: قم بتكوين بيئة التطوير الخاصة بك مع المكتبات والتبعيات اللازمة.
التكامل عبر API: استخدم الكود المقدم لدمج PEGASUS في تطبيقاتك للتلخيص.
ضبط النموذج بدقة: قم بتكييف PEGASUS مع مجموعات بيانات تلخيص محددة باستخدام نصوص الضبط الدقيق المقدمة.
تحسين الأداء: قم بتجربة المعلمات ومجموعات البيانات لتحقيق جودة التلخيص المطلوبة.
حالات استخدام نموذج PEGASUS لتلخيص النصوص
- تلخيص الأخبار
- تحليل المستندات
- ملخصات الأوراق البحثية
- تجميع المحتوى
- محاضر الاجتماعات
- مراجعة المستندات القانونية
- تكثيف سلاسل البريد الإلكتروني
- إنشاء تقارير الكتب








