Beschreibung
UL2 20B stellt einen bedeutenden Fortschritt im Pre-Training von Sprachmodellen dar und bietet ein einheitliches Framework, das die Leistung bei verschiedenen Aufgaben und Setups verbessert. Dieses von Google Research entwickelte Open-Source-Modell adressiert die Einschränkungen bestehender Paradigmen, die oft entweder beim Fine-Tuning oder beim Few-Shot-In-Context-Learning glänzen, aber mit dem jeweils anderen Schwierigkeiten haben.
Traditionelle Sprachmodelle fallen typischerweise in zwei Kategorien: autoregressive Decoder-Only-Architekturen (wie GPT-3), die das nächste Wort vorhersagen, und auf Span-Corruption basierende Encoder-Decoder-Architekturen (wie T5), die maskierten Text wiederherstellen. Während autoregressive Modelle für die offene Generierung und das Prompt-basierte Lernen gut geeignet sind, können sie bei Fine-Tuning-Aufgaben unterdurchschnittlich abschneiden. Umgekehrt schneiden T5-ähnliche Modelle beim überwachten Fine-Tuning gut ab, sind aber in Few-Shot-Szenarien weniger effektiv. UL2 schließt diese Lücke, indem es diese Ansätze vereint.
Die Kerninnovation von UL2 liegt in seinem neuartigen Pre-Training-Paradigma, dem Unified Language Learner (UL2). Dieses Framework formuliert verschiedene Trainingsziele als Denoising-Aufgaben, bei denen das Modell lernt, fehlende Teilsequenzen von Eingabetexten zu rekonstruieren. Während des Pre-Trainings verwendet UL2 eine einzigartige Mischung aus Denoisern, die aus einer Vielzahl von Zielen mit unterschiedlichen Konfigurationen stichprobenartig entnommen werden. Dieser Ansatz ermöglicht es dem Modell, gleichzeitig von den Stärken mehrerer Trainingsstrategien zu profitieren und individuelle Schwächen zu mildern.
Die Mischung aus Denoisern von UL2 umfasst drei Hauptaufgaben: R-Denoising (standardmäßige Span-Corruption), X-Denoising (extreme Span-Corruption) und S-Denoising (sequenzielles PrefixLM). Durch die stichprobenartige Entnahme aus diesen Aufgaben basierend auf benutzerspezifischen Verhältnissen und das Anhängen eines Paradigma-Tokens (z. B. [R], [X], [S]), um die Aufgabe anzuzeigen, trainiert UL2 ein vielseitigeres und robusteres Sprachmodell. Dieser einheitliche Ansatz führt zu einer verbesserten Leistung bei der Generierung, dem Sprachverständnis, der Informationsbeschaffung, dem Verständnis langer Texte und der Beantwortung von Fragen.
Das UL2 20B-Modell mit seinen 20 Milliarden Parametern zeigt außergewöhnliche Fähigkeiten im Few-Shot-Prompting und im Chain-of-Thought (CoT)-Reasoning. Es übertrifft andere State-of-the-Art-Modelle wie PaLM und T5 bei Aufgaben wie 1-Shot-Zusammenfassung (XSUM) und erzielt überlegene ROUGE-Scores. Darüber hinaus ermöglicht UL2 20B CoT-Prompting und Reasoning in zugänglichem Umfang, wodurch fortschrittliche Reasoning-Techniken einer breiteren Forschungsgemeinschaft zur Verfügung gestellt werden. Die öffentliche Veröffentlichung von UL2 20B Checkpoints zielt darauf ab, die Fortschritte bei der Entwicklung besserer Sprachmodelle innerhalb der Machine-Learning-Community zu beschleunigen.
UL2 20B im Überblick
Einheitliches Sprachlernparadigma
Pre-Training-Ziel: Mischung aus Denoisern
Unterstützt R-Denoising-, X-Denoising- und S-Denoising-Aufgaben
Verbessert die Leistung bei Fine-Tuning-Aufgaben
Erweitert die Fähigkeiten des Few-Shot-In-Context-Learnings
Hervorragend bei der offenen Generierung
Starke Leistung beim Sprachverständnis
Effektiv für Retrieval-Aufgaben
Fähig zum Verständnis langer Texte
Unterstützt Aufgaben zur Beantwortung von Fragen
Öffentlich freigegebene Checkpoints für das 20-Milliarden-Parameter-Modell
Ermöglicht Chain-of-Thought (CoT)-Prompting
Erleichtert Reasoning in zugänglichem Umfang
Erste Schritte mit UL2 20B
Modellzugriff: UL2 20B Modell-Checkpoints abrufen.
Umgebung einrichten: Notwendige Bibliotheken und Infrastruktur konfigurieren.
Integration über API: Modell laden und Eingabedaten vorbereiten.
Aufgabe definieren: Die gewünschte Sprachaufgabe festlegen (z. B. Zusammenfassung, QA).
Inferenz ausführen: Eingabedaten durch das Modell verarbeiten.
Ergebnisse auswerten: Modell-Ausgaben auf Leistung analysieren.
UL2 20B's Anwendungsfälle
- Few-Shot Learning
- Textgenerierung
- Sprachverständnis
- Fragenbeantwortung
- Zusammenfassung
- Reasoning-Aufgaben
- Informationsbeschaffung





