説明
Microsoftによって開発されたMPNetは、Masked and Permuted Pre-training for Language Understandingの略です。この革新的な事前学習手法は、BERTのMasked Language Modeling (MLM) やXLNetのPermuted Language Modeling (PLM) に見られる既存モデルの限界に対処し、言語理解ベンチマークにおいて優れた精度を達成しています。
このプロジェクトは、BERT、XLNet、そしてMPNet自身を含む複数の事前学習モデルの統一的なビューと実装を提供します。広範な言語理解タスクに対応するため、新しいモデルの事前学習と既存モデルのファインチューニングの両方に対応する包括的なコードが含まれています。サポートされるタスクには、GLUE、SQuAD、RACEといった一般的なベンチマークが含まれており、NLP研究者や開発者にとって汎用性の高いツールとなっています。
fairseqのコードベースを活用することで、インストールは簡単です。ユーザーはpipを通じて必要なコンポーネントをインストールできます。このツールキットには、PyTorch Transformers、SciPy、Scikit-learnが必要です。事前学習プロセスには、トークン化やバイナリ化を含むデータ前処理が含まれ、その後、提供されたスクリプトと設定を使用してMPNetモデルの実際の事前学習が行われます。
MPNetは、その事前学習アプローチにおいて柔軟性を提供します。ユーザーは、それぞれマスク言語モデルまたは順列言語モデルをトレーニングするために、MLMまたはPLMのような入力モードを指定できます。高度なオプションには、モデルアーキテクチャとコマンドライン引数を調整することによる相対位置埋め込みや全単語マスキングの使用が含まれます。このプロジェクトでは、下流タスクでの直接的なファインチューニングのために、更新された事前学習済みMPNetモデルも利用可能になっています。
このプロジェクトはfairseq-0.8.0に基づいて構築されており、その貢献に感謝しています。このツールキットが有益であると感じた方のために、MPNet論文の引用情報が提供されています。関連する研究や代替の事前学習フレームワークもリストされており、NLP研究のより広い文脈を提供しています。このリポジトリは、言語理解能力の向上に役立つ貴重なリソースとして機能します。
MPNetのハイライト
マスクおよび順列事前学習手法
BERTおよびXLNetに対する精度を向上
事前学習モデルの統一的な実装 (BERT, XLNet, MPNet)
事前学習およびファインチューニング用のコード
GLUE, SQuAD, RACEベンチマークをサポート
fairseqコードベースに基づく
更新された事前学習済みモデルを提供
MLMおよびPLM入力モードをサポート
相対位置埋め込みのオプション
全単語マスキングのオプション
MPNetをはじめる
依存関係のインストール: pip install fairseq pytorch_transformers==1.0.0 transformers scipy sklearn
データの前処理: encode.pyを使用してコーパスをトークン化し、fairseq-preprocessを使用してバイナリ化
MPNetの事前学習: total updates、learning rate、batch sizeなどの指定されたパラメータでfairseq-trainを実行
事前学習済みモデルのロード: fairseq.models.masked_permutation_netからMPNet.from_pretrainedを使用
下流タスクでのファインチューニング: 事前学習済みモデルをGLUEやSQuADなどの特定のNLPタスクに適応させる
MPNetの使用例
- 言語理解
- 事前学習モデル
- NLPモデルのファインチューニング
- ベンチマークパフォーマンス
- NLP研究






