説明
Microsoft Researchは、小型言語モデル(SLM)分野における重要な進歩であるPhi-2を発表しました。この27億パラメータのモデルは、顕著な推論能力と自然言語理解能力を示し、130億パラメータ未満のベース言語モデルの中でリーダーとしての地位を確立しています。Phi-2は様々なベンチマークで最先端のパフォーマンスを達成し、そのサイズの最大25倍のモデルと同等またはそれ以上の性能を示すことがよくあります。このパフォーマンスの飛躍は、革新的なモデルスケーリング技術と、トレーニングデータの綿密なキュレーションに起因しています。
Phi-2の開発は、Phi-1およびPhi-1.5を含むPhiスイートの以前のモデルに基づいています。Phi-1はPythonコーディングで優れていましたが、Phi-1.5は、常識推論と自然言語理解において、その5倍のサイズのモデルに匹敵するパフォーマンスを示しました。Phi-2は、Phi-1.5の知識をより大きなアーキテクチャに組み込むことでこれらの機能をさらに洗練させ、トレーニングの収束を加速し、ベンチマークスコアを向上させています。
Phi-2の成功を牽引する重要な洞察は、トレーニングデータの品質の極めて重要な役割です。Microsoft Researchは、「教科書品質」のデータに極端に焦点を当て、常識推論、一般知識、科学、日常活動、心の理論を教えるために設計された合成データセットを組み込みました。これに、教育的価値とコンテンツ品質のために選択された、注意深くフィルタリングされたWebデータが追加されています。このモデルはTransformerベースであり、NLPおよびコーディングタスクのために、合成データセットとWebデータセットの混合から複数回にわたって1.4兆トークンでトレーニングされています。
Phi-2はAzure AI Studioのモデルカタログで利用可能であり、研究開発を促進します。人間のフィードバックからの強化学習(RLHF)や指示ファインチューニングを受けていないにもかかわらず、Phi-2は、一部のアラインされたオープンソースモデルと比較して、毒性やバイアスに関してより良い振る舞いを示します。これはPhi-1.5での観察と一致しており、調整されたデータキュレーション技術に起因すると考えられます。
Phi-2のコンパクトなサイズは、メカニズム解釈可能性、安全性向上、多様なタスクにおけるファインチューニング実験などの分野を調査する研究者にとって優れたプラットフォームとなります。Big Bench Hard、常識推論、自然言語理解、数学、コーディングを含む複雑なベンチマークでのパフォーマンスは、Mistral 7BやLlama-2モデルのようなより大きなモデルに匹敵またはそれを超え、Gemini Nano 2とも競合します。
Phi-2 言語モデルのハイライト
27億パラメータ
130億パラメータ未満のモデルにおける最先端パフォーマンス
複雑なベンチマークで最大25倍大きいモデルを上回る
高度な推論および自然言語理解能力
「教科書品質」のデータとキュレーションされたWebデータでトレーニング
Transformerベースのアーキテクチャ
次単語予測目的
1.4兆トークンでトレーニング
Azure AI Studioモデルカタログで利用可能
RLHFまたは指示ファインチューニングなしで強力なパフォーマンスを発揮
一部のアラインされたモデルと比較して毒性およびバイアスが低い
研究、解釈可能性、ファインチューニング実験に最適
Phi-2 言語モデルをはじめる
モデルへのアクセス: Azure AI StudioのモデルカタログでPhi-2を見つけます。
認証: Azure AIサービスに必要な認証情報を設定します。
環境設定: 必要なライブラリとSDKで開発環境を構成します。
API経由での統合: 提供されているAPIエンドポイントを使用して、プロンプトを送信し、モデルの出力を受信します。
実験: モデルの機能を使用してファインチューニングまたは研究実験を開始します。
Phi-2 言語モデルの使用例
- 研究探索
- ファインチューニング実験
- 推論タスク
- 自然言語理解
- 常識推論






