説明
Phi-4-Reasoning-Vision-15Bは、Microsoftによって開発されたコンパクトなオープンウェイトのマルチモーダル推論モデルで、Phi-4-Reasoning言語モデルのバックボーンとSigLIP-2ビジョンエンコーダーに基づいています。このモデルは中間融合アーキテクチャを利用しており、ビジョンエンコーダーが画像を視覚トークンに変換し、それを言語モデルの埋め込み空間に投影します。この革新的なアプローチは、事前学習された両方のコンポーネントの強みを組み合わせつつ、管理可能なトレーニングと推論コストを維持します。
このモデルは、テキストと画像を処理する能力があり、コンテキストの長さは16,384トークンです。推論データと非推論データの両方を含む慎重にキュレーションされたデータセットを使用して、監視付きファインチューニング(SFT)でトレーニングされています。これにより、Phi-4-Reasoning-Vision-15Bは、数学的および科学的推論などの複雑なタスクに対して拡張された思考の連鎖を実行できる一方で、キャプショニングや物体検出などの知覚に焦点を当てたタスクに対して直接的な推論も処理できます。
Phi-4-Reasoning-Vision-15Bは、メモリまたは計算リソースが制約された環境で特に効果的であり、一般的なマルチモーダルAIシステムに最適です。その主な使用ケースには、視覚入力に対する科学的および数学的推論、画面コンテンツの解釈やGUI要素のローカライズを含むコンピュータ使用エージェントタスクが含まれます。また、画像キャプショニング、視覚的質問応答、光学文字認識などの一般的なマルチモーダルタスクも処理できます。
モデルのトレーニングには、240台のNVIDIA B200 GPUを使用し、4日間にわたって行われました。安全性と整合性に重点を置いています。モデルは、有害なコンテンツに対する適切な動作を確保するために、オープンソースと社内生成の合成データセットの混合を含む安全なポストトレーニングアプローチを組み込んでいます。開発者は、特に高リスクのシナリオにおけるモデルの限界を考慮し、アプリケーションに統合する際には責任あるAIの実践を適用することを推奨します。
Phi-4-reasoning-vision-15Bのハイライト
モデルタイプ: マルチモーダル
API利用可能: はい
ライセンス: MIT
パラメータ: 15B
コンテキストの長さ: 16,384トークン
トレーニングGPU: 240
トレーニング時間: 4日間
ファインチューニングサポート: はい
マルチモーダル: はい
Phi-4-reasoning-vision-15Bをはじめる
モデルにアクセス: Phi-4-Reasoning-Vision-15BのHugging Faceページを訪問してください。
認証: APIアクセスのためにHugging Faceアカウントを設定してください。
環境を設定: システムが技術要件を満たしていることを確認してください。
API経由で統合: 提供されたAPIドキュメントを使用して、モデルをアプリケーションに統合してください。
最適化: 特定の使用ケースに基づいてモデルをファインチューニングしてください。
Phi-4-reasoning-vision-15Bの使用例
- 科学的推論
- コンピュータ使用エージェントタスク
- 画像キャプショニング
- 視覚的質問応答
- 光学文字認識






