メインコンテンツへスキップ
ToolPotion

Phi-4-reasoning-vision-15B — AIモデル

注目

Phi-4-reasoning-vision-15Bは、Microsoftによって開発されたマルチモーダルAIモデルで、視覚と言語の理解および推論能力を必要とするタスクに設計されています。科学的推論やコンピュータ使用エージェントタスクに優れており、さまざまなアプリケーションに適しています。

URLを訪問

説明

Phi-4-Reasoning-Vision-15Bは、Microsoftによって開発されたコンパクトなオープンウェイトのマルチモーダル推論モデルで、Phi-4-Reasoning言語モデルのバックボーンとSigLIP-2ビジョンエンコーダーに基づいています。このモデルは中間融合アーキテクチャを利用しており、ビジョンエンコーダーが画像を視覚トークンに変換し、それを言語モデルの埋め込み空間に投影します。この革新的なアプローチは、事前学習された両方のコンポーネントの強みを組み合わせつつ、管理可能なトレーニングと推論コストを維持します。

このモデルは、テキストと画像を処理する能力があり、コンテキストの長さは16,384トークンです。推論データと非推論データの両方を含む慎重にキュレーションされたデータセットを使用して、監視付きファインチューニング(SFT)でトレーニングされています。これにより、Phi-4-Reasoning-Vision-15Bは、数学的および科学的推論などの複雑なタスクに対して拡張された思考の連鎖を実行できる一方で、キャプショニングや物体検出などの知覚に焦点を当てたタスクに対して直接的な推論も処理できます。

Phi-4-Reasoning-Vision-15Bは、メモリまたは計算リソースが制約された環境で特に効果的であり、一般的なマルチモーダルAIシステムに最適です。その主な使用ケースには、視覚入力に対する科学的および数学的推論、画面コンテンツの解釈やGUI要素のローカライズを含むコンピュータ使用エージェントタスクが含まれます。また、画像キャプショニング、視覚的質問応答、光学文字認識などの一般的なマルチモーダルタスクも処理できます。

モデルのトレーニングには、240台のNVIDIA B200 GPUを使用し、4日間にわたって行われました。安全性と整合性に重点を置いています。モデルは、有害なコンテンツに対する適切な動作を確保するために、オープンソースと社内生成の合成データセットの混合を含む安全なポストトレーニングアプローチを組み込んでいます。開発者は、特に高リスクのシナリオにおけるモデルの限界を考慮し、アプリケーションに統合する際には責任あるAIの実践を適用することを推奨します。

Phi-4-reasoning-vision-15Bのハイライト

  • モデルタイプ: マルチモーダル

  • API利用可能: はい

  • ライセンス: MIT

  • パラメータ: 15B

  • コンテキストの長さ: 16,384トークン

  • トレーニングGPU: 240

  • トレーニング時間: 4日間

  • ファインチューニングサポート: はい

  • マルチモーダル: はい

Phi-4-reasoning-vision-15Bをはじめる

  1. モデルにアクセス: Phi-4-Reasoning-Vision-15BのHugging Faceページを訪問してください。

  2. 認証: APIアクセスのためにHugging Faceアカウントを設定してください。

  3. 環境を設定: システムが技術要件を満たしていることを確認してください。

  4. API経由で統合: 提供されたAPIドキュメントを使用して、モデルをアプリケーションに統合してください。

  5. 最適化: 特定の使用ケースに基づいてモデルをファインチューニングしてください。

Phi-4-reasoning-vision-15Bの使用例

  • 科学的推論
  • コンピュータ使用エージェントタスク
  • 画像キャプショニング
  • 視覚的質問応答
  • 光学文字認識

Phi-4-reasoning-vision-15BのFAQ

Phi-4-reasoning-vision-15B のレビュー

読み込み中...

Phi-4-reasoning-vision-15B に似た人気のAIツール

Mistral Small 4は、推論、コーディング、マルチモーダル機能を1つのプラットフォームに統合した多用途のAIモデルです。ユーザーはAIアシスタントやエージェントを効率的にカスタマイズ、ファインチューニング、展開できるため、さまざまな企業アプリケーションに最適です。

注目AIモデルとLLM

Gemini 3.1 Proは、複雑なタスクと深い推論のために設計された高度なAIモデルです。マルチモーダル理解に優れ、スマートで簡潔な応答を提供し、学習、計画、革新的なアプリケーションの構築に最適です。

注目AIモデルとLLM

AI モデル

LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。

AIモデルとLLM

AI モデル

MiniGPT-4は、凍結されたビジュアルエンコーダーと大規模言語モデルを連携させることで、視覚と言語の理解を強化するAIモデルです。詳細な画像説明の生成、ドラフトからのウェブサイト作成、画像に触発された物語の執筆、視覚的な問題の解決など、高度なマルチモーダル能力を発揮します。

AIモデルとLLM

Command A+ は、複雑な推論、視覚、48 言語にわたる多言語タスクのために設計された、25B のアクティブパラメータと 218B の総パラメータを持つ専門家の混合モデルです。企業向けに効率的で正確なソリューションを提供します。

注目AIモデルとLLM

ALIGNは、10億以上の画像とaltテキストのペアから得られるノイズの多いテキスト監視を使用して、視覚および視覚言語表現学習をスケーリングするAIモデルです。クロスモーダル検索および視覚のみのタスクで最先端の結果を達成し、ゼロショット分類およびマルチモーダル検索を可能にします。

AIモデルとLLM

UNITERは、ECCV 2020の論文「UNITER: UNiversal Image-TExt Representation Learning」の研究コードリポジトリです。VQA、VCR、画像-テキスト検索など、様々なビジョンと言語のタスクにおけるファインチューニングと推論のためのコードを提供します。UNITER-baseおよびUNITER-largeの…

AIモデルとLLM

AI モデル

PaLM-Eは、実世界の連続的なセンサーデータをテキストと統合する、具現化されたマルチモーダル言語モデルです。これにより、ロボットは言語を知覚に結びつけることで複雑なタスクを実行できるようになり、高度な推論と計画のために多様なトレーニングドメインと具現化にわたるポジティブな転移を示します。

AIモデルとLLM