メインコンテンツへスキップ
ToolPotion

Florence-2モデル

Florence-2は、Microsoftによって開発された高度なビジョン基盤モデルで、さまざまなビジョンおよびビジョン-言語タスクを処理するように設計されています。キャプショニングや物体検出などのタスクに対してプロンプトベースのアプローチを使用し、多様なデータセットを活用してマルチタスク学習を行います。

モデルを見る
共有

説明

Florence-2は、Microsoftによって開発された洗練されたビジョン基盤モデルで、Hugging Faceにホストされています。さまざまなビジョンタスクのための統一された表現を進めるように設計されています。このモデルは、キャプショニング、物体検出、セグメンテーションなど、幅広いビジョンおよびビジョン-言語タスクを効率的に処理するためにプロンプトベースのアプローチを採用しています。Florence-2は、126百万の画像にわたる54億の注釈を含むFLD-5Bデータセットを活用して、マルチタスク学習において優れた性能を発揮します。

このモデルのアーキテクチャはシーケンス・ツー・シーケンスであり、ゼロショットおよびファインチューニング設定の両方で優れた性能を発揮します。Florence-2は、シンプルなテキストプロンプトを解釈してさまざまなタスクを実行できる競争力のあるビジョン基盤モデルです。Florence-2は、4kのコンテキスト長で事前学習されており、継続的な事前学習にはわずか1億サンプルを使用しているため、トレーニングの質に影響を与える可能性があります。

Florence-2の機能には、フレーズのグラウンディング、物体検出、密な領域キャプショニング、領域出力を伴うOCRなどのタスクを処理することが含まれます。ゼロショット設定におけるモデルの性能は注目に値し、COCOおよびNoCapsデータセットで高いCIDErスコアを記録しています。さらに、Florence-2は、さまざまなキャプショニングおよびVQAタスクで優れた性能を発揮するFlorence-2-base-ftおよびFlorence-2-large-ftなどの下流タスクのコレクションでファインチューニングされています。

このモデルは、0.23BパラメータのFlorence-2-baseおよび0.77BパラメータのFlorence-2-largeなど、さまざまなサイズで利用可能です。ユーザーがモデルを始めるための技術レポートやJupyterノートブックなどのリソースが利用可能です。Florence-2は、ビジョンおよびビジョン-言語タスクに取り組む研究者や開発者にとって貴重なツールであり、さらなる開発と応用のための堅牢な基盤を提供します。

Florence-2モデルのハイライト

  • 高度なビジョン基盤モデル

  • プロンプトベースのアプローチ

  • ビジョン-言語タスクを処理

  • シーケンス・ツー・シーケンスアーキテクチャ

  • ゼロショットおよびファインチューニング設定

  • FLD-5Bデータセットを使用

  • キャプショニングおよび物体検出をサポート

  • 領域出力を伴うOCR

Florence-2モデルをはじめる

  1. ページにアクセス: Hugging Faceモデルページを訪問

  2. モデルをロード: Florence-2モデルをダウンロード

  3. 環境を設定: 必要な依存関係を設定

  4. 統合: アプリケーションでモデルを使用

  5. ファインチューニング: 特定のタスクにモデルを調整

Florence-2モデルの使用例

  • 画像キャプショニング
  • 物体検出
  • ビジョン-言語タスク
  • 領域付きOCR
  • 密な領域キャプショニング

Florence-2モデルのFAQ

From Microsoft

Florence-2モデル のレビュー

読み込み中...

Florence-2モデル に似た人気のAIツール

Llama-3.2-11B-Vision-Instructは、視覚認識、画像推論、キャプショニングのために設計されたマルチモーダルAIモデルです。Metaによって開発され、テキストと画像の入力を統合して高度な画像理解能力を提供します。

AIモデルとLLM

Flamingoは、Google DeepMindが開発した単一のビジュアル言語モデル(VLM)であり、多様なマルチモーダルタスクにおける少数の例からの学習(few-shot learning)に優れています。画像、動画、テキストが混在した入力を処理し、関連する言語出力を生成します。追加のトレーニングなしで、タスク固有の例を最小限で済ませることができます。

AIモデルとLLM

Phi-4-reasoning-vision-15Bは、Microsoftによって開発されたマルチモーダルAIモデルで、視覚と言語の理解および推論能力を必要とするタスクに設計されています。科学的推論やコンピュータ使用エージェントタスクに優れており、さまざまなアプリケーションに適しています。

注目AIモデルとLLM

AlibabaによるQwen3 VL 8B Instructは、優れたテキスト理解、視覚認識、マルチモーダル推論を提供する強力なビジョン・ランゲージモデルです。DenseおよびMoEアーキテクチャをサポートし、さまざまなアプリケーションにおけるAI機能を強化します。

AIモデルとLLM

AI モデル

OscarとVinVLは、ビジョン・言語タスクのための高度なAIモデルです。Oscarはオブジェクト・セマンティクス・アラインメントを用いた事前学習により、最先端の結果を達成しています。VinVLは視覚表現を強化し、様々なビジョン・言語ベンチマークでの性能をさらに向上させています。このプロジェクトでは、再現およびさらなる研究のためのコード、事前学習済みモデル…

AIモデルとLLM

AI モデル

LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。

AIモデルとLLM

Mistral-7B-v0.1は、70億のパラメータを持つ事前学習済みの生成テキストモデルで、オープンソースを通じて人工知能を進化させることを目的としています。さまざまなベンチマークでLlama 2 13Bを上回り、自然言語処理タスクにおいて強力なツールとなっています。

注目AIモデルとLLM

AI モデル

MiniGPT-4は、凍結されたビジュアルエンコーダーと大規模言語モデルを連携させることで、視覚と言語の理解を強化するAIモデルです。詳細な画像説明の生成、ドラフトからのウェブサイト作成、画像に触発された物語の執筆、視覚的な問題の解決など、高度なマルチモーダル能力を発揮します。

AIモデルとLLM