説明
Florence-2は、Microsoftによって開発された洗練されたビジョン基盤モデルで、Hugging Faceにホストされています。さまざまなビジョンタスクのための統一された表現を進めるように設計されています。このモデルは、キャプショニング、物体検出、セグメンテーションなど、幅広いビジョンおよびビジョン-言語タスクを効率的に処理するためにプロンプトベースのアプローチを採用しています。Florence-2は、126百万の画像にわたる54億の注釈を含むFLD-5Bデータセットを活用して、マルチタスク学習において優れた性能を発揮します。
このモデルのアーキテクチャはシーケンス・ツー・シーケンスであり、ゼロショットおよびファインチューニング設定の両方で優れた性能を発揮します。Florence-2は、シンプルなテキストプロンプトを解釈してさまざまなタスクを実行できる競争力のあるビジョン基盤モデルです。Florence-2は、4kのコンテキスト長で事前学習されており、継続的な事前学習にはわずか1億サンプルを使用しているため、トレーニングの質に影響を与える可能性があります。
Florence-2の機能には、フレーズのグラウンディング、物体検出、密な領域キャプショニング、領域出力を伴うOCRなどのタスクを処理することが含まれます。ゼロショット設定におけるモデルの性能は注目に値し、COCOおよびNoCapsデータセットで高いCIDErスコアを記録しています。さらに、Florence-2は、さまざまなキャプショニングおよびVQAタスクで優れた性能を発揮するFlorence-2-base-ftおよびFlorence-2-large-ftなどの下流タスクのコレクションでファインチューニングされています。
このモデルは、0.23BパラメータのFlorence-2-baseおよび0.77BパラメータのFlorence-2-largeなど、さまざまなサイズで利用可能です。ユーザーがモデルを始めるための技術レポートやJupyterノートブックなどのリソースが利用可能です。Florence-2は、ビジョンおよびビジョン-言語タスクに取り組む研究者や開発者にとって貴重なツールであり、さらなる開発と応用のための堅牢な基盤を提供します。
Florence-2モデルのハイライト
高度なビジョン基盤モデル
プロンプトベースのアプローチ
ビジョン-言語タスクを処理
シーケンス・ツー・シーケンスアーキテクチャ
ゼロショットおよびファインチューニング設定
FLD-5Bデータセットを使用
キャプショニングおよび物体検出をサポート
領域出力を伴うOCR
Florence-2モデルをはじめる
ページにアクセス: Hugging Faceモデルページを訪問
モデルをロード: Florence-2モデルをダウンロード
環境を設定: 必要な依存関係を設定
統合: アプリケーションでモデルを使用
ファインチューニング: 特定のタスクにモデルを調整
Florence-2モデルの使用例
- 画像キャプショニング
- 物体検出
- ビジョン-言語タスク
- 領域付きOCR
- 密な領域キャプショニング









