Description
Florence-2 est un modèle de fondation vision sophistiqué développé par Microsoft, hébergé sur Hugging Face. Il est conçu pour faire progresser une représentation unifiée pour une variété de tâches de vision. Le modèle utilise une approche basée sur des invites pour gérer efficacement un large éventail de tâches de vision et de vision-langage, telles que la légende, la détection d'objets et la segmentation. Florence-2 tire parti de l'ensemble de données FLD-5B, qui contient 5,4 milliards d'annotations à travers 126 millions d'images, pour exceller dans l'apprentissage multi-tâches.
L'architecture du modèle est de type séquence-à-séquence, ce qui lui permet de bien performer dans des contextes à zéro coup et ajustés. C'est un modèle de fondation vision compétitif, capable d'interpréter des invites textuelles simples pour exécuter diverses tâches. Florence-2 a été préentraîné avec une longueur de contexte de 4k, utilisant seulement 0,1 milliard d'échantillons pour un préentraînement continu, ce qui peut affecter la qualité de son entraînement.
Les capacités de Florence-2 incluent la gestion de tâches telles que l'ancrage de légendes à des phrases, la détection d'objets, la légende de régions denses et l'OCR avec sortie régionale. La performance du modèle dans des contextes à zéro coup est notable, avec des scores CIDEr élevés sur les ensembles de données COCO et NoCaps. De plus, Florence-2 a été ajusté sur une collection de tâches en aval, résultant en des modèles tels que Florence-2-base-ft et Florence-2-large-ft, qui performent bien dans diverses tâches de légende et de VQA.
Le modèle est disponible en différentes tailles, y compris Florence-2-base avec 0,23 milliard de paramètres et Florence-2-large avec 0,77 milliard de paramètres. Des ressources telles que des rapports techniques et des Jupyter Notebooks sont disponibles pour aider les utilisateurs à commencer avec le modèle. Florence-2 est un outil précieux pour les chercheurs et les développeurs travaillant sur des tâches de vision et de vision-langage, offrant une base robuste pour un développement et une application ultérieurs.
Points forts de Modèle Florence-2
Modèle de fondation vision avancé
Approche basée sur des invites
Gère les tâches de vision-langage
Architecture séquence-à-séquence
Contextes à zéro coup et ajustés
Utilise l'ensemble de données FLD-5B
Supporte la légende et la détection d'objets
OCR avec sortie régionale
Premiers pas avec Modèle Florence-2
Accéder à la page : Visitez la page du modèle Hugging Face
Charger le modèle : Téléchargez le modèle Florence-2
Configurer l'environnement : Mettez en place les dépendances nécessaires
Intégrer : Utilisez le modèle dans des applications
Ajuster : Modifiez le modèle pour des tâches spécifiques
Cas d'utilisation de Modèle Florence-2
- Légende d'Image
- Détection d'Objets
- Tâches Vision-Langage
- OCR avec Région
- Légende de Régions Denses









