Description
IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention) est un modèle de langage visuel en accès libre développé pour faire progresser la transparence et la démocratisation dans l'IA. Il s'agit d'une reproduction ouverte de Flamingo de DeepMind, un modèle de langage visuel de pointe qui n'a pas été rendu public. Similaire à des modèles comme GPT-4, IDEFICS peut traiter des séquences arbitraires d'images et de texte, générant des sorties textuelles cohérentes.
Construit exclusivement sur des données et des modèles publiquement disponibles, y compris LLaMA v1 et OpenCLIP, IDEFICS est disponible en deux variantes : une version de base et une version instruite. Chaque variante est proposée en deux tailles de paramètres : 9 milliards et 80 milliards. Le projet met l'accent sur la transparence en utilisant uniquement des données publiques, en fournissant des outils pour explorer les ensembles de données d'entraînement, en partageant les leçons techniques apprises et en menant des évaluations éthiques internes par le biais de requêtes adverses (red teaming) avant la publication.
IDEFICS excelle dans des tâches telles que répondre à des questions sur des images, décrire du contenu visuel et créer des histoires basées sur plusieurs images. Ses performances sont comparables à celles du modèle Flamingo original à code source fermé sur divers benchmarks de compréhension image-texte. Le modèle a été entraîné sur un mélange d'ensembles de données ouverts tels que Wikipedia, Public Multimodal Dataset et LAION, ainsi que sur un nouvel ensemble de données de 115 milliards de tokens appelé OBELICS, qui comprend 141 millions de documents web entrelacés image-texte.
L'équipe de développement s'engage à promouvoir la recherche ouverte dans les systèmes d'IA multimodaux. IDEFICS vise à servir de base solide pour la communauté de l'IA, complétant d'autres reproductions ouvertes comme OpenFlamingo. La charte éthique du projet a guidé les décisions, privilégiant l'autocritique, la transparence et l'équité. Les utilisateurs sont encouragés à explorer la démo, les cartes de modèle et la carte de jeu de données, et à fournir des commentaires pour aider à l'amélioration continue de ces modèles et à l'accessibilité de l'IA multimodale à grande échelle.
Points forts de Modèle de Langage Visuel IDEFICS
Modèle de langage visuel en accès libre
Reproduit des capacités de pointe
Accepte des entrées d'images et de texte entrelacées
Génère des sorties textuelles
Performances comparables à celles de modèles propriétaires
Disponible en tailles de 9 milliards et 80 milliards de paramètres
Versions de base et instruites proposées
Entraîné sur des données et modèles publiquement disponibles
Soutient la recherche en IA multimodale
Inclut une évaluation éthique par red teaming
Visualisation interactive de l'ensemble de données d'entraînement disponible
Premiers pas avec Modèle de Langage Visuel IDEFICS
Accéder au modèle : Trouvez les modèles IDEFICS sur le Hugging Face Hub.
Configurer l'environnement : Assurez-vous d'avoir la dernière version de transformers installée.
Charger le modèle et le processeur : Importez les classes nécessaires et chargez le checkpoint IDEFICS souhaité.
Préparer les entrées : Créez des prompts avec des chaînes de texte entrelacées et des URL d'images ou des images PIL.
Intégrer via API : Utilisez la méthode `generate` avec les entrées préparées et les arguments de génération.
Décoder la sortie : Traitez les IDs générés pour obtenir du texte lisible par l'homme.
Exécuter l'inférence : Exécutez le code pour générer du texte basé sur des entrées multimodales.
Cas d'utilisation de Modèle de Langage Visuel IDEFICS
- Question-Réponse sur Image
- Description de Contenu Visuel
- Narration Multimodale
- Base pour la Recherche Ouverte
- Transparence de l'IA
- Démocratisation de l'IA







