Description
MVDream est un projet open-source hébergé sur GitHub, développé par bytedance, qui se concentre sur la diffusion multi-vues pour la génération 3D. Ce dépôt contient le modèle de diffusion et le code de génération d'images 2D qui forment la base de l'article MVDream. Bien que ce dépôt fournisse les capacités de diffusion principales, la génération 3D réelle est gérée par un projet distinct, MVDream-threestudio.
L'objectif principal de MVDream est de générer des images multi-vues cohérentes à partir d'invites textuelles. Cette capacité est cruciale pour reconstruire ou générer des modèles 3D, car plusieurs vues fournissent les informations géométriques nécessaires. Le projet exploite la puissance des modèles de diffusion, en s'appuyant spécifiquement sur l'architecture et les principes de Stable Diffusion.
L'installation est simple, permettant aux utilisateurs de configurer l'environnement en utilisant le fichier requirements fourni ou en l'installant comme module Python. Le projet propose des modèles pré-entraînés, y compris des versions basées sur Stable Diffusion 2.1 Base et Stable Diffusion 1.5, disponibles sur Hugging Face. Ces modèles sont sous licence OpenRAIL.
Les utilisateurs peuvent générer des images multi-vues directement depuis la ligne de commande en utilisant des invites textuelles. De plus, un script Gradio est fourni pour une expérience interactive basée sur une interface graphique. Les modèles peuvent être chargés automatiquement depuis Hugging Face ou manuellement à l'aide de fichiers de configuration et de points de contrôle. Le processus d'inférence implique la génération de bruit, la définition des pas de temps et la fourniture d'informations de conditionnement telles que les embeddings de texte et les paramètres de caméra.
MVDream est fortement inspiré et basé sur le projet Stable Diffusion, avec des remerciements à ses auteurs pour leurs contributions open-source. L'objectif du projet est de faire progresser la recherche et le développement dans la génération 3D en fournissant des outils de diffusion multi-vues accessibles et puissants.
Fonctionnalités principales de MVDream
Génération d'images multi-vues à partir d'invites textuelles
Architecture de modèle de diffusion
Basé sur Stable Diffusion
Fournit le code de génération d'images 2D
Prend en charge les modèles Stable Diffusion 2.1 Base et 1.5
Interface en ligne de commande pour la génération texte-vers-image
Script Gradio pour une interaction basée sur une interface graphique
Chargement automatique des modèles depuis Hugging Face
Chargement manuel des modèles via des fichiers de configuration et de points de contrôle
Licence OpenRAIL pour les modèles
Option d'installation en tant que module Python
Premiers pas avec MVDream
Cloner : Clonez le dépôt MVDream depuis GitHub.
Installer : Installez les dépendances en utilisant `pip install -r requirements.txt` ou `pip install -e .`.
Configurer : Sélectionnez et chargez un modèle pré-entraîné (par exemple, `sd-v2.1-base-4view`).
Générer : Exécutez les scripts de génération texte-vers-image (par exemple, `python scripts/t2i.py`).
Interagir : Utilisez l'application Gradio pour une expérience graphique (`python scripts/gradio_app.py`).
Inférence : Effectuez l'inférence du modèle avec un bruit personnalisé, des pas de temps et un conditionnement.
Cas d'utilisation de MVDream
- Génération d'actifs 3D
- Synthèse d'images multi-vues
- Recherche en IA générative
- Pipeline de graphisme informatique
- Contenu de réalité virtuelle
- Contenu de réalité augmentée






