Description
DreamFusion représente une avancée significative dans la synthèse texte-vers-3D, surmontant les limitations des méthodes existantes qui nécessitent des ensembles de données 3D à grande échelle et des architectures spécialisées. Ce modèle d'IA utilise un modèle de diffusion texte-vers-image 2D pré-entraîné, tel qu'Imagen, comme un puissant prior pour la génération de contenu 3D. L'innovation principale réside dans une nouvelle fonction de perte basée sur la distillation de densité de probabilité, permettant au modèle de diffusion 2D de guider l'optimisation d'une représentation 3D paramétrique.
Au cœur de DreamFusion se trouve un processus d'optimisation de type DeepDream. Il initialise un modèle 3D, spécifiquement un Neural Radiance Field (NeRF), et l'affine itérativement par descente de gradient. L'objectif est de minimiser une fonction de perte dérivée de rendus 2D du NeRF sous différents angles. Ces rendus sont évalués par rapport à l'invite textuelle à l'aide du modèle de diffusion 2D pré-entraîné. Cette approche distille efficacement les connaissances intégrées dans des milliards de paires image-texte du modèle 2D dans une représentation 3D cohérente.
Les modèles 3D résultants sont très polyvalents. Ils peuvent être visualisés sous n'importe quel angle, permettant une inspection complète et une intégration dans divers contextes visuels. De plus, les objets générés sont relightables, ce qui signifie que leur apparence peut être manipulée avec un éclairage arbitraire, et ils peuvent être intégrés de manière transparente dans des environnements 3D existants. Cette flexibilité fait de DreamFusion un outil précieux pour les créateurs et les développeurs.
La méthodologie de DreamFusion ne nécessite aucune donnée d'entraînement 3D ni aucune modification du modèle de diffusion d'image sous-jacent, soulignant l'efficacité de l'exploitation de modèles pré-entraînés comme priors. Les NeRFs générés présentent une apparence de haute fidélité, des informations de profondeur précises et des normales détaillées. Pour des applications pratiques, ces modèles NeRF peuvent être exportés vers des formats de maillage standard à l'aide d'algorithmes tels que marching cubes, facilitant l'intégration dans des moteurs de rendu 3D et des logiciels de modélisation populaires. Le projet présente également des exemples de composition d'objets générés dans des scènes et fournit une galerie de centaines d'actifs générés.
Points forts de DreamFusion
Génère des objets 3D à partir d'invites textuelles
Utilise des modèles de diffusion 2D pré-entraînés comme priors
Crée des Neural Radiance Fields (NeRFs)
Ne nécessite aucune donnée d'entraînement 3D
Aucune modification du modèle de diffusion d'image nécessaire
Produit des modèles 3D relightables
Prend en charge l'éclairage arbitraire
Permet la composition dans des environnements 3D
Génère une apparence, une profondeur et des normales de haute fidélité
Capacité d'exportation de maillage via marching cubes
Score Distillation Sampling (SDS) pour la génération
Inclut des régulariseurs et des stratégies d'optimisation pour l'amélioration de la géométrie
Premiers pas avec DreamFusion
Entrée de l'invite textuelle : Fournissez une légende descriptive pour l'objet 3D souhaité.
Optimisation du modèle : DreamFusion utilise un modèle de diffusion 2D comme prior pour optimiser un modèle NeRF 3D.
Rendu et évaluation : Le NeRF est rendu à partir d'angles aléatoires, et ses images 2D sont évaluées par rapport à l'invite textuelle.
Raffinement itératif : La descente de gradient ajuste les paramètres du NeRF pour minimiser la perte, améliorant la cohérence et l'apparence.
Exportation de maillage : Une fois optimisé, le NeRF peut être converti en maillage pour être utilisé dans d'autres logiciels 3D.
Cas d'utilisation de DreamFusion
- Génération d'actifs 3D
- Prototypage
- Création de contenu
- Recherche et développement
- Construction de mondes virtuels
- Outils éducatifs






