Description
LGM, acronyme de Large Multi-View Gaussian Model, est un framework avancé conçu pour la création de contenu 3D haute résolution. Ce projet, présenté à l'ECCV 2024 sous forme d'article oral, offre une implémentation robuste d'un nouveau modèle Gaussien capable de générer des actifs 3D détaillés à partir de plusieurs vues d'entrée. Le cœur de LGM réside dans sa capacité à exploiter les informations multi-vues pour reconstruire et rendre des scènes 3D complexes avec une fidélité impressionnante.
Le projet fournit un ensemble complet d'outils pour les chercheurs et les développeurs intéressés par la génération de contenu 3D. Cela comprend le dépôt de code officiel, les poids de modèles pré-entraînés disponibles au téléchargement et des instructions claires pour l'inférence. LGM prend en charge les pipelines de génération text-to-3D et image-to-3D, ce qui en fait un outil polyvalent pour diverses applications créatives et techniques. L'implémentation s'appuie sur les recherches existantes en matière de Gaussian splatting et de techniques de rendu neuronal, visant à repousser les limites de la qualité et de la résolution dans la synthèse 3D.
Les principales capacités de LGM incluent sa sortie haute résolution, permettant la création de modèles et de scènes 3D détaillés. L'architecture du modèle est optimisée pour les entrées multi-vues, permettant une reconstruction précise de la géométrie et de l'apparence. Le projet propose également une interface graphique locale pour visualiser les fichiers PLY enregistrés et des scripts pour la conversion de maillage, facilitant ainsi l'intégration dans les flux de travail 3D existants. Bien que le jeu de données d'entraînement soit basé sur AWS et ne soit pas directement transférable, le projet fournit le cadre du code d'entraînement et un sous-ensemble filtré du jeu de données Objaverse pour les utilisateurs qui souhaitent entraîner leurs propres modèles.
LGM est particulièrement pertinent pour les chercheurs en vision par ordinateur et en graphisme, les artistes 3D, les développeurs de jeux et toute personne impliquée dans la création ou la manipulation d'actifs 3D. La nature open-source du projet et sa documentation détaillée encouragent les contributions de la communauté et le développement ultérieur. L'accent mis sur la sortie haute résolution et la cohérence multi-vues positionne LGM comme une avancée significative dans le domaine de la modélisation 3D générative.
Fonctionnalités principales de LGM : Large Multi-View Gaussian Model
Création de contenu 3D haute résolution
Implémentation du Large Multi-View Gaussian Model
Prend en charge la génération text-to-3D
Prend en charge la génération image-to-3D
Code officiel et poids pré-entraînés fournis
Inclut des scripts d'inférence
Interface graphique locale pour la visualisation de modèles 3D
Utilitaires de conversion de maillage
Basé sur les techniques de Gaussian Splatting
Article oral ECCV 2024
Premiers pas avec LGM : Large Multi-View Gaussian Model
Cloner le dépôt : Obtenez le code LGM depuis GitHub.
Installer les dépendances : Configurez les paquets Python requis, y compris PyTorch et xformers.
Télécharger les poids : Obtenez les points de contrôle du modèle pré-entraîné depuis Hugging Face.
Configurer l'inférence : Spécifiez les chemins de l'espace de travail et des tests pour la génération.
Exécuter l'inférence : Lancez le script `infer.py` pour la génération 3D.
Visualiser les résultats : Utilisez `gui.py` pour visualiser les fichiers PLY générés.
Convertir en maillage : Employez `convert.py` pour l'extraction de maillage.
Cas d'utilisation de LGM : Large Multi-View Gaussian Model
- Génération d'actifs 3D haute résolution
- Création de contenu text-to-3D
- Reconstruction image-to-3D
- Contenu 3D pour AR/VR
- Actifs pour le développement de jeux
- Recherche en 3D générative






