Description
PanoHead est un dépôt de code pour l'article CVPR 2023 intitulé "PanoHead: Geometry-Aware 3D Full-Head Synthesis in 360 degree." Ce projet introduit un nouveau modèle génératif 3D-aware capable de synthétiser des images de haute qualité et cohérentes en vue de têtes humaines complètes sur une plage de 360 degrés. Contrairement aux méthodes précédentes qui sont souvent limitées aux vues quasi frontales ou qui peinent avec la cohérence 3D à de grands angles, PanoHead utilise des images réelles et non structurées pour l'entraînement, comblant ainsi le fossé d'alignement des données.
L'innovation principale réside dans un processus d'alignement d'images auto-adaptatif en deux étapes conçu pour un entraînement robuste des GAN 3D. De plus, il emploie une représentation volumique neuronale tri-grille pour surmonter les problèmes d'enchevêtrement de caractéristiques courants dans les formulations tri-plans, en particulier pour l'avant et l'arrière de la tête. PanoHead intègre des connaissances a priori issues de la segmentation d'images 2D dans l'apprentissage contradictoire des structures de scènes neuronales 3D, facilitant la synthèse de têtes composables sur divers arrière-plans. Cette approche améliore considérablement la génération de têtes 3D avec une géométrie précise et des apparences diverses, y compris des coiffures complexes, rendables à partir de poses arbitraires.
Au-delà de la synthèse, PanoHead démontre la capacité de reconstruire des têtes 3D complètes à partir d'une seule image d'entrée, permettant la création d'avatars 3D réalistes personnalisés. Le dépôt fournit du code pour générer des résultats tels que des vidéos, des images et des formes 3D (fichiers .mrc), ainsi que des scripts pour la reconstruction complète de têtes à partir d'images uniques et des interpolations entre différentes générations de têtes. Il comprend également des exemples pour entraîner le modèle à partir de zéro ou pour affiner des réseaux pré-entraînés, ainsi que des instructions pour évaluer les résultats générés à l'aide des métriques fournies.
Le projet est basé sur le code EG3D et nécessite des configurations matérielles et logicielles spécifiques, notamment Linux, des GPU NVIDIA haut de gamme, Python 3.8+, PyTorch 1.11.0+ et le toolkit CUDA 11.3 ou une version ultérieure. Le dépôt comprend des instructions détaillées pour configurer l'environnement, télécharger les modèles pré-entraînés et exécuter divers scripts de génération et d'entraînement. Il est présenté comme une implémentation de référence pour la recherche.
Fonctionnalités principales de PanoHead
Synthèse 3D de têtes complètes à 360 degrés
Modèle génératif sensible à la géométrie
Génération d'images cohérentes en vue
Entraînement avec des images réelles
Alignement d'images auto-adaptatif en deux étapes
Représentation volumique neuronale tri-grille
Intégration de priors de segmentation d'images 2D
Reconstruction 3D complète de têtes à partir d'images uniques
Génération d'apparences diverses et de géométrie détaillée
Prise en charge des coiffures complexes
Rendu dans des poses arbitraires
Code pour générer des vidéos, des images et des formes 3D
Premiers pas avec PanoHead
Cloner le dépôt : Obtenez le code PanoHead depuis GitHub.
Installer les dépendances : Configurez l'environnement Python en utilisant le fichier environment.yml fourni.
Télécharger les modèles : Obtenez les modèles de réseaux pré-entraînés et placez-les dans le répertoire racine.
Générer les résultats : Exécutez les scripts Python pour générer des vidéos, des images ou des formes 3D.
Reconstruire les têtes : Utilisez les scripts fournis pour la reconstruction complète de têtes à partir d'images uniques.
Entraîner le modèle : Suivez les instructions pour entraîner ou affiner le modèle PanoHead.
Évaluer les métriques : Exécutez les scripts pour évaluer la qualité des sorties générées.
Cas d'utilisation de PanoHead
- Synthèse de têtes 3D
- Création d'avatars
- Essayage virtuel
- Recherche en infographie
- Génération de contenu
- Rendu invariant à la pose
- Techniques d'alignement de données








