Description
VideoPoet représente une avancée significative dans la synthèse vidéo pilotée par l'IA, fonctionnant comme un grand modèle linguistique conçu pour la génération vidéo en mode zero-shot. Son innovation principale réside dans une méthode de modélisation simple qui permet la conversion de tout modèle de langage autorégressif en un générateur vidéo sophistiqué. Cette approche permet la création de vidéos de haute qualité à partir d'invites textuelles, démontrant une capacité remarquable à produire une large gamme de mouvements larges, intéressants et de haute fidélité.
À sa base technique, VideoPoet utilise un tokenizer vidéo MAGVIT V2 pré-entraîné et un tokenizer audio SoundStream. Ces composants convertissent des clips d'images, vidéo et audio de longueurs variables en codes discrets au sein d'un vocabulaire unifié. Ces codes sont compatibles avec les modèles de langage basés sur le texte, facilitant une intégration transparente avec d'autres modalités comme le texte. Un modèle de langage autorégressif apprend ensuite à travers les modalités vidéo, image, audio et texte pour prédire le jeton vidéo ou audio suivant dans une séquence. Le cadre d'entraînement intègre un mélange d'objectifs d'apprentissage génératif multimodal, y compris le texte-vidéo, le texte-image, l'image-vidéo, la continuation d'images vidéo, le masquage et le remplissage vidéo, la stylisation vidéo et le vidéo-audio. Ces tâches peuvent être composées pour obtenir des capacités zero-shot supplémentaires, telles que la génération de texte-audio.
Les capacités de VideoPoet vont au-delà de la simple génération. Il peut produire des vidéos à mouvement élevé et de longueur variable basées sur des invites textuelles et peut également générer de l'audio pour correspondre à une vidéo d'entrée sans guidage textuel. Le modèle prend en charge la génération de vidéos en orientation carrée ou portrait, le rendant adapté au contenu de format court. De plus, il excelle dans l'édition vidéo contrôlable, permettant aux sujets de suivre différents mouvements ou styles, et dans l'édition interactive où les utilisateurs peuvent sélectionner parmi les candidats générés pour affiner les types de mouvement. La génération d'image-vidéo est également une fonctionnalité clé, transformant toute image d'entrée en une vidéo guidée par une invite textuelle. La stylisation zero-shot permet aux vidéos d'adopter divers styles artistiques basés sur des invites textuelles, et les mouvements de caméra contrôlables peuvent être spécifiés par l'ingénierie des invites, permettant des effets tels que les zooms arrière, les zooms dolly et les plans de drone FPV.
Le modèle démontre une génération vidéo de pointe, en particulier dans la production de mouvements diversifiés et de haute fidélité. Il peut générer des vidéos plus longues en prédisant itérativement une seconde de sortie basée sur un clip d'entrée d'une seconde, montrant une forte préservation de l'identité des objets. Cela fait de VideoPoet un outil puissant pour la narration visuelle, la création de contenu et l'exploration de nouvelles formes de synthèse médiatique. La recherche souligne son potentiel pour créer des récits visuels dynamiques et appliquer des effets stylistiques avec facilité.
Points forts de VideoPoet
Génération vidéo zero-shot à partir d'invites textuelles
Génération vidéo-audio sans guidage textuel
Prend en charge la génération texte-vidéo, texte-image et image-vidéo
Permet la continuation d'images vidéo, le masquage et le remplissage
Facilite la stylisation vidéo et les mouvements de caméra contrôlables
Capable de générer des vidéos de longueur variable
Maintient une forte préservation de l'identité des objets dans les clips plus longs
Prend en charge les orientations vidéo carrées et portrait pour le contenu court
Édition vidéo interactive avec sélection de candidats
Compose des objectifs d'apprentissage génératif pour des tâches multimodales
Utilise les tokenizers MAGVIT V2 et SoundStream
Produit du contenu vidéo à mouvement élevé et haute fidélité
Premiers pas avec VideoPoet
Accéder au modèle : Utilisez le modèle VideoPoet via son interface de recherche ou son API.
Saisir l'invite : Fournissez une description textuelle détaillée du contenu vidéo souhaité.
Spécifier les paramètres : Définissez l'orientation vidéo (carrée/portrait) et la longueur désirée.
Générer la vidéo : Lancez le processus de génération pour créer la séquence vidéo.
Générer l'audio : Optionnellement, générez l'audio correspondant à la vidéo créée.
Éditer la vidéo : Appliquez la stylisation, les mouvements de caméra ou l'édition interactive pour l'affinage.
Intégrer : Intégrez les clips vidéo générés dans des projets de narration ou de contenu.
Cas d'utilisation de VideoPoet
- Création de contenu
- Narration
- Montage vidéo
- Prototypage
- Exploration artistique
- Synchronisation audio-visuelle
- Vidéo courte
- Visualisation de concepts





