Description
TwelveLabs est une plateforme d'intelligence vidéo pour les entreprises et une API alimentée par des modèles de base multimodaux et natifs à la vidéo. Elle permet aux développeurs de créer des applications avec une recherche vidéo sémantique, une compréhension vidéo multimodale et des embeddings vidéo, en traitant ensemble le visuel, l'audio, la parole et le texte à l'écran afin que les utilisateurs puissent rechercher, analyser et raisonner sur le contenu vidéo.
Avec la recherche sémantique, vous pouvez interroger des bibliothèques vidéo entières en langage naturel pour localiser des actions spécifiques, des scènes, des dialogues et même des émotions humaines à travers des heures ou des années de séquences sans nécessiter de balises. La plateforme segmente également le contenu par scène et rythme, génère des textes tels que des résumés, des chapitres et des moments forts, prend en charge la conformité et le scan de sécurité de marque, et produit des embeddings pour construire des fonctionnalités de recherche, de classification et de recommandation. Son infrastructure ingère des données multimodales à travers un seul pipeline à environ 60 fois la vitesse réelle, indexant une heure de vidéo en environ une minute à plus de 10 000 heures par jour.
TwelveLabs est construit sur deux modèles de base : Marengo, un modèle d'embedding multimodal qui transforme la vidéo en embeddings spatiotemporels trouvables par contenu dans de nombreuses langues, et Pegasus, un modèle de langage vidéo qui raisonne en continu sur l'arc temporel complet d'un actif jusqu'à environ deux heures. Il s'intègre via API, SDK et MCP, et est utilisé dans les médias et le divertissement, la publicité, le sport, le gouvernement et la sécurité.
La plateforme est certifiée SOC 2 Type II avec un traitement des données crypté et peut être déployée sur le cloud, le cloud privé, sur site ou dans des environnements isolés. Elle propose un niveau gratuit pour les tests (moins de 10 heures d'indexation) ainsi que des plans Développeur et Entreprise, avec un tarif à l'utilisation.
Fonctionnalités principales de TwelveLabs
Recherche sémantique en langage naturel à travers des bibliothèques vidéo entières
Compréhension multimodale à travers la vision, l'audio, la parole et le texte à l'écran
Embeddings vidéo pour la recherche, la classification et les recommandations
Génération de texte à partir de vidéos (résumés, chapitres, moments forts)
Segmentation automatique du contenu et scan de conformité
Ingestion à grande vitesse à ~60 fois la vitesse réelle, plus de 10 000 heures par jour
Modèle d'embedding Marengo et modèle de langage vidéo Pegasus
Accès API, SDK et MCP avec déploiement flexible sur cloud, sur site et dans des environnements isolés
Comment utiliser TwelveLabs ?
Indexez votre vidéo : ingérez votre bibliothèque via l'API ou le SDK.
Recherchez ou analysez : interrogez des moments en langage naturel ou demandez des résumés et des insights.
Générez des embeddings : transformez la vidéo en vecteurs pour la recherche, la classification ou les recommandations.
Intégrez : construisez des fonctionnalités dans votre application via l'API, le SDK ou le MCP.
Déployez : exécutez dans le cloud, le cloud privé, sur site ou dans un environnement isolé.
Cas d'utilisation de TwelveLabs
- Recherche d'archives médiatiques
- Génération de moments forts et de clips
- Placement d'annonces contextuelles
- Conformité et sécurité de la marque
- Sécurité et révision d'incidents







