Description
NVIDIA Dynamo-Triton, anciennement connu sous le nom de NVIDIA Triton Inference Server, est un logiciel open-source conçu pour faciliter le déploiement de modèles d'IA à travers les principaux frameworks tels que TensorRT, PyTorch, ONNX, OpenVINO, Python et RAPIDS FIL. Cet outil puissant offre des performances élevées grâce à des fonctionnalités telles que le traitement par lots dynamique, l'exécution concurrente et des configurations optimisées. Dynamo-Triton est capable de prendre en charge une variété de charges de travail, y compris les charges de travail en temps réel, par lots, en ensemble et en streaming audio/vidéo, et il fonctionne de manière transparente sur les GPU NVIDIA, les accélérateurs non-NVIDIA, les CPU x86 et ARM.
En tant que solution open-source, Dynamo-Triton est compatible avec les workflows DevOps et MLOps, s'intégrant efficacement avec Kubernetes pour le dimensionnement et Prometheus pour la surveillance. Il est conçu pour fonctionner à la fois sur des plateformes d'IA cloud et sur site, fournissant un environnement sécurisé et prêt pour la production dans le cadre de NVIDIA AI Enterprise. Cet environnement comprend des API stables et un support étendu pour le déploiement d'IA, garantissant que les développeurs peuvent gérer efficacement leurs modèles d'IA.
Pour les applications de grands modèles de langage (LLM), NVIDIA propose des outils supplémentaires comme NVIDIA Dynamo, qui est adapté pour l'inférence LLM et le déploiement multi-mode. Cet outil complète Dynamo-Triton en fournissant des optimisations spécifiques aux LLM, y compris le service désagrégé, la mise en cache de préfixes et la mise en cache clé-valeur vers le stockage. Les développeurs peuvent accéder à une multitude de ressources, y compris de la documentation, des tutoriels et des kits de démarrage, pour les aider à commencer avec Dynamo-Triton et maximiser ses capacités dans leurs projets d'IA.
Fonctionnalités principales de Logiciel Open-Source Dynamo-Triton
Open Source
Prend en charge TensorRT, PyTorch, ONNX, OpenVINO
Charges de travail en temps réel et par lots
Traitement par lots dynamique
Exécution concurrente
S'intègre avec Kubernetes
Compatible avec Prometheus
Fonctionne sur le matériel NVIDIA et non-NVIDIA
Prend en charge le déploiement cloud et sur site
Optimisations spécifiques aux LLM disponibles
Comment utiliser Logiciel Open-Source Dynamo-Triton ?
Configurer : Configurez votre environnement pour déployer des modèles d'IA.
Intégrer : Connectez Dynamo-Triton avec vos frameworks d'IA choisis.
Déployer : Lancez vos modèles d'IA en utilisant le Triton Inference Server.
Surveiller : Utilisez Prometheus pour suivre les performances et l'utilisation des ressources.
Évoluer : Utilisez Kubernetes pour dimensionner vos déploiements selon les besoins.
Cas d'utilisation de Logiciel Open-Source Dynamo-Triton
- Inférence IA en temps réel
- Traitement par lots
- Streaming Audio/Video
- Grands Modèles de Langage
- Déploiement Cloud





