Aller au contenu principal
ToolPotion

Logiciel Open-Source Dynamo-Triton

NVIDIA Dynamo-Triton permet le déploiement de modèles d'IA à travers divers frameworks tels que TensorRT, PyTorch et ONNX. Il prend en charge les charges de travail en temps réel, par lots et en streaming, ce qui le rend adapté à diverses applications d'IA.

Visiter l'URL
Partager

Description

NVIDIA Dynamo-Triton, anciennement connu sous le nom de NVIDIA Triton Inference Server, est un logiciel open-source conçu pour faciliter le déploiement de modèles d'IA à travers les principaux frameworks tels que TensorRT, PyTorch, ONNX, OpenVINO, Python et RAPIDS FIL. Cet outil puissant offre des performances élevées grâce à des fonctionnalités telles que le traitement par lots dynamique, l'exécution concurrente et des configurations optimisées. Dynamo-Triton est capable de prendre en charge une variété de charges de travail, y compris les charges de travail en temps réel, par lots, en ensemble et en streaming audio/vidéo, et il fonctionne de manière transparente sur les GPU NVIDIA, les accélérateurs non-NVIDIA, les CPU x86 et ARM.

En tant que solution open-source, Dynamo-Triton est compatible avec les workflows DevOps et MLOps, s'intégrant efficacement avec Kubernetes pour le dimensionnement et Prometheus pour la surveillance. Il est conçu pour fonctionner à la fois sur des plateformes d'IA cloud et sur site, fournissant un environnement sécurisé et prêt pour la production dans le cadre de NVIDIA AI Enterprise. Cet environnement comprend des API stables et un support étendu pour le déploiement d'IA, garantissant que les développeurs peuvent gérer efficacement leurs modèles d'IA.

Pour les applications de grands modèles de langage (LLM), NVIDIA propose des outils supplémentaires comme NVIDIA Dynamo, qui est adapté pour l'inférence LLM et le déploiement multi-mode. Cet outil complète Dynamo-Triton en fournissant des optimisations spécifiques aux LLM, y compris le service désagrégé, la mise en cache de préfixes et la mise en cache clé-valeur vers le stockage. Les développeurs peuvent accéder à une multitude de ressources, y compris de la documentation, des tutoriels et des kits de démarrage, pour les aider à commencer avec Dynamo-Triton et maximiser ses capacités dans leurs projets d'IA.

Fonctionnalités principales de Logiciel Open-Source Dynamo-Triton

  • Open Source

  • Prend en charge TensorRT, PyTorch, ONNX, OpenVINO

  • Charges de travail en temps réel et par lots

  • Traitement par lots dynamique

  • Exécution concurrente

  • S'intègre avec Kubernetes

  • Compatible avec Prometheus

  • Fonctionne sur le matériel NVIDIA et non-NVIDIA

  • Prend en charge le déploiement cloud et sur site

  • Optimisations spécifiques aux LLM disponibles

Premiers pas avec Logiciel Open-Source Dynamo-Triton

  1. Configurer : Configurez votre environnement pour déployer des modèles d'IA.

  2. Intégrer : Connectez Dynamo-Triton avec vos frameworks d'IA choisis.

  3. Déployer : Lancez vos modèles d'IA en utilisant le Triton Inference Server.

  4. Surveiller : Utilisez Prometheus pour suivre les performances et l'utilisation des ressources.

  5. Évoluer : Utilisez Kubernetes pour dimensionner vos déploiements selon les besoins.

Cas d'utilisation de Logiciel Open-Source Dynamo-Triton

  • Inférence IA en temps réel
  • Traitement par lots
  • Streaming Audio/Video
  • Grands Modèles de Langage
  • Déploiement Cloud

FAQ de Logiciel Open-Source Dynamo-Triton

From NVIDIA

Avis sur Logiciel Open-Source Dynamo-Triton

Chargement...

Outils IA populaires comme Logiciel Open-Source Dynamo-Triton

LiteRT est le framework ML haute performance de Google pour le déploiement de modèles GenAI et ML sur des plateformes embarquées. Il offre une conversion, une exécution et une…

MLOps et déploiement de modèles

TensorFlow Extended (TFX) est une plateforme d'apprentissage automatique à l'échelle de production de Google. Elle fournit un cadre de configuration et des bibliothèques partagées…

MLOps et déploiement de modèles

Together AI fournit une plateforme d'IA complète, le Cloud natif pour l'IA, pour l'inférence, le fine-tuning et les clusters GPU. Elle est alimentée par une recherche de pointe,…

En vedettePlateformes de machine learning

Plateformes IA

Une plateforme d'infrastructure IA pour les développeurs afin de déployer, d'affiner et d'exécuter plus de 200 LLM optimisés et modèles multimodaux via une API compatible OpenAI…

En vedetteMLOps et déploiement de modèles

Applications IA

Runware est une plateforme d'inférence d'IA générative qui fournit une API unifiée pour les modèles d'image, de vidéo, d'audio, 3D, LLM et de vision. Elle propose plus de 400 000…

MLOps et déploiement de modèles

Plateformes IA

Cerebrium propose une infrastructure GPU serverless pour l'IA en temps réel, permettant des démarrages à froid en moins d'une seconde pour les agents vocaux, les modèles vidéo et…

En vedetteMLOps et déploiement de modèles

Plateformes IA

KServe est une plateforme open-source native de Kubernetes pour l'inférence IA auto-hébergée. Elle offre une solution unifiée pour l'IA générative et prédictive, simplifiant les…

MLOps et déploiement de modèles

Frameworks IA

OpenVINO est une boîte à outils open-source pour déployer des solutions d'IA haute performance sur du matériel diversifié. Elle permet aux développeurs de convertir, d'optimiser…

Outils de vision par ordinateur