Descripción
NVIDIA Dynamo-Triton, anteriormente conocido como NVIDIA Triton Inference Server, es un software de código abierto diseñado para facilitar el despliegue de modelos de IA a través de marcos principales como TensorRT, PyTorch, ONNX, OpenVINO, Python y RAPIDS FIL. Esta poderosa herramienta ofrece un alto rendimiento a través de características como el procesamiento dinámico por lotes, la ejecución concurrente y configuraciones optimizadas. Dynamo-Triton es capaz de soportar una variedad de cargas de trabajo, incluyendo en tiempo real, por lotes, en conjunto y streaming de audio/video, y opera sin problemas en GPUs de NVIDIA, aceleradores no NVIDIA, CPUs x86 y ARM.
Como solución de código abierto, Dynamo-Triton es compatible con flujos de trabajo tanto de DevOps como de MLOps, integrándose de manera efectiva con Kubernetes para escalado y Prometheus para monitoreo. Está diseñado para funcionar en plataformas de IA en la nube y locales, proporcionando un entorno seguro y listo para producción como parte de NVIDIA AI Enterprise. Este entorno incluye APIs estables y un amplio soporte para el despliegue de IA, asegurando que los desarrolladores puedan gestionar eficientemente sus modelos de IA.
Para aplicaciones de modelos de lenguaje grande (LLM), NVIDIA ofrece herramientas adicionales como NVIDIA Dynamo, que está diseñado para la inferencia de LLM y el despliegue en múltiples modos. Esta herramienta complementa a Dynamo-Triton al proporcionar optimizaciones específicas para LLM, incluyendo servicio desagregado, almacenamiento en caché de prefijos y almacenamiento en caché de clave-valor. Los desarrolladores pueden acceder a una gran cantidad de recursos, incluyendo documentación, tutoriales y kits de inicio, para ayudarles a comenzar con Dynamo-Triton y maximizar sus capacidades en sus proyectos de IA.
Características principales de Software de Código Abierto Dynamo-Triton
Código Abierto
Soporta TensorRT, PyTorch, ONNX, OpenVINO
Cargas de trabajo en tiempo real y por lotes
Procesamiento dinámico por lotes
Ejecución concurrente
Se integra con Kubernetes
Compatible con Prometheus
Funciona en hardware de NVIDIA y no NVIDIA
Soporta despliegue en la nube y local
Optimización específica para LLM disponible
¿Cómo usar Software de Código Abierto Dynamo-Triton?
Configurar: Prepara tu entorno para desplegar modelos de IA.
Integrar: Conecta Dynamo-Triton con tus marcos de IA elegidos.
Desplegar: Lanza tus modelos de IA utilizando el Triton Inference Server.
Monitorear: Usa Prometheus para rastrear el rendimiento y el uso de recursos.
Escalar: Utiliza Kubernetes para escalar tus despliegues según sea necesario.
Casos de uso de Software de Código Abierto Dynamo-Triton
- Inferencia de IA en Tiempo Real
- Procesamiento por Lotes
- Streaming de Audio/Video
- Modelos de Lenguaje Grande
- Despliegue en la Nube





