Descrição
O NVIDIA Dynamo-Triton, anteriormente conhecido como NVIDIA Triton Inference Server, é um software de código aberto projetado para facilitar a implantação de modelos de IA em principais estruturas como TensorRT, PyTorch, ONNX, OpenVINO, Python e RAPIDS FIL. Esta poderosa ferramenta oferece alto desempenho por meio de recursos como agrupamento dinâmico, execução concorrente e configurações otimizadas. O Dynamo-Triton é capaz de suportar uma variedade de cargas de trabalho, incluindo em tempo real, em lotes, em conjunto e streaming de áudio/vídeo, e opera perfeitamente em GPUs NVIDIA, aceleradores não NVIDIA, CPUs x86 e ARM.
Como uma solução de código aberto, o Dynamo-Triton é compatível com fluxos de trabalho de DevOps e MLOps, integrando-se efetivamente ao Kubernetes para escalabilidade e ao Prometheus para monitoramento. Foi projetado para funcionar em plataformas de IA em nuvem e locais, proporcionando um ambiente seguro e pronto para produção como parte do NVIDIA AI Enterprise. Este ambiente inclui APIs estáveis e amplo suporte para a implantação de IA, garantindo que os desenvolvedores possam gerenciar seus modelos de IA de forma eficiente.
Para aplicações de modelos de linguagem grande (LLM), a NVIDIA oferece ferramentas adicionais como o NVIDIA Dynamo, que é adaptado para inferência LLM e implantação em múltiplos modos. Esta ferramenta complementa o Dynamo-Triton ao fornecer otimizações específicas para LLM, incluindo serviço desagregado, cache de prefixo e cache de chave-valor para armazenamento. Os desenvolvedores podem acessar uma riqueza de recursos, incluindo documentação, tutoriais e kits de início, para ajudá-los a começar com o Dynamo-Triton e maximizar suas capacidades em seus projetos de IA.
Recursos principais de Software de Código Aberto Dynamo-Triton
Código Aberto
Suporta TensorRT, PyTorch, ONNX, OpenVINO
Cargas de trabalho em tempo real e em lotes
Agrupamento dinâmico
Execução concorrente
Integra-se ao Kubernetes
Compatível com Prometheus
Funciona em hardware NVIDIA e não NVIDIA
Suporta implantação em nuvem e local
Otimizações específicas para LLM disponíveis
Como usar Software de Código Aberto Dynamo-Triton?
Configurar: Prepare seu ambiente para implantar modelos de IA.
Integrar: Conecte o Dynamo-Triton com suas estruturas de IA escolhidas.
Implantar: Lance seus modelos de IA usando o Triton Inference Server.
Monitorar: Use o Prometheus para acompanhar o desempenho e o uso de recursos.
Escalar: Utilize o Kubernetes para escalar suas implantações conforme necessário.
Casos de uso de Software de Código Aberto Dynamo-Triton
- Inferência de IA em Tempo Real
- Processamento em Lote
- Streaming de Áudio/Vídeo
- Modelos de Linguagem Grande
- Implantação em Nuvem





