Pular para o conteúdo principal
ToolPotion

Software de Código Aberto Dynamo-Triton

O NVIDIA Dynamo-Triton permite a implantação de modelos de IA em várias estruturas como TensorRT, PyTorch e ONNX. Suporta cargas de trabalho em tempo real, em lotes e de streaming, tornando-o adequado para diversas aplicações de IA.

Visitar URL
Compartilhar

Descrição

O NVIDIA Dynamo-Triton, anteriormente conhecido como NVIDIA Triton Inference Server, é um software de código aberto projetado para facilitar a implantação de modelos de IA em principais estruturas como TensorRT, PyTorch, ONNX, OpenVINO, Python e RAPIDS FIL. Esta poderosa ferramenta oferece alto desempenho por meio de recursos como agrupamento dinâmico, execução concorrente e configurações otimizadas. O Dynamo-Triton é capaz de suportar uma variedade de cargas de trabalho, incluindo em tempo real, em lotes, em conjunto e streaming de áudio/vídeo, e opera perfeitamente em GPUs NVIDIA, aceleradores não NVIDIA, CPUs x86 e ARM.

Como uma solução de código aberto, o Dynamo-Triton é compatível com fluxos de trabalho de DevOps e MLOps, integrando-se efetivamente ao Kubernetes para escalabilidade e ao Prometheus para monitoramento. Foi projetado para funcionar em plataformas de IA em nuvem e locais, proporcionando um ambiente seguro e pronto para produção como parte do NVIDIA AI Enterprise. Este ambiente inclui APIs estáveis e amplo suporte para a implantação de IA, garantindo que os desenvolvedores possam gerenciar seus modelos de IA de forma eficiente.

Para aplicações de modelos de linguagem grande (LLM), a NVIDIA oferece ferramentas adicionais como o NVIDIA Dynamo, que é adaptado para inferência LLM e implantação em múltiplos modos. Esta ferramenta complementa o Dynamo-Triton ao fornecer otimizações específicas para LLM, incluindo serviço desagregado, cache de prefixo e cache de chave-valor para armazenamento. Os desenvolvedores podem acessar uma riqueza de recursos, incluindo documentação, tutoriais e kits de início, para ajudá-los a começar com o Dynamo-Triton e maximizar suas capacidades em seus projetos de IA.

Recursos principais de Software de Código Aberto Dynamo-Triton

  • Código Aberto

  • Suporta TensorRT, PyTorch, ONNX, OpenVINO

  • Cargas de trabalho em tempo real e em lotes

  • Agrupamento dinâmico

  • Execução concorrente

  • Integra-se ao Kubernetes

  • Compatível com Prometheus

  • Funciona em hardware NVIDIA e não NVIDIA

  • Suporta implantação em nuvem e local

  • Otimizações específicas para LLM disponíveis

Primeiros passos com Software de Código Aberto Dynamo-Triton

  1. Configurar: Prepare seu ambiente para implantar modelos de IA.

  2. Integrar: Conecte o Dynamo-Triton com suas estruturas de IA escolhidas.

  3. Implantar: Lance seus modelos de IA usando o Triton Inference Server.

  4. Monitorar: Use o Prometheus para acompanhar o desempenho e o uso de recursos.

  5. Escalar: Utilize o Kubernetes para escalar suas implantações conforme necessário.

Casos de uso de Software de Código Aberto Dynamo-Triton

  • Inferência de IA em Tempo Real
  • Processamento em Lote
  • Streaming de Áudio/Vídeo
  • Modelos de Linguagem Grande
  • Implantação em Nuvem

Perguntas frequentes de Software de Código Aberto Dynamo-Triton

From NVIDIA

Avaliações de Software de Código Aberto Dynamo-Triton

Carregando...

Ferramentas de IA populares como Software de Código Aberto Dynamo-Triton

LiteRT é o framework de machine learning on-device de alto desempenho do Google para implantação de modelos GenAI e ML em plataformas de edge. Ele oferece conversão, runtime e…

MLOps e implantação de modelos

TensorFlow Extended (TFX) é uma plataforma de machine learning em escala de produção do Google. Ela fornece um framework de configuração e bibliotecas compartilhadas para integrar…

MLOps e implantação de modelos

Together AI oferece uma plataforma de IA completa, a Nuvem Nativa para IA, para inferência, fine-tuning e clusters de GPU. É alimentada por pesquisa de ponta, oferecendo…

DestaquePlataformas de machine learning

Plataformas de IA

Uma plataforma de infraestrutura de IA para desenvolvedores implantarem, ajustarem e executarem mais de 200 LLMs e modelos multimodais otimizados através de uma API compatível com…

DestaqueMLOps e implantação de modelos

Apps de IA

Runware é uma plataforma de inferência de IA generativa que fornece uma API unificada para modelos de imagem, vídeo, áudio, 3D, LLM e visão. Oferece mais de 400 mil modelos,…

MLOps e implantação de modelos

Plataformas de IA

Cerebrium oferece infraestrutura de GPU serverless para IA em tempo real, permitindo cold starts de sub-segundo para agentes de voz, modelos de vídeo e LLMs. Fornece autoscaling…

DestaqueMLOps e implantação de modelos

Plataformas de IA

KServe é uma plataforma open-source nativa do Kubernetes para inferência de IA auto-hospedada. Oferece uma solução unificada para IA generativa e preditiva, simplificando…

MLOps e implantação de modelos

Frameworks de IA

OpenVINO é um toolkit de código aberto para implementar soluções de IA de alto desempenho em hardware diverso. Ele permite que os desenvolvedores convertam, otimizem e executem…

Ferramentas de visão computacional