描述
NVIDIA Dynamo-Triton,前身为 NVIDIA Triton 推理服务器,是一款开源软件,旨在促进在 TensorRT、PyTorch、ONNX、OpenVINO、Python 和 RAPIDS FIL 等主要框架中部署 AI 模型。该强大工具通过动态批处理、并发执行和优化配置等功能提供高性能。Dynamo-Triton 能够支持多种工作负载,包括实时、批处理、集成和音频/视频流式处理,并且能够在 NVIDIA GPU、非 NVIDIA 加速器、x86 和 ARM CPU 上无缝运行。
作为一款开源解决方案,Dynamo-Triton 兼容 DevOps 和 MLOps 工作流程,能够与 Kubernetes 有效集成以进行扩展,并与 Prometheus 集成以进行监控。它旨在在云和本地 AI 平台上工作,提供安全且适合生产的环境,作为 NVIDIA AI 企业的一部分。该环境包括稳定的 API 和广泛的 AI 部署支持,确保开发人员能够高效管理他们的 AI 模型。
对于大型语言模型(LLM)应用,NVIDIA 提供了额外的工具,如 NVIDIA Dynamo,专为 LLM 推理和多模式部署而设计。该工具通过提供 LLM 特定的优化,包括分散服务、前缀缓存和键值缓存到存储,来补充 Dynamo-Triton。开发人员可以访问丰富的资源,包括文档、教程和入门工具包,以帮助他们开始使用 Dynamo-Triton,并最大限度地发挥其在 AI 项目中的能力。
Dynamo-Triton 开源软件的核心功能
开源
支持 TensorRT、PyTorch、ONNX、OpenVINO
实时和批处理工作负载
动态批处理
并发执行
与 Kubernetes 集成
兼容 Prometheus
支持 NVIDIA 和非 NVIDIA 硬件
支持云和本地部署
提供 LLM 特定优化
如何使用 Dynamo-Triton 开源软件?
配置:设置您的环境以部署 AI 模型。
集成:将 Dynamo-Triton 与您选择的 AI 框架连接。
部署:使用 Triton 推理服务器启动您的 AI 模型。
监控:使用 Prometheus 跟踪性能和资源使用情况。
扩展:根据需要利用 Kubernetes 扩展您的部署。
Dynamo-Triton 开源软件的使用案例
- 实时 AI 推理
- 批处理
- 音频/视频流式处理
- 大型语言模型
- 云部署





