Описание
NVIDIA Dynamo-Triton, ранее известный как NVIDIA Triton Inference Server, является программным обеспечением с открытым исходным кодом, разработанным для упрощения развертывания AI моделей в основных фреймворках, таких как TensorRT, PyTorch, ONNX, OpenVINO, Python и RAPIDS FIL. Этот мощный инструмент обеспечивает высокую производительность благодаря таким функциям, как динамическое пакетирование, параллельное выполнение и оптимизированные конфигурации. Dynamo-Triton способен поддерживать различные рабочие нагрузки, включая рабочие нагрузки в реальном времени, пакетные, ансамблевые и потоковые аудио/видео, и он работает без проблем на графических процессорах NVIDIA, не-NVIDIA ускорителях, x86 и ARM процессорах.
Как решение с открытым исходным кодом, Dynamo-Triton совместим как с DevOps, так и с MLOps рабочими процессами, эффективно интегрируясь с Kubernetes для масштабирования и Prometheus для мониторинга. Он разработан для работы как в облачных, так и в локальных AI платформах, обеспечивая безопасную и готовую к производству среду в рамках NVIDIA AI Enterprise. Эта среда включает стабильные API и обширную поддержку развертывания AI, что гарантирует, что разработчики могут эффективно управлять своими AI моделями.
Для приложений больших языковых моделей (LLM) NVIDIA предлагает дополнительные инструменты, такие как NVIDIA Dynamo, который предназначен для вывода LLM и многорежимного развертывания. Этот инструмент дополняет Dynamo-Triton, предоставляя оптимизации, специфичные для LLM, включая раздельное обслуживание, кэширование префиксов и кэширование ключ-значение для хранения. Разработчики могут получить доступ к множеству ресурсов, включая документацию, учебные пособия и стартовые наборы, чтобы помочь им начать работу с Dynamo-Triton и максимально использовать его возможности в своих AI проектах.
Основные функции Dynamo-Triton Open-Source Software
Открытый исходный код
Поддерживает TensorRT, PyTorch, ONNX, OpenVINO
Рабочие нагрузки в реальном времени и пакетные
Динамическое пакетирование
Параллельное выполнение
Интеграция с Kubernetes
Совместимость с Prometheus
Работает на оборудовании NVIDIA и не-NVIDIA
Поддерживает облачное и локальное развертывание
Оптимизации, специфичные для LLM, доступны
Как использовать Dynamo-Triton Open-Source Software?
Настройка: Подготовьте свою среду для развертывания AI моделей.
Интеграция: Подключите Dynamo-Triton к выбранным вами AI фреймворкам.
Развертывание: Запустите свои AI модели с помощью Triton Inference Server.
Мониторинг: Используйте Prometheus для отслеживания производительности и использования ресурсов.
Масштабирование: Используйте Kubernetes для масштабирования ваших развертываний по мере необходимости.
Варианты использования Dynamo-Triton Open-Source Software
- AI вывод в реальном времени
- Пакетная обработка
- Потоковая передача аудио/видео
- Большие языковые модели
- Облачное развертывание





