Deskripsi
NVIDIA Dynamo-Triton, sebelumnya dikenal sebagai NVIDIA Triton Inference Server, adalah perangkat lunak sumber terbuka yang dirancang untuk memfasilitasi penerapan model AI di berbagai kerangka kerja utama seperti TensorRT, PyTorch, ONNX, OpenVINO, Python, dan RAPIDS FIL. Alat yang kuat ini memberikan kinerja tinggi melalui fitur-fitur seperti pengelompokan dinamis, eksekusi bersamaan, dan konfigurasi yang dioptimalkan. Dynamo-Triton mampu mendukung berbagai beban kerja, termasuk waktu nyata, terbatch, ensemble, dan streaming audio/video, dan beroperasi dengan lancar di GPU NVIDIA, akselerator non-NVIDIA, CPU x86, dan ARM.
Sebagai solusi sumber terbuka, Dynamo-Triton kompatibel dengan alur kerja DevOps dan MLOps, terintegrasi secara efektif dengan Kubernetes untuk penskalaan dan Prometheus untuk pemantauan. Ini dirancang untuk bekerja di platform AI cloud dan on-premises, menyediakan lingkungan yang aman dan siap produksi sebagai bagian dari NVIDIA AI Enterprise. Lingkungan ini mencakup API yang stabil dan dukungan luas untuk penerapan AI, memastikan bahwa pengembang dapat mengelola model AI mereka dengan efisien.
Untuk aplikasi model bahasa besar (LLM), NVIDIA menawarkan alat tambahan seperti NVIDIA Dynamo, yang dirancang khusus untuk inferensi LLM dan penerapan multi-mode. Alat ini melengkapi Dynamo-Triton dengan memberikan optimasi khusus LLM, termasuk penyajian terpisah, caching prefiks, dan caching nilai kunci ke penyimpanan. Pengembang dapat mengakses banyak sumber daya, termasuk dokumentasi, tutorial, dan paket awal, untuk membantu mereka memulai dengan Dynamo-Triton dan memaksimalkan kemampuannya dalam proyek AI mereka.
Fitur Inti Perangkat Lunak Sumber Terbuka Dynamo-Triton
Sumber Terbuka
Mendukung TensorRT, PyTorch, ONNX, OpenVINO
Beban kerja waktu nyata dan terbatch
Pengelompokan dinamis
Eksekusi bersamaan
Terintegrasi dengan Kubernetes
Kompatibel dengan Prometheus
Bekerja di perangkat keras NVIDIA dan non-NVIDIA
Mendukung penerapan cloud dan on-premises
Optimasi khusus LLM tersedia
Cara menggunakan Perangkat Lunak Sumber Terbuka Dynamo-Triton?
Konfigurasi: Siapkan lingkungan Anda untuk menerapkan model AI.
Integrasi: Hubungkan Dynamo-Triton dengan kerangka kerja AI pilihan Anda.
Penerapan: Luncurkan model AI Anda menggunakan Triton Inference Server.
Pemantauan: Gunakan Prometheus untuk melacak kinerja dan penggunaan sumber daya.
Penskalaan: Manfaatkan Kubernetes untuk penskalaan penerapan Anda sesuai kebutuhan.
Kasus Penggunaan Perangkat Lunak Sumber Terbuka Dynamo-Triton
- Inferensi AI Waktu Nyata
- Pemrosesan Batch
- Streaming Audio/Video
- Model Bahasa Besar
- Penerapan Cloud





