Description
Le GenAI App Engine de ClearML est conçu pour rationaliser le déploiement et la mise à l'échelle des grands modèles de langage (LLM) pour les entreprises. Il fournit un plan de contrôle d'infrastructure robuste qui gère l'accès au calcul, l'utilisation, la surveillance des performances et la sécurité, facilitant ainsi l'adoption de l'IA générative par les organisations.
La plateforme offre un environnement flexible aux développeurs pour lancer des LLM. Les utilisateurs peuvent exploiter des LLM prêts à l'emploi via une interface simplifiée avec orchestration intégrée ou déployer leurs propres modèles affinés pour accélérer les tests et la production. Cette double approche garantit que les applications GenAI peuvent être mises sur le marché plus rapidement, en répondant aux besoins spécifiques de l'entreprise.
Les capacités clés incluent le déploiement de n'importe quel LLM en un seul clic, qu'il s'agisse d'un modèle personnalisé de Hugging Face ou d'une version affinée. Le moteur prend en charge divers frameworks de service LLM tels que vLLM, Llama.cpp et Triton, fournissant des points d'accès API sécurisés avec contrôle d'accès basé sur les rôles et mise en réseau adaptée à des cas d'utilisation spécifiques. Cela garantit que les modèles déployés sont accessibles et sécurisés.
L'allocation des ressources est gérée par un routage dynamique du trafic, permettant aux organisations de contrôler les données, l'équilibrage de charge et les ressources de calcul pour les applications, les points d'accès ou les agents IA déployés. ClearML optimise le flux de trafic pour améliorer les performances des applications et réduire la latence du réseau. Pour l'inférence, il peut faire évoluer horizontalement les ressources de calcul à la volée, en conservant la puissance des GPU et en garantissant une disponibilité maximale pendant les périodes d'utilisation intensive.
Les performances et l'utilisation sont continuellement surveillées via un tableau de bord centralisé qui fournit des informations sur le trafic des API IA, les points d'accès actifs, le volume des requêtes, la latence, l'utilisation de la mémoire et l'utilisation des ressources (CPU, GPU, E/S, réseau). Cette visibilité est cruciale pour maintenir des performances optimales et identifier les goulots d'étranglement potentiels.
ClearML se concentre également sur la maximisation de la disponibilité tout en minimisant les coûts d'exploitation. Sa technologie de mémoire unifiée utilise la mémoire CPU active pour conserver les modèles inactifs, réduisant ainsi les coûts d'inférence en réservant la puissance des GPU pour les modèles actifs. Cela garantit que les applications GenAI restent disponibles sans les dépenses de ressources GPU dédiées.
La plateforme permet aux utilisateurs de créer des assistants personnalisés pour déployer des applications GenAI au sein de leur entreprise, permettant le démarrage instantané d'applications avec des interfaces utilisateur personnalisées pour les clients internes. De plus, elle facilite la création et le lancement d'agents IA pour l'automatisation et l'optimisation des tâches, avec un suivi facile de leur utilisation et de leurs performances.
L'approche de ClearML consiste à fournir un moteur pour la création et le déploiement de solutions GenAI, en gérant l'authentification, le routage du trafic, la gestion des identifiants, les ressources de calcul et la surveillance des points d'accès en direct. Cela permet aux ingénieurs de se concentrer sur le développement de solutions GenAI tandis que ClearML gère l'infrastructure sous-jacente, réduisant ainsi les frais généraux opérationnels et permettant des cas d'utilisation GenAI évolutifs. Les projets peuvent commencer avec un minimum de calcul et évoluer en "migrant" les applications réussies vers des clusters plus importants, ClearML gérant la restauration de l'état.
Fonctionnalités principales de GenAI App Engine
Déploiement de LLM en un clic
Déploiement évolutif d'applications GenAI
Gestion et optimisation des ressources de calcul
Surveillance des performances de l'IA
Points d'accès API sécurisés avec contrôle d'accès basé sur les rôles
Routage dynamique du trafic et équilibrage de charge
Mise à l'échelle horizontale du calcul pour l'inférence
Technologie de mémoire unifiée pour l'optimisation des coûts
Interface utilisateur personnalisable pour les applications GenAI internes
Création et suivi d'agents IA
Prise en charge de divers moteurs de service LLM (vLLM, Llama.cpp, Triton)
Capacité de migration ("lift and shift") pour la mise à l'échelle des applications
Comment utiliser GenAI App Engine ?
Déployer un LLM : Sélectionnez et déployez un LLM prêt à l'emploi ou affiné en un seul clic.
Configurer les ressources : Allouez les ressources de calcul et gérez le routage du trafic pour vos applications déployées.
Surveiller les performances : Suivez le trafic des API, le volume des requêtes, la latence et l'utilisation des ressources.
Mettre à l'échelle les applications : Mettez à l'échelle horizontalement les ressources de calcul à la volée pour répondre à la demande.
Optimiser les coûts : Utilisez la technologie de mémoire unifiée pour minimiser la consommation d'énergie des GPU.
Lancer des applications personnalisées : Créez et déployez des applications GenAI personnalisées avec des interfaces utilisateur adaptées.
Automatiser les tâches : Créez et lancez des agents IA pour l'automatisation et l'optimisation des tâches.
Cas d'utilisation de GenAI App Engine
- Déploiement de LLM
- Développement d'applications GenAI
- Surveillance des performances des modèles
- Gestion des ressources
- Automatisation des agents IA
- Inférence rentable
- Adoption de l'IA en entreprise









