Перейти к основному содержимому
ToolPotion

KServe

KServe — это кроссплатформенная платформа с открытым исходным кодом на базе Kubernetes для самостоятельного развертывания ИИ-инференса. Она предлагает унифицированное решение как для генеративного, так и для предиктивного ИИ, упрощая развертывание от быстрых настроек до требовательных корпоративных нагрузок благодаря таким функциям, как ускорение на GPU и автоматическое масштабирование.

Посетить URL

Описание

KServe присоединился к CNCF, укрепив свои позиции как открытый стандарт для самостоятельного развертывания ИИ-инференса. Эта платформа на базе Kubernetes предоставляет унифицированное решение как для генеративного ИИ, так и для предиктивного ИИ, разработанное так, чтобы быть достаточно простым для быстрого развертывания и достаточно мощным для корпоративных рабочих нагрузок.

Для генеративного ИИ KServe предлагает оптимизированные бэкенды, такие как vLLM и llm-d, для высокопроизводительного обслуживания LLM. Он имеет протокол, совместимый с OpenAI, для бесшовной интеграции, ускорение на GPU с оптимизированным управлением памятью и кэширование моделей для сокращения времени загрузки. Расширенные возможности включают выгрузку KV-кэша для обработки более длинных последовательностей, автоматическое масштабирование на основе запросов, настроенное для генеративных рабочих нагрузок, и нативную поддержку моделей Hugging Face для упрощенного развертывания.

В области предиктивного ИИ KServe поддерживает широкий спектр фреймворков, включая TensorFlow, PyTorch, scikit-learn, XGBoost и ONNX. Он обеспечивает интеллектуальную маршрутизацию между компонентами предиктора, трансформера и экспликатора, а также облегчает расширенные развертывания, такие как поэтапное развертывание (canary rollouts), конвейеры и ансамбли с использованием InferenceGraph. Автоматическое масштабирование, включая масштабирование до нуля для предиктивных рабочих нагрузок, является ключевой функцией, наряду со встроенной объяснимостью моделей для понимания причин прогнозов и расширенным мониторингом для логирования полезной нагрузки, обнаружения выбросов, антагонистических атак и дрейфа. Его экономическая эффективность повышается за счет возможности масштабирования до нуля на дорогостоящих ресурсах, когда они не используются.

KServe предоставляет простой, но мощный API через пользовательское определение ресурсов Kubernetes (CRD) для обслуживания моделей машинного обучения. Он абстрагирует сложности автоматического масштабирования, сетевого взаимодействия, проверки работоспособности и конфигурации сервера, привнося передовые возможности обслуживания в развертывания ML. Платформа обеспечивает стандартный API Kubernetes для различных ML-фреймворков, поддерживает предварительную/пост-обработку и объяснимость, а также предлагает поддержку спецификации OpenAI для LLM, наряду с поэтапным развертыванием и A/B-тестированием для инференса.

Архитектура состоит из плоскости управления (Control Plane), которая управляет жизненным циклом ML-моделей, включая отслеживание ревизий и A/B-тестирование, и плоскости данных (Data Plane), которая предлагает стандартизированный протокол инференса для серверных моделей с API запросов/ответов. Основным ресурсом Kubernetes является InferenceService, который упрощает развертывание ML-моделей с автоматическим масштабированием, сетевым взаимодействием и проверками работоспособности. InferenceGraph обеспечивает расширенные развертывания с конвейерами, ансамблями и многомодельными рабочими процессами. KServe пользуется доверием лидеров отрасли для надежного инференса моделей в масштабе.

Основные функции KServe

  • Платформа на базе Kubernetes для ИИ-инференса

  • Унифицированное обслуживание для генеративного и предиктивного ИИ

  • Протокол, совместимый с OpenAI, для LLM

  • Ускорение на GPU и оптимизированное управление памятью

  • Кэширование моделей и выгрузка KV-кэша

  • Автоматическое масштабирование на основе запросов для генеративных рабочих нагрузок

  • Нативная поддержка моделей Hugging Face

  • Поддержка нескольких фреймворков (TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX)

  • Интеллектуальная маршрутизация для предикторов, трансформеров и экспликаторов

  • Расширенные развертывания с InferenceGraph (конвейеры, ансамбли)

  • Автоматическое масштабирование до нуля для предиктивных рабочих нагрузок

  • Встроенная объяснимость моделей и атрибуция признаков

  • Расширенный мониторинг (логирование полезной нагрузки, обнаружение выбросов, антагонистических атак, дрейфа)

  • Стандартный API Kubernetes для ML-фреймворков

  • Поэтапное развертывание (canary rollouts) и A/B-тестирование для инференса

Как использовать KServe?

  1. Установка KServe: Разверните KServe и его зависимости в вашем кластере Kubernetes.

  2. Создание InferenceService: Определите простую YAML-конфигурацию для развертывания предварительно обученной модели.

  3. Настройка предиктора: Укажите формат модели, ресурсы (CPU, память, GPU) и URI хранилища.

  4. Отправка запросов на инференс: Выполняйте прогнозы с использованием развернутой модели через вызовы API.

Варианты использования KServe

  • Обслуживание LLM
  • Развертывание предиктивных моделей
  • ИИ-инференс в масштабе
  • Объяснимость моделей
  • Расширенные стратегии развертывания
  • Экономически эффективный ИИ
  • Интеграция моделей Hugging Face

Часто задаваемые вопросы KServe

Отзывы о KServe

Загрузка...

Популярные ИИ-инструменты, похожие на KServe

AI-платформы

Cerebrium предлагает бессерверную GPU-инфраструктуру для ИИ в реальном времени, обеспечивая холодные старты менее чем за секунду для голосовых агентов, видеомоделей и LLM. Он…

РекомендованоMLOps и развёртывание моделей

AI-платформы

Платформа ИИ-инфраструктуры для разработчиков, позволяющая развертывать, настраивать и запускать более 200 оптимизированных LLM и мультимодальных моделей через один совместимый с…

РекомендованоMLOps и развёртывание моделей

AI-платформы

Платформа вывода Baseten позволяет пользователям эффективно развертывать и масштабировать модели ИИ с открытым исходным кодом и настраиваемые модели. Она предлагает…

РекомендованоMLOps и развёртывание моделей

AI-фреймворки

OpenVINO — это набор инструментов с открытым исходным кодом для развертывания высокопроизводительных решений ИИ на разнообразном оборудовании. Он позволяет разработчикам…

MLOps и развёртывание моделей

Replicate предоставляет облачный API для запуска и дообучения моделей машинного обучения с открытым исходным кодом. Развертывайте пользовательские модели одной строкой кода.…

РекомендованоMLOps и развёртывание моделей

Cloudflare Workers AI — это платформа для вывода ИИ на краю сети, которая позволяет пользователям выполнять глобальный вывод ИИ с помощью одного вызова API. Она предлагает более…

РекомендованоMLOps и развёртывание моделей

Bento — это платформа для инференса, разработанная для скорости и контроля, позволяющая развертывать любую AI-модель где угодно. Она предлагает индивидуальную оптимизацию,…

РекомендованоMLOps и развёртывание моделей

AI-платформы

DeepInfra — это облачная платформа для ИИ-инференса, которая предоставляет более 100 моделей машинного обучения через удобные для разработчиков API с оплатой по мере…

РекомендованоMLOps и развёртывание моделей