Descrição
Bento é uma plataforma de inferência abrangente construída para velocidade e controle, capacitando equipes de IA a implantar qualquer modelo em qualquer lugar com otimização personalizada, escalonamento eficiente e operações simplificadas. Ela simplifica a infraestrutura de inferência, ao mesmo tempo que fornece controle granular sobre as implantações, facilitando o gerenciamento, monitoramento e otimização da inferência de modelos de IA.
Bento suporta a implantação de uma ampla gama de modelos, incluindo opções populares de código aberto como Llama 4, DeepSeek, Ling/Ring, Flux, Qwen e GPT-OSS, através de seu Catálogo Aberto de Modelos. Ele também oferece um framework unificado para empacotar e implantar modelos personalizados de qualquer arquitetura, framework ou modalidade, incluindo modelos de código aberto com fine-tuning e modelos proprietários personalizados. A plataforma automatiza os processos de implantação e CI/CD, fornece observabilidade abrangente, controle de acesso granular e rastreamento de recursos/quotas.
Para escalonamento eficiente, Bento apresenta o Bento Compute Engine, que fornece gerenciamento inteligente de recursos para utilização ideal de computação. Ele suporta escalonamento entre regiões, auto-escalonamento elástico, aceleração de cold-start, orquestração de computação multi-cloud e capacidades de escalonamento para zero. Os usuários têm controle total sobre sua infraestrutura e ambiente de implantação, com opções para implantar em sua própria nuvem, Kubernetes on-premises, ou alavancar o Bento Cloud para acesso a hardware de GPU de ponta sem complicações de aquisição, incluindo GPUs Nvidia, GPUs AMD e B200, H100, MI300X.
Bento acelera o caminho para a produção de aplicações de IA, fornecendo aos desenvolvedores tudo o que eles precisam para construir, enviar e escalar a inferência de IA. Isso inclui um Dev Codespace para iteração rápida na nuvem, um LLM Gateway para uma interface unificada para todos os provedores de LLM com controle de custo centralizado, e operações simplificadas com gerenciamento completo do ciclo de vida de implantação, controle de versão, rollbacks e testes A/B. A observabilidade completa é alcançada através do monitoramento abrangente de computação, desempenho e métricas específicas de LLM.
A plataforma é construída para segurança de nível empresarial, conformidade e capacidades operacionais, garantindo confiabilidade com SLAs de desempenho, monitoramento 24/7, garantias de uptime e failover automático. Bento também oferece Forward Deployed Engineering com especialistas técnicos dedicados, pesquisa de otimização de inferência e benchmarking contínuo. A soberania dos dados é mantida com controle total sobre os dados do usuário. BentoML agora faz parte da Modular.
Recursos principais de Bento: Execute Inferência em Escala
Implante qualquer modelo em qualquer lugar
Otimização de inferência personalizada
Capacidades de escalonamento eficientes
Operações simplificadas
Catálogo Aberto de Modelos para modelos populares de código aberto
Framework unificado para empacotamento e implantação de modelos personalizados
Implantação automatizada e CI/CD
Observabilidade e monitoramento abrangentes
Controle de acesso granular
Rastreamento de recursos e quotas
Gerenciamento inteligente de recursos para utilização de computação
Escalonamento entre regiões e auto-escalonamento elástico
Aceleração de cold-start
Orquestração de computação multi-cloud
Escalonamento para zero
Como usar Bento: Execute Inferência em Escala?
Construir: Empacote seu modelo usando o framework unificado.
Implantar: Automatize a implantação com pipelines de CI/CD.
Escalar: Utilize gerenciamento inteligente de recursos para escalonamento eficiente.
Monitorar: Acompanhe o desempenho e a saúde do sistema com observabilidade abrangente.
Otimizar: Ajuste cada camada de sua implantação para velocidade, custo e qualidade.
Casos de uso de Bento: Execute Inferência em Escala
- Implantação de Modelos
- Escalonamento de Inferência
- Otimização de Desempenho
- Operações Simplificadas
- Inferência Cloud-Native
- Serviço de LLM
- Inferência em Lote
- Recursos de IA em Tempo Real





