설명
Bento는 속도와 제어를 위해 구축된 포괄적인 추론 플랫폼으로, AI 팀이 맞춤형 최적화, 효율적인 확장 및 간소화된 운영을 통해 모든 모델을 어디든 배포할 수 있도록 지원합니다. 추론 인프라를 단순화하는 동시에 배포에 대한 세분화된 제어를 제공하여 AI 모델 추론을 더 쉽게 관리, 모니터링 및 최적화할 수 있습니다.
Bento는 Open Model Catalog를 통해 Llama 4, DeepSeek, Ling/Ring, Flux, Qwen, GPT-OSS와 같은 인기 있는 오픈 소스 옵션을 포함한 광범위한 모델 배포를 지원합니다. 또한 모든 아키텍처, 프레임워크 또는 모달리티의 사용자 지정 모델(미세 조정된 오픈 소스 모델 및 독점 사용자 지정 모델 포함)을 패키징하고 배포하기 위한 통합 프레임워크를 제공합니다. 이 플랫폼은 배포 및 CI/CD 프로세스를 자동화하고 포괄적인 가시성, 세분화된 액세스 제어 및 리소스/할당량 추적을 제공합니다.
효율적인 확장을 위해 Bento는 최적의 컴퓨팅 활용을 위한 지능형 리소스 관리를 제공하는 Bento Compute Engine을 특징으로 합니다. 이 엔진은 크로스 리전 확장, 탄력적 자동 확장, 콜드 스타트 가속화, 멀티 클라우드 컴퓨팅 오케스트레이션 및 제로 스케일링 기능을 지원합니다. 사용자는 자체 클라우드, 온프레미스 Kubernetes에 배포하거나 Bento Cloud를 활용하여 Nvidia GPU, AMD GPU, B200, H100, MI300X를 포함한 최첨단 GPU 하드웨어를 조달 번거로움 없이 액세스하는 옵션을 통해 인프라 및 배포 환경에 대한 완전한 제어를 유지할 수 있습니다.
Bento는 AI 애플리케이션의 프로덕션 경로를 가속화하여 개발자에게 AI 추론을 구축, 배포 및 확장하는 데 필요한 모든 것을 제공합니다. 여기에는 빠른 클라우드 반복을 위한 Dev Codespace, 모든 LLM 제공업체에 대한 통합 인터페이스와 중앙 집중식 비용 제어를 위한 LLM Gateway, 전체 배포 수명 주기 관리, 버전 관리, 롤백 및 A/B 테스트를 통한 간소화된 운영이 포함됩니다. 완전한 가시성은 컴퓨팅, 성능 및 LLM별 메트릭에 대한 포괄적인 모니터링을 통해 달성됩니다.
이 플랫폼은 엔터프라이즈급 보안, 규정 준수 및 운영 기능을 위해 구축되었으며, 성능 SLA, 연중무휴 모니터링, 가동 시간 보장 및 자동 장애 조치를 통해 안정성을 보장합니다. Bento는 또한 전담 기술 전문가, 추론 최적화 연구 및 지속적인 벤치마킹을 통한 Forward Deployed Engineering을 제공합니다. 데이터 주권은 사용자 데이터에 대한 완전한 제어를 통해 유지됩니다. BentoML은 이제 Modular의 일부입니다.
Bento: 대규모 추론 실행의 핵심 기능
모든 모델을 어디든 배포
맞춤형 추론 최적화
효율적인 확장 기능
간소화된 운영
인기 오픈 소스 모델을 위한 Open Model Catalog
사용자 지정 모델 패키징 및 배포를 위한 통합 프레임워크
자동화된 배포 및 CI/CD
포괄적인 가시성 및 모니터링
세분화된 액세스 제어
리소스 및 할당량 추적
컴퓨팅 활용을 위한 지능형 리소스 관리
크로스 리전 및 탄력적 자동 확장
콜드 스타트 가속화
멀티 클라우드 컴퓨팅 오케스트레이션
제로 스케일링
Bento: 대규모 추론 실행 사용 방법은?
빌드: 통합 프레임워크를 사용하여 모델을 패키징합니다.
배포: CI/CD 파이프라인으로 배포를 자동화합니다.
확장: 지능형 리소스 관리를 활용하여 효율적으로 확장합니다.
모니터링: 포괄적인 가시성으로 성능 및 시스템 상태를 추적합니다.
최적화: 속도, 비용 및 품질을 위해 배포의 모든 계층을 조정합니다.
Bento: 대규모 추론 실행의 사용 사례
- 모델 배포
- 추론 확장
- 성능 최적화
- 간소화된 운영
- 클라우드 네이티브 추론
- LLM 서빙
- 배치 추론
- 실시간 AI 기능





