描述
KubeHA 是一个开创性的 GenAI 驱动的 SaaS 平台,旨在为大规模 Kubernetes 环境提供全面的监控、可观测性、修复和探索(MORE)。它通过提供一个统一的智能平台,将上下文、清晰度和控制力整合到一个界面中,从而消除了在多个工具之间跳转的需要。
该平台提供实时、高保真的 Kubernetes 指标和警报,警报会自动进行分析并与 Prometheus 图表相关联。通过显示 Kubernetes 事件和最近的部署更改,它提供了对基础设施和应用程序问题的零盲点视图。通过 APM、跨日志、指标、跟踪和错误的统一可见性,以及内置的异常检测和智能关联,可观测性得到了增强。KubeHA 支持 MELT 风格的可观测性(指标、事件、日志、跟踪),以快速检测回归、性能问题和根本原因。
修复功能包括对集群状态和更改的 AI 驱动的 Mega 分析、智能修复建议以及一键修复。KubeHA GPT 引擎允许用户以自然语言提问,以获得关于警报、日志、指标等的即时、可操作的答案,提供指导性见解而无需深入挖掘。主要优势包括不再需要工具蔓延、自动根本原因分析和修复、跨各种数据源的即时遥测关联以及在指标和日志级别进行 AI 驱动的异常检测。
KubeHA 还通过与 Slack 和 Microsoft Teams 集成,将见解、警报和建议的修复直接推送到团队对话中,从而促进实时协作。自动检测提供快速的 APM 设置,只需最少的代码更改,并支持 OpenTelemetry SDK。
内置了安全监控功能,使用 Trivy 和 Popeye 等工具来检测配置错误、漏洞和运行时威胁。该平台提供了开箱即用的仪表板,用于即时集群健康可视化,并提供与流行的监控、遥测、安全、协作、事件管理、CI/CD 和 Kubernetes 原生工具的轻松集成。
KubeHA的核心功能
GenAI 驱动的 Kubernetes 监控和可观测性
用于 MORE(监控、可观测性、修复、探索)的一体化智能平台
实时、高保真的 Kubernetes 指标和警报
AI 驱动的根本原因分析和修复建议
KubeHA GPT,用于自然语言查询集群数据
跨日志、指标、跟踪和错误的统一可见性
内置异常检测和智能关联
与 Slack 和 Microsoft Teams 无缝集成以进行协作
警报的自动根本原因分析
跨 APM、基础设施、日志、跟踪和指标的即时遥测关联
内置扫描器(Trivy、Popeye)的安全监控
用于集群健康可视化的开箱即用仪表板
自动检测,实现快速 APM 设置,代码更改最少
支持 OpenTelemetry SDK
如何使用 KubeHA?
配置:将 KubeHA 与您的 Kubernetes 环境和所需工具集成。
监控:利用实时指标、警报和开箱即用的仪表板来监控集群健康状况。
观察:通过异常检测获得日志、指标、跟踪和错误的统一可见性。
修复:利用 AI 驱动的分析和智能建议来解决问题。
探索:使用 KubeHA GPT 以自然语言提问,以获得即时见解。
协作:将警报和见解推送到 Slack 或 Microsoft Teams 以实现团队对齐。
KubeHA的使用案例
- Kubernetes 监控
- 可观测性
- 事件修复
- 性能分析
- 安全审计
- 故障排除
- 团队协作





