描述
Respan 提供了一个全面的 LLM 工程平台,旨在简化可靠 AI 应用的开发和部署。它充当一个统一的网关,将 LLM 可观测性、评估、提示优化和 API 管理整合到一个单一的界面中。这种方法消除了管理多个活动部件的复杂性,使团队能够专注于构建和扩展其 AI 解决方案。
该平台使团队能够通过一个网关路由 LLM 流量,通过跟踪观察调用,通过指标监控支出,并运行评估。它支持将提示、模型和工作流直接部署到生产环境,并具备版本控制和发布逻辑。Respan 通过单一 API 提供对 500 多个模型的访问,允许用户路由类似 OpenAI 的调用或利用具有直通端点的原生 SDK,确保每个请求都被记录。
Respan 通过提供回退机制来增强应用程序的可靠性。如果模型出现错误或速率限制,网关可以自动尝试预定义回退列表中的下一个模型,在 API 密钥之间平衡负载,并实现带指数退避的重试逻辑。这确保了即使单个模型出现问题也能持续运行。
成本管理是一项关键功能,可以为每个 API 密钥设置软警告或硬上限。当阈值被跨越时,用户会收到 Slack 或电子邮件警报。此外,Respan 会缓存重复的提示以降低成本和延迟。每个网关调用都会被转换为一个跟踪树,显示每个跨度的延迟。用户可以添加客户标识符和元数据以过滤日志和跟踪。
为了进行质量保证,Respan 提供了一个评估系统,该系统在一个工作流中结合了人工审查、代码检查和 LLM 裁判。该系统根据关键指标衡量性能。团队可以构建包含快速规则检查、LLM 裁判和人工审查的评估流程,并在一个地方管理代码、评分标准和地面实况评分。该平台还允许在抽样的生产流量上运行这些评估器,以实时识别质量问题。
Respan 通过构建来自生产跟踪或 CSV 文件的数据集,运行跨提示和模型变体的实验,并在合并更改之前比较分数,从而使团队能够在发布前进行实验。它捕获生产流量中的每个提示、工具调用和响应,并附带丰富的上下文。可以在抽样的生产日志上运行在线评估,在实际跨度上显示诸如忠实度(faithfulness)和 JSON 模式(JSON schema)之类的分数。
该平台的可观测性功能包括 LLM 使用情况的仪表板,允许按模型或用户对指标进行切片。团队可以在一个地方跟踪请求、令牌、错误、延迟和成本。可以为错误率、成本、延迟或令牌使用量配置警报,当生产阈值被突破时通过 Slack、电子邮件或 Webhook 通知团队。Respan 是为 AI 代理构建的,旨在减少停机时间并提高部署频率。它致力于遵守严格的国际安全和安保标准,包括 ISO 27001、SOC 2、GDPR 和 HIPAA 合规性。
Respan的核心功能
统一的 LLM 网关,用于路由和管理
LLM 调用和性能的实时可观测性
自动回退模型以提高正常运行时间
通过支出限制和警报进行成本控制
跟踪树,用于详细调试每次 LLM 交互
包含人工和 AI 裁判的全面评估工作流
用于提示和模型变体的实验工具
用于在线评估的生产流量采样
按模型和用户切片的指标使用情况仪表板
用于关键性能阈值的警报系统
用于生产部署的版本控制和发布逻辑
通过单一 API 访问 500 多个 LLM 模型
缓存重复提示以降低延迟和成本
线程视图,用于重现和检查真实用户会话
如何使用 Respan?
集成:通过 Respan 的统一网关将其连接到您的 LLM 应用。
路由:配置您的 LLM 流量通过 Respan 网关。
观察:使用实时仪表板和跟踪来监控 LLM 调用、延迟、成本和错误。
评估:构建并运行评估工作流以评估模型性能和质量。
优化:使用实验工具和提示工程功能来改进您的 AI 模型。
部署:使用版本控制将优化后的提示、模型和工作流推广到生产环境。
警报:为性能指标设置自定义警报,以主动解决问题。
Respan的使用案例
- LLM 可观测性
- 提示优化
- 模型评估
- AI 网关
- 成本管理
- 可靠的 AI 部署
- 生产监控
- 代理开发








