描述
Revalvo 是一个以本地为先的工作台,旨在通过在多个模型上同时运行提示来评估大型语言模型(LLMs)。它提供了一个全面的环境,用户可以在生产之前编写、运行、版本化和评估提示。与传统的聊天用户界面不同,Revalvo 提供对提示、模型和变量的完全控制,确保通过分数、差异和版本历史记录实现透明性和可追溯性。
该平台不是典型的 SaaS;它不需要创建账户,所有数据保留在用户的浏览器中,确保隐私和安全。用户可以使用密钥、OAuth 或本地运行时连接他们的提供者,并为每个提供者创建单独的工作区。游乐场功能允许用户编写一次并在任何地方运行,模型可以并行响应相同的提示,提供延迟、令牌和每个响应的成本等指标。
Revalvo 的版本控制系统将提示视为代码,具有不可变快照、Git 风格的版本历史记录,以及回滚到任何先前版本的能力。用户可以将版本导出为 API 片段或代理提示,并在工作区之间复制提示以进行新的评估。
该平台支持使用数据集进行大规模测试,提供 40 个可批量运行的评分器,用于结构、AI 判断、性能和安全性。批量运行生成的报告包括通过率、延迟和每个模型的成本,提供详细的准备就绪发货的收据。
Revalvo 针对效率进行了优化,具有周到的默认设置和最小的设置时间。它在聊天游乐场的速度与全面评估平台的严谨性之间取得了平衡,使其适合首次使用者和经验丰富的提示工程师。
Revalvo的核心功能
以本地为先的 LLM 评估
实时评分和版本控制
无需账户
分数和差异的完全透明性
通过密钥、OAuth 或本地运行时连接
并行模型响应评估
Git 风格的版本历史
使用 40 个评分器进行批量测试
如何使用 Revalvo?
配置:使用密钥或 OAuth 连接您的提供者
使用:在多个模型上并行运行提示
优化:使用 Git 风格的历史保存和版本化您的提示
测试:使用数据集和评分器运行批量测试
Revalvo的使用案例
- 提示评估
- 版本控制
- 批量测试
- 模型比较
- 数据隐私





