描述
EvalCore 旨在帮助开发者在用户注意到之前了解他们的 AI 变得更糟。它提供 AI 行为的快照测试,允许用户记录他们的 LLM 应用或代理的行为,然后在每次更改时在持续集成 (CI) 中重放该记录。这个过程是离线的、确定性的,并且完全免费。
通过 EvalCore,开发者可以轻松检查修改提示、交换模型或更新依赖项等更改是否导致任何问题。该工具记录 AI 行为,并将每个更改与记录的数据进行比较,确保任何回归都能及早发现。设置非常简单,只需一个小的二进制文件即可与任何编程语言配合使用,消除了对测试工具或 SDK 的需求。
EvalCore 的第一次运行调用真实模型,并将每个请求和响应记录到本地 SQLite 磁带中。该磁带以规范请求的哈希为键,便于跟踪令牌和成本。CI 中的每次后续运行重放该磁带,确保相同的输入产生相同的输出,从而有效阻止回归。这意味着开发者可以在不需要网络访问或 API 密钥的情况下运行测试,使过程更加可靠和高效。
EvalCore 兼容多种模型和 API,包括 OpenAI、vLLM 和 Ollama,以及自定义 REST API 和 shell 命令。这种灵活性使开发者能够在几分钟内交付他们的第一次评估,而无需任何依赖。该工具在 Apache-2.0 许可证下开源,任何希望改善其 AI 应用程序的人都可以使用。
EvalCore的核心功能
AI 行为的快照测试
离线重放
确定性结果
无需 SDK 或测试工具
记录请求和响应
与 OpenAI 和其他 API 兼容
本地 SQLite 磁带存储
在 CI 中免费使用
如何使用 EvalCore?
配置:将目标指向您的应用并列出数据集。
运行:执行命令以记录 AI 行为。
重放:在 CI 中使用记录的磁带检查回归。
提交:保存磁带以供未来测试。
EvalCore的使用案例
- 回归测试
- 行为监控
- 模型比较
- 集成测试
- 成本跟踪







