描述
LightOn 提供强大的 AI 检索 API,旨在“将您的 AI 指向您的文档”。它提供三个核心端点:`/parse` 用于文档结构化,`/extract` 用于根据定义的模式提取特定字段,以及 `/search` 用于带引用的事实检索。
`/parse` 端点利用 LightOnOCR-2,这是一个最先进的解析引擎,可将扫描件、表格、手写体和多栏布局转换为结构化 Markdown。它原生支持 20 多种语言,并基于 HuggingFace 上提供的开源权重构建,在 OLMOCR-BENCH 上取得了 83.2 的成绩。
`/extract` 端点允许用户定义 JSON 模式并接收结构化 JSON 输出,从而能够提取发票号码、租赁到期日期或合同条款等特定实体。此功能按页收费,并通过 Webhook 支持异步处理。
`/search` 端点提供带引用的事实检索,利用结合了密集、稀疏和后期交互信号的混合方法。它基于开源 ColBERT 系列(LateOn 和 NextPlaid)构建,确保每次搜索结果都附带生成它的确切源文本段落。此功能按查询收费,延迟低。
LightOn 专为代理(agents)而构建,能够处理原始 PDF、混乱的表格和非领域查询,并提供强大的检索能力。它通过事实检索结果和可审计的设计来强调信任。该平台与 LLM 无关,允许用户自带模型,并支持 VPC、本地部署或隔离部署以增强安全性和合规性。
关键用例包括交易对手风险分析、多司法管辖区合同审查和监管范围映射,在这些场景中,即时知识发现和洞察浮现至关重要。该平台提供单点登录、基于角色的访问以及 GDPR/SOC 2 合规性等功能。提供免费套餐供开发者在控制台中测试所有端点。
LightOn AI的核心功能
带 OCR 的文档解析
结构化数据提取
带引用的事实检索
多语言支持(20+ 种语言)
混合搜索(密集、稀疏、后期交互)
LLM 无关架构
开源模型(ColBERT 系列)
生产就绪 API
提供免费套餐
欧盟托管基础设施
基于角色的访问控制
工作区和块级 ACL 范围
来自外部源的数据同步
如何使用 LightOn AI?
访问控制台:在 Playground 控制台中试用端点。
配置 API:获取控制台和企业版的 API 密钥。
解析文档:使用 /parse 端点获取结构化 Markdown 输出。
提取字段:使用定义的 JSON 模式利用 /extract 端点。
执行搜索:使用 /search 端点进行带引用的事实检索。
集成 API:将代码片段复制到您的项目中以进行应用程序集成。
部署企业版:讨论 VPC、本地部署或隔离部署选项。
LightOn AI的使用案例
- 文档分析
- 信息检索
- 代理开发
- 合同审查
- 风险评估
- 监管合规
- 知识管理
- 企业搜索








