描述
WaterCrawl 是一个现代的网络爬虫和内容提取平台,可以将任何网站转变为结构化的、适合 LLM 的数据。它为开发者设计,允许用户通过智能爬取控制,立即爬取任何网站,控制深度、域名和路径,使用自定义选择器进行精确内容提取,过滤广告和页脚,并通过 JavaScript 渲染捕获动态内容,生成 PDF 或 JPG 格式的截图。
除了爬取功能,WaterCrawl 还包括一个网络搜索引擎,可以实时获取网络上的结果,自动生成网站地图以映射网站上的所有 URL,并内置 OpenAI 集成,将原始 HTML 转换为结构化、有意义的数据。它提供了可扩展的插件系统,通过服务器推送事件实时监控爬取状态和性能,并提供全面的错误报告。该项目在修改后的 MIT 许可证下开源,商业用途作为竞争服务需要获得许可。
开发者可以通过干净的 REST API 集成 WaterCrawl,支持基于 JWT 的身份验证和 webhook,官方 SDK 支持 Python、Go、Node.js、PHP 和 Rust。API 支持启动单个或批量爬取请求,配置爬虫和页面选项,流式传输实时状态,并将结果下载为 JSON 或 Markdown,此外还有专用搜索端点。
免费计划每月提供 1,000 页的使用额度,配备数据中心代理和 7 天的数据保留窗口。付费的初创、成长和企业计划增加更多的页面额度、更高的爬取深度和并发数、优质的住宅代理、更多的团队席位和更长的保留时间。
WaterCrawl的核心功能
深度、域名和路径的智能爬取控制
使用自定义选择器进行精确内容提取
JavaScript 渲染和 PDF 或 JPG 格式的截图
内置的网络搜索引擎,提供实时结果
自动生成网站地图和网站映射
通过 OpenAI 集成实现 AI 驱动的处理
开源,具有可扩展的插件系统
支持多种语言的 REST API、webhooks 和 SDK
如何使用 WaterCrawl?
免费注册:创建一个账户并获得每月 1,000 页的使用额度。
获取 API 密钥:从仪表板生成团队 API 密钥。
配置爬取:设置起始 URL、深度、域名和页面选项。
运行并监控:启动爬取并通过 SSE 实时跟踪进度。
获取数据:将结果下载为 JSON 或 Markdown,或通过 webhook 接收。
WaterCrawl的使用案例
- LLM 数据管道
- 内容聚合
- 市场研究
- 搜索引擎
- 网站监控




