Description
WaterCrawl est une plateforme moderne de crawling web et d'extraction de contenu qui transforme n'importe quel site web en données structurées prêtes pour les LLM. Conçu pour les développeurs, il permet aux utilisateurs de crawler n'importe quel site instantanément avec des contrôles de crawling intelligents pour la profondeur, les domaines et les chemins, une extraction de contenu précise utilisant des sélecteurs personnalisés qui filtrent les publicités et les pieds de page, et un rendu JavaScript pour capturer du contenu dynamique et prendre des captures d'écran en PDF ou JPG.
Au-delà du crawling, WaterCrawl inclut un moteur de recherche web pour des résultats en temps réel sur le web, une génération automatique de sitemap pour cartographier toutes les URL d'un site, et une intégration OpenAI intégrée pour transformer le HTML brut en données structurées et significatives. Il offre un système de plugins extensible, une surveillance en temps réel de l'état et des performances du crawling via des événements envoyés par le serveur, et un reporting d'erreurs complet. Le projet est open source sous une licence MIT modifiée, avec une utilisation commerciale en tant que service concurrent nécessitant une autorisation.
Les développeurs intègrent WaterCrawl via une API REST claire avec authentification basée sur JWT et support de webhook, ainsi que des SDK officiels pour Python, Go, Node.js, PHP et Rust. L'API prend en charge le démarrage de requêtes de crawling uniques ou en lot, la configuration des options de spider et de page, le streaming de l'état en direct, et le téléchargement des résultats au format JSON ou Markdown, ainsi que des points de terminaison de recherche dédiés.
Un plan gratuit fournit 1 000 crédits de page par mois avec des proxies de datacenter et une fenêtre de rétention de 7 jours.
Fonctionnalités principales de WaterCrawl
Contrôles de crawling intelligents pour la profondeur, les domaines et les chemins
Extraction de contenu précise avec des sélecteurs personnalisés
Rendu JavaScript et captures d'écran en PDF ou JPG
Moteur de recherche web intégré avec résultats en temps réel
Génération automatique de sitemap et cartographie de site
Traitement alimenté par l'IA via l'intégration OpenAI
Open source avec un système de plugins extensible
API REST, webhooks et SDK pour plusieurs langages
Comment utiliser WaterCrawl ?
Inscrivez-vous gratuitement : Créez un compte et obtenez 1 000 crédits de page par mois.
Obtenez une clé API : Générez une clé API d'équipe depuis le tableau de bord.
Configurez un crawl : Définissez l'URL de départ, la profondeur, les domaines et les options de page.
Exécutez et surveillez : Démarrez le crawl et suivez les progrès en temps réel via SSE.
Récupérez les données : Téléchargez les résultats au format JSON ou Markdown, ou recevez-les via webhook.
Cas d'utilisation de WaterCrawl
- Pipelines de données LLM
- Agrégation de contenu
- Recherche de marché
- Moteurs de recherche
- Surveillance de site web




