Description
DeepSeek OCR est une IA documentaire à deux étapes, basée sur un transformateur, qui compresse les images de pages en tokens visuels compacts avant de les décoder avec un modèle de langage à mélange d'experts à haute capacité. La première étape fusionne un transformateur de vision SAM à fenêtre avec un encodeur CLIP-Large dense et un compresseur convolutionnel 16x, tandis que la deuxième étape utilise le décodeur DeepSeek-3B-MoE (~570M de paramètres actifs par token) pour reconstruire le texte, le HTML et les annotations de figures avec une perte minimale.
Son innovation principale est la compression optique contextuelle : en réduisant une page de 1024x1024 à aussi peu que 256 tokens, DeepSeek OCR permet l'ingestion de documents longs qui submergeraient les pipelines OCR conventionnels, tout en préservant la sémantique globale et en réduisant les besoins en calcul. Un sélecteur de mode varie de Tiny (64 tokens) à Gundam (carrelage multi-vues), permettant aux utilisateurs d'ajuster l'équilibre entre vitesse et fidélité pour les factures, les plans et les scans grand format.
Entraîné sur 30 millions de pages PDF réelles ainsi que sur des graphiques, des formules et des diagrammes synthétiques, il préserve la structure de mise en page, les tableaux, les chaînes SMILES de chimie et les tâches géométriques, et il prend en charge plus de 100 langues, y compris les scripts latins, CJK, cyrilliques et scientifiques. La sortie structurée peut être émise sous forme de tableaux HTML, Markdown, JSON, SMILES et légendes pour une ingestion directe dans des pipelines d'analyse.
Les poids sous licence MIT (un point de contrôle safetensors d'environ 6,7 Go) peuvent être exécutés sur site sur des GPU locaux, évitant ainsi l'exposition des données à l'étranger, ou appelés via l'API compatible OpenAI de DeepSeek avec une tarification basée sur les tokens. Un seul NVIDIA A100 peut traiter environ 200 000 pages par jour.
Fonctionnalités principales de DeepSeek OCR
OCR à deux étapes avec compression optique contextuelle
DeepEncoder combinant SAM à fenêtre et CLIP-Large avec compression 16x
Décodeur à mélange d'experts DeepSeek-3B (~570M de paramètres actifs)
Sélecteur de mode de Tiny (64 tokens) à Gundam carrelage multi-vues
Prise en charge de plus de 100 langues, y compris CJK, cyrillique et scripts scientifiques
Sortie structurée sous forme de tableaux HTML, Markdown, JSON, SMILES et légendes
Poids sous licence MIT pour déploiement local sur GPU
API hébergée compatible OpenAI avec tarification basée sur les tokens
Comment utiliser DeepSeek OCR ?
Déployer localement : Clonez le dépôt GitHub, téléchargez le point de contrôle safetensors d'environ 6,7 Go et configurez PyTorch 2.6+ avec FlashAttention sur un GPU compatible.
Ou appelez l'API : Utilisez les points de terminaison compatibles OpenAI de DeepSeek pour soumettre des images et recevoir du texte structuré avec facturation basée sur les tokens.
Choisissez un mode : Sélectionnez Tiny, Base, Large ou Gundam pour équilibrer vitesse et fidélité selon votre type de document.
Intégrez les sorties : Convertissez les résultats en JSON, liez les chaînes SMILES aux pipelines de chimie informatique, ou intégrez du HTML sensible à la mise en page dans des workflows d'automatisation et RAG.
Cas d'utilisation de DeepSeek OCR
- Livres et rapports numérisés
- Diagrammes techniques et formules
- Création de jeux de données multilingues
- Applications de conversion de documents
- OCR sur site à grande échelle




