OCR
Optical Character Recognition
Technologie de reconnaissance de texte dans des images ou des documents numérisés — convertit les données en pixels en texte traitable.
Qu’est-ce que l’OCR ?
L’OCR (Optical Character Recognition) est une technologie de reconnaissance automatique de texte dans des images — documents numérisés, photographies, fichiers PDF (sans couche de texte lisible par machine). L’OCR analyse les pixels, identifie les caractères individuels et les assemble en texte pouvant être traité, recherché, copié ou envoyé à d’autres systèmes.
On distingue :
- OCR classique — reconnaissance de caractères (Tesseract, ABBYY)
- IDP (Intelligent Document Processing) — OCR + compréhension IA de la mise en page, comprend également la structure du document (tableaux, en-têtes, pieds de page)
- ICR (Intelligent Character Recognition) — reconnaissance de l’écriture manuscrite
L’OCR moderne basé sur le deep learning atteint une précision de 98 à 99 % sur du texte imprimé de bonne qualité. Problèmes courants : scans inclinés, taches, tampons illisibles, tableaux sans lignes claires — la combinaison IA/RAG aide ici.
En entreprise B2B, l’OCR est particulièrement utile pour :
- Les factures reçues en PDF — extraction du numéro de TVA, des montants, de la TVA, de l’échéance
- Les contrats — recherche en texte intégral dans les archives
- Les notes de frais — lecture des tickets de caisse
Quand l’utiliser ?
L’OCR est la première étape de pratiquement toute automatisation IA de documents. Sans OCR, un modèle IA ne pourrait pas traiter une facture PDF ou un contrat numérisé.
Voir le module Extraction de documents et le module Fichiers.
Termes associés
- Extraction de documents — processus bout en bout OCR + extraction IA. Voir /fr/glossaire/vytazovanie-dokladov-pojem.
- e-Invoice — alternative où l’OCR n’est pas nécessaire. Voir /fr/glossaire/e-invoice.
- RAG — après l’OCR, les documents sont typiquement indexés dans un système RAG. Voir /fr/glossaire/rag.
Dans Modulario
Le module Extraction de documents de Modulario combine l’OCR avec l’extraction IA — une facture PDF arrive par e-mail, le système effectue l’OCR, le modèle IA extrait tous les champs pertinents et crée automatiquement un enregistrement de facture reçue dans la Comptabilité.
Modulario utilise une architecture en couches : pour les PDF lisibles par machine, le texte est extrait directement ; pour les PDFs numérisés ou avec couches, un moteur OCR est déclenché. La précision d’extraction des champs courants d’une facture (numéro de TVA, montant, date) est d’environ 98 % dans Modulario, les cas ambigus sont signalés pour vérification manuelle.
Termes associés
Extraction de documents
Lecture automatisée des factures, commandes, bons de livraison et autres documents via OCR et IA — extraction des données sans ressaisie manuelle.
RAG
Technique qui enrichit un LLM d'une recherche dynamique dans les documents de l'entreprise — la réponse est générée en combinant le contexte récupéré et le modèle génératif.
AI Agent
Système logiciel basé sur un LLM qui résout des tâches de façon autonome — planifie les étapes, utilise des outils et appelle des API pour atteindre un objectif.
e-Invoice
Facture électronique structurée au format XML/UBL pouvant être traitée automatiquement sans ressaisie manuelle.
P2P
Processus de bout en bout depuis l'émission d'une demande d'achat, via la commande, la réception et la facture, jusqu'au règlement du fournisseur.
Modules Modulario associés
Vous implémentez OCR dans votre entreprise ?
Modulario couvre la plupart des processus B2B de façon modulaire — déployez uniquement ce dont vous avez besoin maintenant et évoluez progressivement. Prenez un rendez-vous gratuit.
Réserver une consultation