Faut-il faire de l’OCR ou réutiliser une couche texte existante ?
Utilisez l’OCR sur des pages image ; privilégiez l’extraction directe quand le PDF contient déjà un texte sélectionnable fiable.
Elysia Tools
Navigation mobile
Workflow Playbook
Extrayez le texte OCR de scans et convertissez des pages ou images en Markdown, JSON, tableaux, légendes et segments prêts pour la recherche avec contrôle qualité.
Dossiers
Un workflow OCR fiable commence par la nature de la source. Certains PDF sont entièrement scannés et exigent un OCR complet. D’autres possèdent déjà une couche texte, ou mêlent pages numériques et insertions scannées. Cette différence détermine s’il faut faire de l’OCR, extraire directement ou découper le fichier.
Les rapports narratifs demandent souvent du Markdown ou du texte propre pour les éditeurs, relecteurs ou modèles de langage. Les reçus et pièces d’identité demandent plutôt des champs JSON. Les relevés financiers, manifestes et rapports de laboratoire peuvent dépendre davantage des tableaux que des paragraphes. Une seule exportation en texte brut sert rarement tous ces usages.
Conservez les limites de page, les titres et les valeurs clés lorsque vous produisez des tableaux, des légendes ou un JSON structurel. Cela facilite la preuve de l’origine d’un montant, d’un nom, d’une date ou d’une légende lors d’un audit ultérieur.
L’OCR n’est pas terminé dès qu’un texte apparaît. Vérifiez des pages représentatives et comparez titres, montants, noms, dates, en-têtes de tableau et lignes tronquées avec la source. Ensuite seulement, créez des segments avec citations pour le RAG ou publiez le Markdown et le JSON extraits.
Guide de workflow
Déterminez si l’ensemble du fichier nécessite un OCR ou seulement certaines pages, puis isolez la plage utile.
Lancez l’OCR sur les pages scannées ou l’extraction directe sur les PDF dotés d’une couche texte exploitable, en conservant la sortie brute pour comparaison.
Transformez le document en JSON structurel, tableaux, champs de reçu, champs d’identité ou légendes quand l’étape suivante exige une sémantique explicite.
Générez des segments avec citations et comparez titres, montants, noms, dates et tableaux à la source avant l’ingestion dans la recherche ou le RAG.
Utilisez l’OCR sur des pages image ; privilégiez l’extraction directe quand le PDF contient déjà un texte sélectionnable fiable.
Choisissez une extraction spécialisée pour reçus et pièces d’identité, une extraction de tableaux pour les pages tabulaires et Markdown ou texte propre pour les documents narratifs.
Réduisez la plage de pages si des annexes, couvertures ou pages peu utiles nuiraient à la qualité et au temps de revue.