# Extracción OCR de documentos

Extrae texto OCR de escaneos y convierte páginas o imágenes en Markdown, JSON, tablas, captions y fragmentos listos para recuperación con control de calidad.

> Página canónica: https://elysiatools.com/es/hubs/document-ocr-extraction

- **Palabras clave:** OCR de documentos, PDF escaneado a markdown, extracción OCR a JSON, extracción de tablas PDF, fragmentación documental para RAG

## Preguntas frecuentes

### ¿Todo PDF escaneado debe pasar por OCR a Markdown?

No. Si el PDF ya tiene una capa de texto fiable, la extracción directa suele ser más rápida y más limpia.

### ¿Cuándo conviene un extractor especializado en lugar de OCR genérico?

Cuando importan campos concretos de un recibo o una identificación más que la fidelidad del párrafo, porque el objetivo es JSON estructurado.

### ¿La extracción de tablas sustituye la revisión de páginas?

No. Las tablas OCR suelen requerir verificación por celdas combinadas, filas partidas, símbolos monetarios y encabezados desplazados.

### ¿Por qué fragmentar después y no antes?

Fragmentar OCR de baja calidad solo propaga errores. Primero estabiliza texto y estructura, luego prepáralos para recuperación.
