# Depurador de orden de lectura PDF

Compara el orden bruto del PDF con XY-Cut++ para detectar problemas de lectura en layouts complejos

> Página canónica: https://elysiatools.com/es/tools/pdf-reading-order-debugger

- **Categoría:** Developer Tools

- **Palabras clave:** pdf, reading order, xycut

## Descripción general

Sube un PDF y la herramienta ejecutara OpenDataLoader con `readingOrder=off` y `readingOrder=xycut` para producir una comparacion pagina por pagina. Es util para documentos multicolumna, folletos, informes y PDFs con maquetacion compleja.

## Entradas

- **Archivo PDF** (file)
- **Usar arbol estructural** (checkbox)
- **Incluir encabezado y pie** (checkbox)
- **Paginas** (text): e.g. 1,3,5-7

## Cuándo usarlo

- Al procesar documentos con múltiples columnas donde el texto se extrae de forma desordenada.
- Para verificar si los encabezados y pies de página interfieren con el flujo principal de lectura.
- Cuando se necesita validar la estructura lógica de un PDF antes de realizar una extracción de datos masiva.

## Cómo funciona

- Sube el archivo PDF y especifica el rango de páginas que deseas analizar.
- El sistema procesa el documento dos veces: una con el orden de dibujo bruto y otra aplicando el algoritmo XY-Cut++.
- Se genera una comparación técnica que resalta las discrepancias en la secuencia del texto extraído.
- Revisa el informe HTML resultante para confirmar qué método de lectura preserva mejor la coherencia del contenido.

## Casos de uso

- Auditoría de extracción de datos en artículos científicos con maquetación de doble columna.
- Validación de flujos de lectura en folletos publicitarios y revistas con diseño gráfico complejo.
- Depuración de informes financieros donde las tablas y el texto lateral pueden confundir a los extractores estándar.

## Preguntas frecuentes

### ¿Qué es XY-Cut++?

Es un algoritmo avanzado que analiza la geometría del PDF para reconstruir el orden de lectura humano en layouts complejos.

### ¿Por qué el texto de mi PDF aparece desordenado?

Los PDF suelen almacenar texto en el orden en que fue dibujado, no necesariamente en el orden lógico en que se lee.

### ¿Puedo analizar solo páginas específicas?

Sí, puedes definir rangos de páginas exactos, como '1, 3, 5-7', en el campo de configuración de páginas.

### ¿Para qué sirve la opción 'Usar árbol estructural'?

Permite aprovechar los metadatos de etiquetas internas del PDF para intentar mejorar la precisión del orden de lectura.

### ¿Qué formato tiene el resultado?

La herramienta genera un informe en formato HTML con una comparativa detallada página por página.

## Herramientas relacionadas

- [Analizador de PDF con formulas y graficos](https://elysiatools.com/es/tools/formula-chart-heavy-pdf-analyzer): Compara la extraccion local e hybrid de OpenDataLoader para identificar paginas que requieren ayuda de IA
- [Eliminador de ruido de encabezado y pie PDF](https://elysiatools.com/es/tools/pdf-header-footer-noise-remover): Compara la extraccion con y sin encabezados/pies para detectar ruido repetido en el texto
- [Inspector de PDF etiquetado](https://elysiatools.com/es/tools/tagged-pdf-inspector): Compara la extraccion con y sin StructTree para ver si el PDF tiene estructura etiquetada util
- [Explorador de estructura JSON desde PDF](https://elysiatools.com/es/tools/pdf-to-json-structure-explorer): Extrae la estructura JSON de OpenDataLoader desde un PDF y muestra encabezados, parrafos, tablas, listas y bounding boxes
- [Puente de PDF (OCR) a JSON estructurado](https://elysiatools.com/es/tools/ocr-pdf-to-structured-json-bridge): Extrae la capa de texto del PDF con geometría (líneas por posición y, tablas por huecos de columna, títulos por tamaño de fuente, pares clave-valor con dos puntos) y rellena campo a campo un JSON Schema del usuario — etiquetas emparejadas por claves normalizadas, valores coaccionados a los tipos declarados y validados con ajv.
- [Escaner de prompt injection para PDF](https://elysiatools.com/es/tools/pdf-prompt-injection-scanner): Compara extracciones seguras e inseguras para detectar texto oculto, contenido fuera de pagina y otros riesgos en PDF
- [Conversor PDF a Markdown](https://elysiatools.com/es/tools/pdf-to-markdown): Convierte documentos PDF a formato Markdown con extracción de texto y preservación de formato
- [PDF a Texto Avanzado](https://elysiatools.com/es/tools/pdf-to-text-advanced): Conversor avanzado de PDF a texto con selección de páginas, opciones de formato y extracción de metadatos

## Ejemplos

- [Muestras PDF](https://elysiatools.com/es/samples/pdf-samples): Muestras PDF generadas por herramientas 2026-02-01 a 2026-02-10
- [Ejemplos de Presentaciones Markdown](https://elysiatools.com/es/samples/md-slide-deck-to-pdf): Mazos Markdown estilo Remark/Marp para probar la exportacion a PDF
- [Muestras ICS del Planificador por Zona Horaria](https://elysiatools.com/es/samples/time-zone-workflow-scheduler-ics-samples): Archivos ICS con la misma estructura devuelta por Time Zone Workflow Scheduler, incluyendo varios VEVENT de candidatos
- [Muestras OFD](https://elysiatools.com/es/samples/ofd-samples): Muestras OFD para pruebas de analisis de documentos de diseno fijo GB/T 33190

## Contenido relacionado

- [Flujos de extraccion y depuracion de PDF](https://elysiatools.com/es/hubs/pdf-extraction-debugging-workflows): Depura casos dificiles de PDF revisando cifrado, seguridad, paginas, orden de lectura, OCR, tablas y salidas estructuradas.
