# Inspector de PDF etiquetado

Compara la extraccion con y sin StructTree para ver si el PDF tiene estructura etiquetada util

> Página canónica: https://elysiatools.com/es/tools/tagged-pdf-inspector

- **Categoría:** Developer Tools

- **Palabras clave:** pdf, tagged pdf, struct tree

## Descripción general

Tras subir un PDF, la herramienta ejecuta OpenDataLoader con `useStructTree=true` y `useStructTree=false`, y compara titulos, listas, tablas y bloques de parrafo. Sirve para decidir si la estructura etiquetada del PDF merece ser aprovechada.

## Entradas

- **Archivo PDF** (file)
- **Paginas** (text): e.g. 1,3,5-7
- **Incluir encabezado y pie** (checkbox)

## Cuándo usarlo

- Cuando necesitas verificar si un documento PDF contiene etiquetas semánticas (Tagged PDF) válidas antes de procesarlo en un pipeline de datos.
- Para diagnosticar problemas de extracción de texto donde los títulos, listas o tablas no se reconocen correctamente con métodos tradicionales.
- Al preparar flujos de ingesta de datos para modelos RAG y decidir si confiar en la estructura interna del PDF o usar heurísticas visuales.

## Cómo funciona

- Sube tu archivo PDF utilizando el campo principal de entrada.
- Opcionalmente, especifica un rango de páginas (por ejemplo, 1,3,5-7) y decide si deseas incluir encabezados y pies de página en la extracción.
- La herramienta ejecuta OpenDataLoader dos veces: una con el soporte de StructTree activado y otra desactivado.
- Finalmente, genera un informe HTML comparativo que resalta las diferencias en la detección de nodos semánticos, jerarquía de títulos y tablas.

## Casos de uso

- Auditoría de accesibilidad documental para comprobar si los PDF generados por un sistema corporativo cumplen con los estándares de etiquetado.
- Optimización de pipelines de datos RAG, determinando si el árbol de estructura del PDF mejora la fragmentación (chunking) del texto.
- Depuración de herramientas de conversión de PDF a HTML o Markdown cuando el formato de salida pierde la jerarquía original de los títulos.

## Preguntas frecuentes

### ¿Qué es un PDF etiquetado (Tagged PDF)?

Es un PDF que contiene una estructura de árbol oculta (StructTree) que define la semántica del contenido, indicando qué texto corresponde a un título, un párrafo, una lista o una tabla.

### ¿Por qué comparar la extracción con y sin StructTree?

Porque muchos PDF tienen etiquetas incorrectas, generadas automáticamente o incompletas. Comparar ambos métodos ayuda a decidir cuál ofrece mejores resultados para tu caso de uso específico.

### ¿Puedo analizar solo páginas específicas de un documento largo?

Sí, puedes usar el campo 'Páginas' para definir rangos específicos (ej. 1-5, 10) y así acelerar el análisis sin procesar todo el documento.

### ¿Qué motor utiliza esta herramienta para la extracción?

Utiliza OpenDataLoader para procesar el documento y evaluar la calidad de la estructura semántica subyacente.

### ¿Qué tipo de resultados obtendré?

Obtendrás un informe en formato HTML que muestra lado a lado las diferencias en la detección de bloques de texto, listas y tablas, incluyendo el recuento de nodos semánticos.

## Herramientas relacionadas

- [Analizador de PDF con formulas y graficos](https://elysiatools.com/es/tools/formula-chart-heavy-pdf-analyzer): Compara la extraccion local e hybrid de OpenDataLoader para identificar paginas que requieren ayuda de IA
- [Eliminador de ruido de encabezado y pie PDF](https://elysiatools.com/es/tools/pdf-header-footer-noise-remover): Compara la extraccion con y sin encabezados/pies para detectar ruido repetido en el texto
- [Depurador de orden de lectura PDF](https://elysiatools.com/es/tools/pdf-reading-order-debugger): Compara el orden bruto del PDF con XY-Cut++ para detectar problemas de lectura en layouts complejos
- [Extractor de revision con tachado PDF](https://elysiatools.com/es/tools/pdf-strikethrough-review-extractor): Detecta texto tachado en PDFs de revision y genera un informe para contratos, politicas y borradores
- [Explorador de estructura JSON desde PDF](https://elysiatools.com/es/tools/pdf-to-json-structure-explorer): Extrae la estructura JSON de OpenDataLoader desde un PDF y muestra encabezados, parrafos, tablas, listas y bounding boxes
- [Puente de PDF (OCR) a JSON estructurado](https://elysiatools.com/es/tools/ocr-pdf-to-structured-json-bridge): Extrae la capa de texto del PDF con geometría (líneas por posición y, tablas por huecos de columna, títulos por tamaño de fuente, pares clave-valor con dos puntos) y rellena campo a campo un JSON Schema del usuario — etiquetas emparejadas por claves normalizadas, valores coaccionados a los tipos declarados y validados con ajv.
- [Extractor de imagenes y captions PDF](https://elysiatools.com/es/tools/pdf-image-caption-extractor): Extrae imagenes PDF, empareja captions cercanos y genera un indice HTML navegable
- [Escaner de prompt injection para PDF](https://elysiatools.com/es/tools/pdf-prompt-injection-scanner): Compara extracciones seguras e inseguras para detectar texto oculto, contenido fuera de pagina y otros riesgos en PDF

## Ejemplos

- [Muestras PDF](https://elysiatools.com/es/samples/pdf-samples): Muestras PDF generadas por herramientas 2026-02-01 a 2026-02-10
- [Ejemplos de Presentaciones Markdown](https://elysiatools.com/es/samples/md-slide-deck-to-pdf): Mazos Markdown estilo Remark/Marp para probar la exportacion a PDF
- [Muestras ICS del Planificador por Zona Horaria](https://elysiatools.com/es/samples/time-zone-workflow-scheduler-ics-samples): Archivos ICS con la misma estructura devuelta por Time Zone Workflow Scheduler, incluyendo varios VEVENT de candidatos
- [Muestras Go](https://elysiatools.com/es/samples/go-viewer-samples): Archivos de muestra para el visor Go en el navegador

## Contenido relacionado

- [Revision de archivo, accesibilidad y confianza en PDF](https://elysiatools.com/es/hubs/pdf-archival-accessibility-trust): Limpia paginas escaneadas, agrega OCR, prepara PDF/A, revisa estructura accesible, crea marcadores y verifica firmas antes de archivar.
- [Flujos de extraccion y depuracion de PDF](https://elysiatools.com/es/hubs/pdf-extraction-debugging-workflows): Depura casos dificiles de PDF revisando cifrado, seguridad, paginas, orden de lectura, OCR, tablas y salidas estructuradas.
- [Preparacion de PDF para LLM y RAG](https://elysiatools.com/es/hubs/pdf-llm-rag-prep): Convierte PDFs en entradas limpias, seguras y citables para resumen con LLM, embeddings, busqueda y RAG.
- [Chunking RAG y preparacion de recuperacion](https://elysiatools.com/es/hubs/rag-chunking-retrieval-prep): Limpia PDFs y Word, elimina ruido de extraccion, revisa riesgos de prompt oculto, divide texto, puntua chunks y prepara entradas RAG con citas.
