# Puente de PDF (OCR) a JSON estructurado

Extrae la capa de texto del PDF con geometría (líneas por posición y, tablas por huecos de columna, títulos por tamaño de fuente, pares clave-valor con dos puntos) y rellena campo a campo un JSON Schema del usuario — etiquetas emparejadas por claves normalizadas, valores coaccionados a los tipos declarados y validados con ajv.

> Página canónica: https://elysiatools.com/es/tools/ocr-pdf-to-structured-json-bridge

- **Categoría:** Document Tools

- **Palabras clave:** pdf a json, json schema, extracción estructurada, extracción de facturas, extracción de tablas

## Descripción general

Esta herramienta extrae la información contenida en la capa de texto de un archivo PDF analizando su geometría espacial —incluyendo encabezados, pares clave-valor y tablas alineadas— para mapear y coaccionar automáticamente los datos dentro de un JSON Schema predefinido, validando el resultado final mediante Ajv.

## Entradas

- **Archivo PDF (con capa de texto)** (file): Invoice / form / statement PDF with a text layer
- **JSON Schema de destino** (textarea): { "type": "object", "properties": { "invoice_number": { "type": "string" }, "total": { "type": "number" } }, "required": \["invoice_number"\] }
- **Estilo de coerción numérica** (select)

## Cuándo usarlo

- Al transformar facturas, recibos o estados de cuenta en PDF a objetos JSON listos para APIs o bases de datos.
- Cuando se requiere validar formalmente que los datos extraídos de un documento cumplan con restricciones de tipo, formato o listas de valores permitidos (enum).
- Al automatizar la lectura de formularios en PDF con capas de texto estructuradas sin necesidad de escribir analizadores sintácticos manuales.

## Cómo funciona

- Sube el archivo PDF con capa de texto y proporciona el JSON Schema de destino en formato de texto.
- El motor analiza la posición vertical y horizontal del texto para identificar títulos por tamaño de fuente, tablas por columnas y claves separadas por dos puntos.
- Los datos detectados se normalizan, se asignan a las propiedades del esquema y se coaccionan a los tipos correspondientes (como números y fechas).
- El validador Ajv comprueba la estructura final y entrega un reporte visual con la tabla de mapeo, los datos en JSON y los posibles errores de esquema.

## Casos de uso

- Mapeo de facturas de proveedores hacia esquemas JSON estructurados para sistemas ERP y contables.
- Extracción y tipado estricto de resúmenes de transacciones o extractos financieros en PDF.
- Conversión de órdenes de compra estandarizadas en cargas útiles validadas para pipelines de automatización.

## Preguntas frecuentes

### ¿El documento PDF debe contener texto editable?

Sí, el archivo debe contar con una capa de texto digital o procesada previamente mediante OCR para que los elementos geométricos puedan ser leídos.

### ¿Cómo se gestionan los diferentes separadores decimales?

Puedes definir la opción de estilo numérico en 'Auto' (asumiendo el último separador como decimal), forzar decimal con punto o forzar decimal con coma.

### ¿Qué ocurre si los datos del PDF no cumplen una regla del JSON Schema?

El JSON resultante se genera con los valores detectados, pero el validador Ajv listará las rutas exactas y el motivo de cada fallo de validación.

### ¿La herramienta puede detectar tablas estructuradas?

Sí, identifica distribuciones tabulares analizando los espacios y alineaciones entre columnas dentro de la capa de texto.

### ¿Se modifican los valores originales si fallan las restricciones de un enum?

No, el sistema conserva el valor real extraído del PDF y reporta el desajuste en el panel de validación sin sustituir información de forma silenciosa.

## Herramientas relacionadas

- [Transcripcion de chat a PDF](https://elysiatools.com/es/tools/chat-transcript-to-pdf): Maqueta transcripciones multirol en PDF
- [Generador PDF de entrenamiento fitness](https://elysiatools.com/es/tools/fitness-workout-pdf-generator): Genera un PDF imprimible de entrenamiento desde JSON o CSV con tablas, casillas de progreso y QR opcionales
- [JSON de texto enriquecido a PDF](https://elysiatools.com/es/tools/richtext-json-to-pdf): Convierte JSON de TipTap/Quill/Slate a PDF
- [Explorador de estructura JSON desde PDF](https://elysiatools.com/es/tools/pdf-to-json-structure-explorer): Extrae la estructura JSON de OpenDataLoader desde un PDF y muestra encabezados, parrafos, tablas, listas y bounding boxes
- [Generador de Data URI](https://elysiatools.com/es/tools/data-uri-generator): Convierte archivos en Data URIs (Base64 o porcentaje-codificado) para incrustar imágenes, fuentes y recursos directamente en HTML, CSS o Markdown
- [Convertidor de PDF cifrado](https://elysiatools.com/es/tools/encrypted-pdf-converter): Abre PDF protegidos con la contrasena correcta y los exporta como Markdown, JSON o texto
- [Rellenador PDF AcroForm](https://elysiatools.com/es/tools/pdf-acroform-filler): Rellena campos de formulario PDF por JSON y exporta el PDF final
- [Exportación de anotaciones PDF](https://elysiatools.com/es/tools/pdf-annotation-export): Extrae anotaciones existentes (resaltados, comentarios, sellos, enlaces) de un PDF a una cadena JSON

## Ejemplos

- [Muestras PDF](https://elysiatools.com/es/samples/pdf-samples): Muestras PDF generadas por herramientas 2026-02-01 a 2026-02-10
- [Ejemplos JSON de Chat](https://elysiatools.com/es/samples/chat-transcript-json): Ejemplos JSON para transcripciones de chat multirrol
- [Ejemplos JSON de Texto Enriquecido](https://elysiatools.com/es/samples/rich-media-json): Ejemplos JSON para editores de texto enriquecido (TipTap, Quill, Slate)
- [Muestras JSON de Terraform Plan](https://elysiatools.com/es/samples/terraform-plan-json-samples): Archivos Terraform plan JSON para visualizacion de dependencias y revision de cambios, similares a terraform show -json
