# Проводник структуры JSON из PDF

Извлекает JSON-структуру OpenDataLoader из PDF и показывает заголовки, абзацы, таблицы, списки и bounding box

> Каноническая страница: https://elysiatools.com/ru/tools/pdf-to-json-structure-explorer

- **Категория:** Developer Tools

- **Ключевые слова:** pdf, json, structure, explorer

## Обзор

После загрузки PDF инструмент создает JSON через OpenDataLoader и отображает заголовки, абзацы, списки, таблицы, страницы и bounding box в виде обзорного отчета. Это полезно для отладки качества парсинга и семантической структуры.

## Входные данные

- **PDF файл** (file)
- **Использовать структуру тегов** (checkbox)
- **Санитизировать чувствительные данные** (checkbox)
- **Страницы** (text): e.g. 1,3,5-7
- **Фильтр узлов** (select)
- **Поиск** (text): e.g. revenue or heading

## Когда использовать

- Когда необходимо проверить корректность распознавания таблиц и списков в PDF-документе.
- Для отладки иерархии заголовков и семантической структуры перед дальнейшей обработкой данных.
- При поиске конкретных узлов или проверке координат (bounding box) элементов на определенных страницах.

## Как это работает

- Загрузите исходный PDF-файл в инструмент.
- При необходимости укажите конкретные страницы, настройте фильтр узлов (например, только таблицы) или введите поисковый запрос.
- Инструмент обработает файл и сгенерирует наглядный HTML-отчет, отображающий извлеченную JSON-структуру и метаданные каждого элемента.

## Сценарии использования

- Отладка алгоритмов парсинга PDF для разработчиков систем документооборота.
- Визуальная проверка извлеченных финансовых таблиц из годовых отчетов перед их экспортом в базу данных.
- Анализ иерархии заголовков в объемных технических руководствах для создания оглавлений.

## Частые вопросы

### Что такое OpenDataLoader?

Это стандарт извлечения данных, который преобразует неструктурированные документы (например, PDF) в машиночитаемый JSON с сохранением семантики.

### Можно ли извлечь только таблицы?

Да, используйте опцию «Фильтр узлов» и выберите «Только таблицы», чтобы скрыть остальные элементы.

### Как обработать только определенные страницы?

Введите нужные номера в поле «Страницы» (например, 1,3,5-7), и инструмент проанализирует только их.

### Что делает опция санитизации данных?

Она скрывает или маскирует потенциально чувствительную информацию из извлеченного текста перед отображением отчета.

### В каком формате выдается результат?

Результат предоставляется в виде интерактивного HTML-отчета, который визуализирует JSON-структуру документа.

## Связанные инструменты

- [Мост OCR PDF → структурированный JSON](https://elysiatools.com/ru/tools/ocr-pdf-to-structured-json-bridge): Извлекает текстовый слой PDF с геометрией (строки по y-координате, таблицы по промежуткам колонок, заголовки по кеглю, пары ключ-значение через двоеточие) и заполняет пользовательскую JSON-схему поле за полем — метки сопоставляются по нормализованным ключам, значения приводятся к объявленным типам и проверяются ajv.
- [Экспорт аннотаций PDF](https://elysiatools.com/ru/tools/pdf-annotation-export): Извлекает существующие аннотации (выделения, комментарии, штампы, ссылки) из PDF в строку JSON
- [Экспорт данных формы PDF](https://elysiatools.com/ru/tools/pdf-form-data-export): Читает имена, типы и текущие значения полей AcroForm из PDF и экспортирует их как строку JSON
- [Извлечение таблиц PDF в CSV/JSON](https://elysiatools.com/ru/tools/pdf-table-extractor-to-csv-json): Извлекает таблицы из PDF через OpenDataLoader и экспортирует в JSON, CSV или HTML
- [Конвертер зашифрованного PDF](https://elysiatools.com/ru/tools/encrypted-pdf-converter): Открывает защищенные PDF с правильным паролем и экспортирует их в Markdown, JSON или текст
- [Извлечение диапазона страниц PDF](https://elysiatools.com/ru/tools/pdf-page-range-extractor): Извлекает только выбранный диапазон страниц PDF и экспортирует его в Markdown, JSON или текст
- [Генератор PDF-плана тренировок](https://elysiatools.com/ru/tools/fitness-workout-pdf-generator): Создает печатный PDF-план тренировок из JSON или CSV с таблицами, ячейками прогресса и QR-кодами
- [Заполнение шаблона LibreOffice](https://elysiatools.com/ru/tools/libreoffice-template-fill-merge): Подставляет плейсхолдеры в DOCX и рендерит PDF в стиле mail merge

## Примеры

- [PDF Примеры](https://elysiatools.com/ru/samples/pdf-samples): PDF примеры, созданные инструментами 2026-02-01..2026-02-10
- [JSON Примеры Terraform Plan](https://elysiatools.com/ru/samples/terraform-plan-json-samples): Файлы Terraform plan JSON для визуализации зависимостей и проверки изменений, похожие на terraform show -json
- [Примеры JSON](https://elysiatools.com/ru/samples/json): Примеры формата JSON (JavaScript Object Notation) от простых до сложных структур
- [Примеры JSON чата](https://elysiatools.com/ru/samples/chat-transcript-json): Примеры JSON для чат-транскриптов с несколькими ролями

## Связанные материалы

- [OCR-извлечение документов](https://elysiatools.com/ru/hubs/document-ocr-extraction): Извлекайте OCR-текст из сканов и преобразуйте страницы или изображения в Markdown, JSON, таблицы, описания и блоки для поиска с проверкой качества.
- [PDF: конвертация, OCR и извлечение данных](https://elysiatools.com/ru/hubs/pdf-convert): Преобразуйте офисные файлы, wiki-страницы, комментарии и изображения в PDF, а затем извлекайте текст, изображения, таблицы, структуру или OCR из готовых PDF.
- [Рабочие процессы извлечения и отладки PDF](https://elysiatools.com/ru/hubs/pdf-extraction-debugging-workflows): Отлаживайте сложное извлечение PDF: шифрование, безопасность, страницы, порядок чтения, OCR, таблицы и структурированный вывод.
- [Подготовка PDF для LLM и RAG](https://elysiatools.com/ru/hubs/pdf-llm-rag-prep): Преобразуйте PDF в чистые, безопасные и цитируемые входные данные для LLM, эмбеддингов, поиска и RAG.
