# Отладчик порядка чтения PDF

Сравнивает обычный порядок извлечения PDF и XY-Cut++ для выявления проблем в сложных макетах

> Каноническая страница: https://elysiatools.com/ru/tools/pdf-reading-order-debugger

- **Категория:** Developer Tools

- **Ключевые слова:** pdf, reading order, xycut

## Обзор

Загрузите PDF, и инструмент запустит OpenDataLoader с `readingOrder=off` и `readingOrder=xycut`, чтобы построить постраничное сравнение. Это особенно полезно для многоколоночных отчетов, статей и брошюр.

## Входные данные

- **PDF файл** (file)
- **Использовать структуру тегов** (checkbox)
- **Включать колонтитулы** (checkbox)
- **Страницы** (text): e.g. 1,3,5-7

## Когда использовать

- При работе с многоколоночными PDF-документами, где текст извлекается в неправильной последовательности.
- Для проверки корректности распознавания структуры в научных статьях, брошюрах и финансовых отчетах.
- Перед автоматизированной обработкой больших объемов PDF для выбора оптимального алгоритма извлечения данных.

## Как это работает

- Загрузите PDF-файл и укажите диапазон страниц для анализа в соответствующем поле.
- Инструмент запускает два процесса извлечения: стандартный (по порядку отрисовки) и с применением алгоритма XY-Cut++.
- Система сопоставляет полученные результаты и формирует детальный HTML-отчет с постраничным сравнением.
- Изучите отчет, чтобы увидеть, как алгоритмы обрабатывают колонки, врезки и колонтитулы в вашем документе.

## Сценарии использования

- Отладка парсеров для извлечения данных из многоколоночных научных публикаций и журналов.
- Проверка качества подготовки PDF-документов перед их индексацией в поисковых системах или LLM-приложениях.
- Анализ сложных маркетинговых материалов с нестандартным расположением текстовых блоков и графики.

## Частые вопросы

### Что такое XY-Cut++?

Это алгоритм сегментации страниц, который использует геометрический анализ для корректного распознавания колонок и блоков текста в сложных макетах.

### Зачем сравнивать порядок чтения?

Чтобы убедиться, что при автоматическом извлечении текста абзацы и колонки не перемешиваются, сохраняя логическую связность документа.

### Можно ли анализировать только определенные страницы?

Да, вы можете указать конкретные номера страниц или диапазоны, например '1, 3, 5-7', чтобы ускорить процесс отладки.

### Влияют ли колонтитулы на результат анализа?

Вы можете включить или исключить верхние и нижние колонтитулы из процесса сравнения с помощью специальной опции в настройках.

### Что делать, если оба метода извлечения дают одинаковый результат?

Это означает, что структура документа проста и стандартный порядок отрисовки совпадает с логическим порядком чтения.

## Связанные инструменты

- [Анализатор PDF с формулами и графиками](https://elysiatools.com/ru/tools/formula-chart-heavy-pdf-analyzer): Сравнивает локальное и hybrid-извлечение OpenDataLoader, чтобы найти страницы, где нужен AI-assisted parsing
- [Очиститель шума колонтитулов PDF](https://elysiatools.com/ru/tools/pdf-header-footer-noise-remover): Сравнивает извлечение с колонтитулами и без них, чтобы найти повторяющийся шум в тексте
- [Инспектор Tagged PDF](https://elysiatools.com/ru/tools/tagged-pdf-inspector): Сравнивает извлечение с StructTree и без него, чтобы понять, содержит ли PDF полезную tagged-структуру
- [Проводник структуры JSON из PDF](https://elysiatools.com/ru/tools/pdf-to-json-structure-explorer): Извлекает JSON-структуру OpenDataLoader из PDF и показывает заголовки, абзацы, таблицы, списки и bounding box
- [Мост OCR PDF → структурированный JSON](https://elysiatools.com/ru/tools/ocr-pdf-to-structured-json-bridge): Извлекает текстовый слой PDF с геометрией (строки по y-координате, таблицы по промежуткам колонок, заголовки по кеглю, пары ключ-значение через двоеточие) и заполняет пользовательскую JSON-схему поле за полем — метки сопоставляются по нормализованным ключам, значения приводятся к объявленным типам и проверяются ajv.
- [Сканер prompt injection для PDF](https://elysiatools.com/ru/tools/pdf-prompt-injection-scanner): Сравнивает безопасное и небезопасное извлечение, чтобы выявить скрытый текст, контент вне страницы и другие риски PDF
- [Конвертер PDF в Markdown](https://elysiatools.com/ru/tools/pdf-to-markdown): Конвертирует PDF документы в формат Markdown с извлечением текста и сохранением форматирования
- [PDF в текст расширенный](https://elysiatools.com/ru/tools/pdf-to-text-advanced): Расширенный конвертер PDF в текст с выбором страниц, параметрами форматирования и извлечением метаданных

## Примеры

- [PDF Примеры](https://elysiatools.com/ru/samples/pdf-samples): PDF примеры, созданные инструментами 2026-02-01..2026-02-10
- [Примеры Markdown Презентаций](https://elysiatools.com/ru/samples/md-slide-deck-to-pdf): Markdown колоды в стиле Remark/Marp для тестирования экспорта в PDF
- [ICS Примеры Планировщика по Часовым Поясам](https://elysiatools.com/ru/samples/time-zone-workflow-scheduler-ics-samples): ICS-файлы в той же структуре, что и у Time Zone Workflow Scheduler, с несколькими VEVENT для кандидатов
- [OFD образцы](https://elysiatools.com/ru/samples/ofd-samples): OFD-образцы для тестов парсинга документов фиксированного макета GB/T 33190

## Связанные материалы

- [Рабочие процессы извлечения и отладки PDF](https://elysiatools.com/ru/hubs/pdf-extraction-debugging-workflows): Отлаживайте сложное извлечение PDF: шифрование, безопасность, страницы, порядок чтения, OCR, таблицы и структурированный вывод.
