# Depurador de ordem de leitura de PDF

Compara a ordem bruta do PDF com XY-Cut++ para detectar problemas de leitura em layouts complexos

> Página canônica: https://elysiatools.com/pt/tools/pdf-reading-order-debugger

- **Categoria:** Developer Tools

- **Palavras-chave:** pdf, reading order, xycut

## Visão geral

Envie um PDF e a ferramenta executara o OpenDataLoader com `readingOrder=off` e `readingOrder=xycut` para gerar uma comparacao por pagina. Isso e util para relatorios multicoluna, artigos e documentos com layout complexo.

## Entradas

- **Arquivo PDF** (file)
- **Usar arvore estrutural** (checkbox)
- **Incluir cabecalho e rodape** (checkbox)
- **Paginas** (text): e.g. 1,3,5-7

## Quando usar

- Ao processar relatórios financeiros com múltiplas colunas onde o texto extraído parece fora de ordem.
- Para validar a extração de artigos científicos que utilizam layouts densos e fluxos de leitura complexos.
- Quando a extração padrão de texto falha em manter a continuidade lógica de parágrafos em folhetos ou brochuras.

## Como funciona

- Carregue o arquivo PDF que apresenta problemas de leitura ou layout para análise.
- Defina o intervalo de páginas e escolha se deseja incluir cabeçalhos, rodapés ou utilizar a árvore estrutural do documento.
- O sistema processa o arquivo comparando os modos de extração bruta e o algoritmo de segmentação XY-Cut++.
- Visualize o relatório HTML gerado para identificar discrepâncias visuais e confirmar a melhor estratégia de extração.

## Casos de uso

- Otimização de fluxos de ingestão para LLMs, garantindo que o contexto do documento seja extraído na sequência correta.
- Auditoria de conversão de documentos técnicos onde a precisão da sequência de parágrafos e tabelas é crítica.
- Ajuste de parâmetros de extração para sistemas de RAG que processam PDFs com layouts não convencionais.

## Perguntas frequentes

### O que é o algoritmo XY-Cut++?

É um método de segmentação recursiva que analisa o layout do PDF para preservar a ordem lógica de leitura, especialmente em documentos com múltiplas colunas.

### Por que meu texto aparece embaralhado na extração bruta?

PDFs costumam armazenar o texto na ordem em que os elementos foram desenhados na tela, o que raramente coincide com a ordem de leitura humana em layouts complexos.

### Posso depurar apenas páginas específicas do documento?

Sim, você pode especificar páginas individuais ou intervalos, como '1, 3, 5-10', no campo de configuração de páginas.

### Para que serve a opção 'Usar árvore estrutural'?

Ela tenta aproveitar as metatags de estrutura interna do PDF (Tagged PDF) para determinar a ordem correta dos elementos antes de aplicar algoritmos geométricos.

### O que significa o resultado '0 changed pages'?

Isso indica que a ordem de desenho bruta e o algoritmo XY-Cut++ resultaram na mesma sequência de texto, sugerindo um layout simples de coluna única.

## Ferramentas relacionadas

- [Analisador de PDF com formulas e graficos](https://elysiatools.com/pt/tools/formula-chart-heavy-pdf-analyzer): Compara a extracao local e hybrid do OpenDataLoader para identificar paginas que merecem parsing assistido por IA
- [Removedor de ruido de cabecalho e rodape PDF](https://elysiatools.com/pt/tools/pdf-header-footer-noise-remover): Compara a extracao com e sem cabecalhos/rodapes para detectar ruido repetido no texto
- [Inspetor de PDF marcado](https://elysiatools.com/pt/tools/tagged-pdf-inspector): Compara a extracao com e sem StructTree para ver se o PDF possui estrutura marcada util
- [Explorador de estrutura JSON a partir de PDF](https://elysiatools.com/pt/tools/pdf-to-json-structure-explorer): Extrai a estrutura JSON do OpenDataLoader de um PDF e exibe titulos, paragrafos, tabelas, listas e bounding boxes
- [Ponte de PDF (OCR) para JSON estruturado](https://elysiatools.com/pt/tools/ocr-pdf-to-structured-json-bridge): Extrai a camada de texto do PDF com geometria (linhas por posição y, tabelas por vaos de coluna, títulos por tamanho de fonte, pares chave-valor com dois pontos) e preenche campo a campo um JSON Schema do usuário — rótulos pareados por chaves normalizadas, valores coagidos aos tipos declarados e validados com ajv.
- [Scanner de prompt injection para PDF](https://elysiatools.com/pt/tools/pdf-prompt-injection-scanner): Compara extracoes seguras e inseguras para detectar texto oculto, conteudo fora da pagina e outros riscos em PDF
- [Conversor PDF para Markdown](https://elysiatools.com/pt/tools/pdf-to-markdown): Converte documentos PDF para formato Markdown com extração de texto e preservação de formatação
- [PDF para Texto Avançado](https://elysiatools.com/pt/tools/pdf-to-text-advanced): Conversor avançado de PDF para texto com seleção de páginas, opções de formatação e extração de metadados

## Exemplos

- [Exemplos PDF](https://elysiatools.com/pt/samples/pdf-samples): Exemplos PDF gerados por ferramentas de 2026-02-01 a 2026-02-10
- [Exemplos de Apresentacoes Markdown](https://elysiatools.com/pt/samples/md-slide-deck-to-pdf): Decks Markdown estilo Remark/Marp para testar exportacao em PDF
- [Amostras ICS do Agendador por Fuso Horario](https://elysiatools.com/pt/samples/time-zone-workflow-scheduler-ics-samples): Arquivos ICS na mesma estrutura retornada pelo Time Zone Workflow Scheduler, com varios VEVENT de horarios candidatos
- [Amostras OFD](https://elysiatools.com/pt/samples/ofd-samples): Amostras OFD para testes de analise de documentos de layout fixo GB/T 33190

## Conteúdo relacionado

- [Fluxos de extracao e depuracao de PDF](https://elysiatools.com/pt/hubs/pdf-extraction-debugging-workflows): Depure PDFs dificeis verificando criptografia, seguranca, paginas, ordem de leitura, OCR, tabelas e saidas estruturadas.
