# Inspetor de PDF marcado

Compara a extracao com e sem StructTree para ver se o PDF possui estrutura marcada util

> Página canônica: https://elysiatools.com/pt/tools/tagged-pdf-inspector

- **Categoria:** Developer Tools

- **Palavras-chave:** pdf, tagged pdf, struct tree

## Visão geral

Depois de enviar um PDF, a ferramenta executa o OpenDataLoader com `useStructTree=true` e `useStructTree=false` e compara titulos, listas, tabelas e blocos de paragrafo. Isso ajuda a decidir se a estrutura marcada do PDF vale a pena em fluxos de acessibilidade, migracao e RAG.

## Entradas

- **Arquivo PDF** (file)
- **Paginas** (text): e.g. 1,3,5-7
- **Incluir cabecalho e rodape** (checkbox)

## Quando usar

- Para avaliar se a estrutura de um PDF é adequada para ingestão em sistemas RAG (Retrieval-Augmented Generation).
- Para verificar a qualidade das marcações semânticas (tags) em auditorias de acessibilidade de documentos.
- Para depurar falhas na extração de tabelas, listas e títulos antes de processar grandes volumes de PDFs.

## Como funciona

- Faça o upload do seu arquivo PDF e, opcionalmente, defina o intervalo de páginas e a inclusão de cabeçalhos e rodapés.
- A ferramenta processa o documento duas vezes usando o OpenDataLoader: uma com `useStructTree=true` e outra com `useStructTree=false`.
- Um relatório HTML é gerado lado a lado, destacando as diferenças na contagem de nós semânticos, títulos, listas e tabelas.

## Casos de uso

- Auditoria de documentos corporativos para garantir conformidade com padrões de acessibilidade digital.
- Preparação e limpeza de dados não estruturados para treinamento de modelos de IA e pipelines RAG.
- Migração de manuais e diretrizes de marca em PDF para formatos web estruturados (HTML/Markdown).

## Perguntas frequentes

### O que é um PDF marcado (Tagged PDF)?

É um PDF que contém uma estrutura de tags oculta (StructTree) que define a ordem de leitura e a semântica dos elementos, como títulos, parágrafos e tabelas.

### Por que comparar a extração com e sem StructTree?

Porque muitos PDFs possuem marcações incorretas, corrompidas ou ausentes. A comparação ajuda a decidir se é melhor confiar na estrutura nativa do arquivo ou usar heurísticas de extração visual.

### Posso analisar apenas páginas específicas?

Sim, você pode usar o campo 'Páginas' para definir intervalos específicos (por exemplo, 1,3,5-7) e focar apenas nas seções relevantes do documento.

### O que a ferramenta identifica na comparação?

Ela compara a quantidade e a precisão de nós semânticos, mostrando diferenças na detecção de blocos de texto, cabeçalhos, listas e estruturas tabulares.

### Os cabeçalhos e rodapés afetam a análise?

Podem afetar. Você pode marcar a opção 'Incluir cabeçalho e rodapé' para ver como esses elementos repetitivos são tratados pela árvore de estrutura do PDF.

## Ferramentas relacionadas

- [Analisador de PDF com formulas e graficos](https://elysiatools.com/pt/tools/formula-chart-heavy-pdf-analyzer): Compara a extracao local e hybrid do OpenDataLoader para identificar paginas que merecem parsing assistido por IA
- [Removedor de ruido de cabecalho e rodape PDF](https://elysiatools.com/pt/tools/pdf-header-footer-noise-remover): Compara a extracao com e sem cabecalhos/rodapes para detectar ruido repetido no texto
- [Depurador de ordem de leitura de PDF](https://elysiatools.com/pt/tools/pdf-reading-order-debugger): Compara a ordem bruta do PDF com XY-Cut++ para detectar problemas de leitura em layouts complexos
- [Extrator de revisao com tachado em PDF](https://elysiatools.com/pt/tools/pdf-strikethrough-review-extractor): Detecta texto riscado em PDFs revisados e gera um relatorio para contratos e revisoes
- [Explorador de estrutura JSON a partir de PDF](https://elysiatools.com/pt/tools/pdf-to-json-structure-explorer): Extrai a estrutura JSON do OpenDataLoader de um PDF e exibe titulos, paragrafos, tabelas, listas e bounding boxes
- [Ponte de PDF (OCR) para JSON estruturado](https://elysiatools.com/pt/tools/ocr-pdf-to-structured-json-bridge): Extrai a camada de texto do PDF com geometria (linhas por posição y, tabelas por vaos de coluna, títulos por tamanho de fonte, pares chave-valor com dois pontos) e preenche campo a campo um JSON Schema do usuário — rótulos pareados por chaves normalizadas, valores coagidos aos tipos declarados e validados com ajv.
- [Extrator de imagens e captions PDF](https://elysiatools.com/pt/tools/pdf-image-caption-extractor): Extrai imagens PDF, relaciona captions proximas e gera um indice HTML navegavel
- [Scanner de prompt injection para PDF](https://elysiatools.com/pt/tools/pdf-prompt-injection-scanner): Compara extracoes seguras e inseguras para detectar texto oculto, conteudo fora da pagina e outros riscos em PDF

## Exemplos

- [Exemplos PDF](https://elysiatools.com/pt/samples/pdf-samples): Exemplos PDF gerados por ferramentas de 2026-02-01 a 2026-02-10
- [Exemplos de Apresentacoes Markdown](https://elysiatools.com/pt/samples/md-slide-deck-to-pdf): Decks Markdown estilo Remark/Marp para testar exportacao em PDF
- [Amostras ICS do Agendador por Fuso Horario](https://elysiatools.com/pt/samples/time-zone-workflow-scheduler-ics-samples): Arquivos ICS na mesma estrutura retornada pelo Time Zone Workflow Scheduler, com varios VEVENT de horarios candidatos
- [Amostras Go](https://elysiatools.com/pt/samples/go-viewer-samples): Arquivos de amostra para o visualizador Go no navegador

## Conteúdo relacionado

- [Revisão de PDF para arquivo, acessibilidade e confianca](https://elysiatools.com/pt/hubs/pdf-archival-accessibility-trust): Limpe paginas digitalizadas, adicione OCR, prepare PDF/A, revise acessibilidade, crie marcadores e verifique assinaturas antes do arquivo.
- [Fluxos de extracao e depuracao de PDF](https://elysiatools.com/pt/hubs/pdf-extraction-debugging-workflows): Depure PDFs dificeis verificando criptografia, seguranca, paginas, ordem de leitura, OCR, tabelas e saidas estruturadas.
- [Preparação de PDF para LLM e RAG](https://elysiatools.com/pt/hubs/pdf-llm-rag-prep): Transforme PDFs em entradas limpas, seguras e citaveis para resumo com LLM, embeddings, busca e RAG.
- [Chunking RAG e preparo de recuperacao](https://elysiatools.com/pt/hubs/rag-chunking-retrieval-prep): Limpe PDFs e Word, remova ruido de extração, detecte prompts ocultos, divida texto, pontue chunks e prepare entradas RAG citaveis.
