# Gerador de chunks RAG e citation pack para PDF

Converte um PDF em chunks RAG com pagina, bounding box e metadados de citacao

> Página canônica: https://elysiatools.com/pt/tools/pdf-rag-chunker-citation-pack

- **Categoria:** AI Tools

- **Palavras-chave:** pdf, rag, citacao, chunk

## Visão geral

Envie um PDF e a ferramenta executa o OpenDataLoader para gerar JSON estruturado. Em seguida, paragrafos, listas, tabelas e titulos sao agrupados em chunks para RAG com pagina, bounding box e contexto de secao.

## Entradas

- **Arquivo PDF** (file)
- **Modo de fragmentacao** (select)
- **Caracteres maximos por bloco** (number)
- **Usar arvore estrutural** (checkbox)
- **Sanitizar dados sensiveis** (checkbox)
- **Incluir tabelas** (checkbox)

## Quando usar

- Ao preparar documentos PDF para alimentar bancos de dados vetoriais em sistemas de Retrieval-Augmented Generation (RAG).
- Quando é necessário que a IA cite a página exata e a localização visual de uma informação dentro de um PDF original.
- Para processar relatórios técnicos ou financeiros onde a estrutura de títulos e tabelas deve ser preservada para manter o contexto.

## Como funciona

- O usuário faz o upload do arquivo PDF e seleciona o modo de fragmentação, como o agrupamento baseado em títulos ou por elemento individual.
- A ferramenta utiliza o OpenDataLoader para analisar a árvore estrutural do documento, identificando elementos como listas, tabelas e hierarquia de cabeçalhos.
- O conteúdo é dividido em blocos (chunks) respeitando o limite de caracteres definido e anexando metadados de localização e contexto de seção.
- Um arquivo JSON estruturado é gerado, contendo os fragmentos de texto prontos para indexação em vector stores ou uso em sistemas de chat fundamentados em documentos.

## Casos de uso

- Criação de assistentes virtuais corporativos que precisam responder perguntas baseadas em manuais técnicos extensos com citações de página.
- Automação de auditorias de conformidade onde cada resposta da IA deve apontar para a evidência exata e localização no documento fonte.
- Indexação de relatórios financeiros anuais em bancos de dados vetoriais para análise comparativa rápida e precisa.

## Perguntas frequentes

### O que é o modo 'heading-aware'?

É uma fragmentação que agrupa o conteúdo respeitando a hierarquia de títulos para manter o contexto semântico de cada seção.

### A ferramenta processa tabelas do PDF?

Sim, se a opção 'Incluir tabelas' estiver ativa, as tabelas são extraídas como nós estruturados dentro dos chunks gerados.

### O que são as bounding boxes incluídas no JSON?

São as coordenadas geográficas que indicam a posição exata do texto na página do PDF original, permitindo o realce visual da fonte.

### Posso limitar o tamanho dos blocos de texto?

Sim, você pode configurar o número máximo de caracteres por chunk, com um intervalo permitido entre 200 e 4000 caracteres.

### A ferramenta remove dados sensíveis?

Existe uma opção de sanitização que, quando ativada, ajuda a ocultar informações sensíveis identificadas durante o processamento do documento.

## Ferramentas relacionadas

- [PDF para texto limpo para LLM](https://elysiatools.com/pt/tools/pdf-to-clean-text-for-llm): Extrai texto limpo de PDFs para resumo, traducao, embedding e outros fluxos com LLM
- [Pacote de Temas Markdown para PDF](https://elysiatools.com/pt/tools/markdown-to-pdf-theme-pack): Converte Markdown em PDF com temas claro, escuro ou impressão
- [Conversão PDF/A](https://elysiatools.com/pt/tools/pdf-a-convert): Converte PDFs para um perfil PDF/A autodeclarado sem dependências externas
- [PDF para Excel](https://elysiatools.com/pt/tools/pdf-to-excel): Extrai dados tabulares de arquivos PDF e os converte em planilhas Excel com opções de análise personalizáveis
- [Conversor PDF para Markdown](https://elysiatools.com/pt/tools/pdf-to-markdown): Converte documentos PDF para formato Markdown com extração de texto e preservação de formatação
- [PDF para Texto Avançado](https://elysiatools.com/pt/tools/pdf-to-text-advanced): Conversor avançado de PDF para texto com seleção de páginas, opções de formatação e extração de metadados
- [Ponte de PDF (OCR) para JSON estruturado](https://elysiatools.com/pt/tools/ocr-pdf-to-structured-json-bridge): Extrai a camada de texto do PDF com geometria (linhas por posição y, tabelas por vaos de coluna, títulos por tamanho de fonte, pares chave-valor com dois pontos) e preenche campo a campo um JSON Schema do usuário — rótulos pareados por chaves normalizadas, valores coagidos aos tipos declarados e validados com ajv.
- [Removedor de ruido de cabecalho e rodape PDF](https://elysiatools.com/pt/tools/pdf-header-footer-noise-remover): Compara a extracao com e sem cabecalhos/rodapes para detectar ruido repetido no texto

## Exemplos

- [Exemplos PDF](https://elysiatools.com/pt/samples/pdf-samples): Exemplos PDF gerados por ferramentas de 2026-02-01 a 2026-02-10
- [Exemplos de Apresentacoes Markdown](https://elysiatools.com/pt/samples/md-slide-deck-to-pdf): Decks Markdown estilo Remark/Marp para testar exportacao em PDF
- [Amostras ICS do Agendador por Fuso Horario](https://elysiatools.com/pt/samples/time-zone-workflow-scheduler-ics-samples): Arquivos ICS na mesma estrutura retornada pelo Time Zone Workflow Scheduler, com varios VEVENT de horarios candidatos
- [Amostras de legendas ASS](https://elysiatools.com/pt/samples/ass-samples): Arquivos ASS do simples ao complexo para parse com estilos, traducao, conversao e QA de localizacao

## Conteúdo relacionado

- [Extração OCR de documentos](https://elysiatools.com/pt/hubs/document-ocr-extraction): Extraia texto OCR de scans e converta páginas ou imagens em Markdown, JSON, tabelas, legendas e blocos prontos para recuperacao com verificacao de qualidade.
- [Preparação de PDF para LLM e RAG](https://elysiatools.com/pt/hubs/pdf-llm-rag-prep): Transforme PDFs em entradas limpas, seguras e citaveis para resumo com LLM, embeddings, busca e RAG.
- [Chunking RAG e preparo de recuperacao](https://elysiatools.com/pt/hubs/rag-chunking-retrieval-prep): Limpe PDFs e Word, remova ruido de extração, detecte prompts ocultos, divida texto, pontue chunks e prepare entradas RAG citaveis.
