# RAG 分块、语料清洗与检索准备工具

把分块评分、文本清洗、OCR 恢复、可引用分块导出与 token 预估放到同一专题，帮助你构建质量更高的 RAG 语料库。

> 标准页面: https://elysiatools.com/zh/hubs/rag-chunking-retrieval-prep

- **分类:** prepare

- **关键词:** RAG 分块工具, RAG 语料准备, 知识库清洗, 可引用分块, 向量索引预处理, 文档分块质量, 检索前准备, 语义检索工作流

## 概述

这个专题聚焦于文档进入向量索引之前的准备工作：先清理源内容、裁出真正需要的页码、补 OCR、检查结构是否保留下来，再比较分块方案并导出可回链引用的结果。这样你可以把原始文件更稳定地整理成更容易检索、更容易排障的 RAG 语料。

## 工具

- AI RAG 分块质量评分器: 对文档的候选 RAG 分块方案在四个维度上评分——连贯性（干净的分句/分段边界）、覆盖率（主题聚焦 / 关键词集中度）、上下文重叠健康度以及分块大小一致性——并排对比最多三种方案并推荐最优。纯离线启发式，无模型调用。
- PDF RAG 分块与引用包生成器: 将 PDF 转成带页码、bbox 与标题路径的 RAG 分块 JSON，便于向量库入库和引用回链
- PDF 转 LLM 干净文本: 将 PDF 抽取成适合摘要、翻译、向量化和问答的干净纯文本
- PDF 页眉页脚噪音清理器: 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- Tagged PDF 检查器: 对比启用和关闭 StructTree 的抽取结果，判断 PDF 是否具备可利用的 Tagged 语义结构
- PDF Prompt Injection 扫描器: 通过对比安全抽取与关闭过滤后的抽取结果，识别 PDF 中的隐藏文本、页外内容、超小字体和隐藏图层风险
- PDF 页码范围提取器: 按指定页码范围提取 PDF 内容，并导出为 Markdown、JSON 或纯文本
- Word文本提取器: 从Word文档中提取文本内容，支持格式选项、段落选择和多语言处理
- AI Token 预估器: 按语言体系分析文本，并预估 OpenAI、Codex、Claude 和 DeepSeek 的 token 消耗
- 句子分离器: 按标点符号分割段落，支持句号、问号、感叹号、省略号等多种标点
- 文本分割器: 按自定义分隔符、字符或模式分割文本
- 扫描版 PDF OCR 转 Markdown: 将扫描版或图片型 PDF 转成 Markdown，优先走 OpenDataLoader hybrid OCR，并在后端不可用时优雅回退

## 示例

- 向量数据库示例: 全面的向量数据库示例，包括Chroma、Pinecone、Weaviate、FAISS和自定义向量解决方案，用于语义搜索和RAG应用
- LangChain 示例: 使用 LangChain 的AI应用开发框架示例，包括链、代理和记忆来构建LLM驱动的应用程序
- Markdown 示例: Markdown 格式示例，从简单到复杂的文档结构

## 常见问题

### 这个专题能做什么？

你可以清理原始文档、检查结构、只抽出需要的页码、试验 chunk 边界、生成可引用的分块结果，并在内容进入向量索引前预估 token 规模。

### 适合谁用？

它适合做 RAG 的工程师、内部知识库团队、AI 应用开发者、技术写作者，以及所有要把长文档整理成可检索语料的人。

### 应该从哪里开始？

先把源文档清理干净或裁出目标页码，再用有代表性的文本比较 chunk 大小，最后再进入可引用分块导出或向量数据库接入。

## 相关内容

- [PDF 转 LLM 与 RAG 预处理工具](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 在建索引或喂给模型之前，把 PDF 处理成适合 AI 使用的 clean text、结构化 Markdown 和 JSON、表格结果、OCR 文本层、chunk 包与安全检查结果。
- [文档 OCR 与结构化提取工具](https://elysiatools.com/zh/hubs/document-ocr-extraction): 面向扫描 PDF 与文档图片的 OCR 和结构化提取流程，可输出文本、Markdown、JSON、表格、图片说明和 RAG 可用分块。
- [提示词工程与大模型输入准备工具](https://elysiatools.com/zh/hubs/prompt-engineering-llm-input-workflows): 结构化提示词、估算 OpenAI/Claude/Codex/DeepSeek 的 token、翻译提示词、清洗 PDF 作为背景材料并审查 prompt 注入风险，集中在一个提示词工程页面。
- [PDF 抽取排障与安全审查工具](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 在一个 PDF 抽取排障专题里检查阅读顺序、页眉页脚噪声、隐藏文本风险、OCR 回退需求和结构化导出质量。
