# AI RAG 分块质量评分器

对文档的候选 RAG 分块方案在四个维度上评分——连贯性（干净的分句/分段边界）、覆盖率（主题聚焦 / 关键词集中度）、上下文重叠健康度以及分块大小一致性——并排对比最多三种方案并推荐最优。纯离线启发式，无模型调用。

> 标准页面: https://elysiatools.com/zh/tools/ai-rag-chunk-quality-scorer

- **分类:** AI Tools

- **关键词:** rag, 分块, 分块大小, 检索增强生成, 向量数据库, 嵌入, 语义分块, 查询覆盖率, 上下文重叠, rag 评估, 知识库, 文档切分, 大模型

## 概述

面向 AI 工程师与文档问答团队的 RAG 分块评估器：

1. **文档** —— 粘贴你打算建索引的源文本。
2. **计量单位与方法** —— 按字符、单词或 ≈token 计数，并按定长（可能截断句子）、按句子（对齐到句末）或按段落（对齐到段落末）切分。
3. **三个候选方案** —— 为方案 A、B、C 各设一个分块大小和重叠，这些就是你要对比的配置。
4. **评分** —— 每个方案在连贯性、覆盖率、重叠、一致性上各得 0–100 分，总分为四项均值。
5. **推荐** —— 工具选出总分最高的方案，给出并排评分卡，并把最优方案展开为各分块并标注边界。

所有指标均为本地确定性启发式计算，无外部 API、无模型调用，结果可复现、迭代成本低。

## 输入项

- **文档文本** (textarea): Paste the document you want to chunk for RAG…
- **计量单位** (select)
- **切分方法** (select)
- **方案 A — 大小** (number): e.g. 256
- **方案 A — 重叠** (number): e.g. 32
- **方案 B — 大小** (number): e.g. 512
- **方案 B — 重叠** (number): e.g. 64
- **方案 C — 大小** (number): e.g. 1024
- **方案 C — 重叠** (number): e.g. 128
- **展示视图** (select)
- **小数位数** (number): 1

## 适用场景

- 在构建检索增强生成（RAG）知识库前，需要评估不同分块大小（Chunk Size）和重叠度（Overlap）对文档切分质量的影响时。
- 想要对比定长切分、按句子切分或按段落切分等不同切分方法在保持上下文连贯性上的表现时。
- 需要在无网络连接、无模型调用预算或要求结果可复现的场景下，快速优化向量检索的文档分块策略时。

## 工作原理

- 输入需要建索引的源文本，并选择计量单位（字符、单词或近似 Token）与切分方法（定长、按句子或按段落）。
- 分别设置方案 A、B、C 的分块大小与重叠大小，系统将基于本地确定性启发式算法对各方案进行切分模拟。
- 算法从连贯性、覆盖率、重叠健康度及一致性四个维度自动计算评分（0-100分），并输出并排对比的评分卡。
- 切换至明细视图，直观查看总分最高的推荐方案在文档中的具体分块边界与切分效果。

## 使用案例

- 优化技术文档的 RAG 检索精度，通过对比不同 Token 大小下的分块覆盖率，避免检索时丢失关键上下文。
- 评估法律条款或政策文件的切分方案，确保分块边界完整对齐到句末或段落末，提升语义嵌入质量。
- 降低 RAG 系统开发调试成本，在将文档导入向量数据库前，离线快速筛选出最佳的 Chunk Size 和 Overlap 参数组合。

## 常见问题

### 这个评分器需要调用大模型或外部 API 吗？

不需要。它完全基于本地确定性启发式算法运行，无任何外部 API 调用，结果可完全复现且无运行成本。

### 评分器支持哪些计量单位和切分方法？

支持按字符、单词或近似 Token 进行计量，并提供定长切分（可能截断句子）、按句子对齐切分以及按段落对齐切分三种方法。

### 评分的四个维度分别代表什么？

连贯性评估边界是否避开句中截断；覆盖率评估主题聚焦度；重叠健康度评估上下文衔接；一致性评估分块大小的均匀度。

### 为什么定长切分方法的连贯性得分通常较低？

因为定长切分容易在句子中间强行截断，破坏了语义的完整性，而按句子或段落对齐能保持更好的语义连贯性。

### 如何查看最优方案的具体分块效果？

将展示视图（renderMode）切换为“最优方案明细”，即可在页面上直接查看带有边界标注的具体分块文本。

## 相关工具

- [PDF 转 LLM 干净文本](https://elysiatools.com/zh/tools/pdf-to-clean-text-for-llm): 将 PDF 抽取成适合摘要、翻译、向量化和问答的干净纯文本
- [ECharts 主题 Token 抽取器](https://elysiatools.com/zh/tools/echarts-theme-token-extractor): 从 ECharts 主题 JSON 抽取设计 token——颜色、数字、字号与字符串——并直接导出到你的设计系统。粘贴一个主题对象（即通过 echarts.init(dom, themeName) 注册的那种），工具遍历每个叶子节点，为每个颜色（可选地将命名色/rgb 规范化为 hex）、间距数字、字号与字符串打标，然后输出干净的 CSS 变量、Tailwind theme.extend 配置、Style Dictionary tokens.json 或 SCSS 变量。在 ECharts 可视化主题与 Figma/CSS/Tailwind 设计 token 之间架桥，无需逐个手抄。
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- [智能文本总结器 - AI内容分析](https://elysiatools.com/zh/tools/text-summarizer): 智能提取文章核心要点，生成高质量总结。支持多种总结风格和长度，适用于学术论文、新闻报道、工作报告等各类文本
- [角速度单位换算器（rad/s / rpm / deg/s / Hz）](https://elysiatools.com/zh/tools/angular-velocity-converter): 角速度/角频率单位互转：rad/s（SI 基准）↔ rpm（转每分，1=2π/60 rad/s）↔ deg/s（度每秒，1=π/180 rad/s）↔ Hz（转每秒，1=2π rad/s）。注意 Hz 用于角频率时指每秒一整圈，故 1 Hz=2π rad/s。经 rad/s 中转后输出目标单位，并列出全部四单位等值。参考：黑胶 33⅓ rpm≈3.49 rad/s、发动机怠速 ~800 rpm≈83.8 rad/s。
- [BOM字符移除器](https://elysiatools.com/zh/tools/data-bom-remover): 从文本和文件内容中移除BOM（字节顺序标记）字符。非常适合清理有编码问题的文本文件、修复CSV导入和为处理准备数据。 功能特点： - 检测并移除UTF-8 BOM (EF BB BF) - 检测并移除UTF-16 BOM (FE FF 或 FF FE) - 检测并移除UTF-32 BOM (00 00 FE FF 或 FF FE 00 00) - 支持多种输入格式 - 可视化BOM字符显示 - 详细检测报告 - 支持批量文本处理 常见用途： - 修复CSV文件导入错误 - 清理文本文件编码问题 - 为JSON解析准备数据 - 修复XML解析问题 - 解决API数据编码冲突 - 标准化文本数据格式
- [疲劳极限计算器（Goodman / Gerber / Soderberg）](https://elysiatools.com/zh/tools/fatigue-limit-calculator): 平均应力修正下的疲劳安全系数。给定应力幅 σ_a、平均应力 σ_m，以及材料 σ_uts、疲劳极限 σ_-1、屈服 σ_y，输出三种经典判据的安全系数：Modified Goodman（线性保守）、Gerber（抛物线，更贴合延性材料）、Soderberg（用 σ_y，最保守）。取三者最小值为控制值，并判定工作点是否在 Haigh 图 Goodman 线内侧。
- [游离水清除率计算器（鉴别低/高钠血症）](https://elysiatools.com/zh/tools/free-water-clearance): 计算游离水清除率（C_H₂O）及电解质游离水清除率（eC_H₂O）。经典公式 C_H₂O = V·(1−U_osm/P_osm)：正值提示稀释尿（排出游离水，如尿崩症、精神性多饮、水负荷恢复期）；负值提示浓缩尿（保留游离水，如脱水、SIADH）。电解质游离水清除率 eC_H₂O = V·(1−(U_Na+U_K)/P_Na) 预测血钠变化更准确，负值提示排出电解质游离水、使血钠升高（指导补液）。来源 Rose 临床生理学、Shimizu 2002 Nephron、NephSIM。为点估计值，需结合临床。不构成医疗建议。

## 示例

- [无版权MP3音频样本](https://elysiatools.com/zh/samples/mp3-samples): 免费使用和测试的无版权音频样本集合，包括自然声音、冥想音乐和环境音频，适用于测试和开发目的
- [Web Python 图像处理示例](https://elysiatools.com/zh/samples/web-image-processing-python): Web Python 图像处理示例，使用 PIL/Pillow 包括读取、保存、缩放和格式转换
- [SVG示例](https://elysiatools.com/zh/samples/svg-samples): 可缩放矢量图形（SVG）示例，展示各种SVG功能和技术
- [Android Java 图像处理示例](https://elysiatools.com/zh/samples/android-image-processing-java): Android Java 图像处理示例，包括图像读取保存、缩放和格式转换

## 相关内容

- [RAG 分块、语料清洗与检索准备工具](https://elysiatools.com/zh/hubs/rag-chunking-retrieval-prep): 把分块评分、文本清洗、OCR 恢复、可引用分块导出与 token 预估放到同一专题，帮助你构建质量更高的 RAG 语料库。
- [文本大小写、编码与规范化转换工具](https://elysiatools.com/zh/hubs/text-convert): 在一个专题中比较文本大小写转换、全半角转换、编码转换、Quoted-Printable 处理和行内文本规范化工具。
- [Text 工具专题](https://elysiatools.com/zh/hubs/text-utility): 探索 33 个围绕 text 的 utility 工作流工具，快速找到相近能力。
- [文本分析、可读性与内容检查工具](https://elysiatools.com/zh/hubs/text-analyze): 在一个专题中比较文本统计、语言识别、可读性评分、情感分析、内容审核和模式分析工具。
