# PDF去噪

使用真实图像处理算法去除扫描PDF页面的视觉噪点——椒盐噪点、随机颗粒以及背景灰雾。文字页保留为可搜索的矢量内容。

> 标准页面: https://elysiatools.com/zh/tools/pdf-denoise

- **分类:** PDF Tools

- **关键词:** pdf, denoise, denoising, noise, speckle, salt and pepper, median filter, binarize, otsu, despeckle, scan, clean

## 概述

使用纯JavaScript流水线（无需外部二进制文件）和真实的图像处理算子清理带噪点的扫描PDF页面。

**按页面内容类型分别处理（重要）：**
- **图片页**（扫描文档）：栅格化→去噪→嵌入。这是去噪真正有用的场景。
- **文字页**（含文字+图片混合页）：原样保留矢量内容，文字、字体、可搜索性完整保留。
- **空白页**：原样保留。

如果扫描件带有OCR文字层（被识别为"文字页"）但其底层图像仍有噪点，请启用"栅格化文字页"强制处理。

**去噪模式（均为真实算法）：**
- **自动**：3x3中值滤波 + 孤立斑点去除。保留色调与边缘的均衡清理——推荐默认。
- **中值滤波**：3x3逐通道中值滤波（1-3次）。椒盐/脉冲噪点的经典克星。
- **二值化**：Otsu自适应阈值。将背景灰雾塌缩为纯白、前景渲染为纯黑——尤其适合扫描文字的清晰度。

**工作原理（图片页）：**
1. 使用 pdf.js 将图片页栅格化
2. 对原始像素缓冲区运行所选去噪算子
3. 将清理后的图像嵌入新PDF

## 输入项

- **PDF文件** (file): 上传PDF文件
- **去噪模式** (select): 自动：均衡的中值+去斑（保留色调）。中值滤波：最适合椒盐/脉冲噪点。二值化：Otsu阈值将发灰背景变白、文字变黑。
- **强度（中值滤波次数）** (number): 3x3中值滤波次数（1-3）。值越大去噪越强但画面越柔和。二值化模式下忽略。
- **栅格化文字页** (select): 默认情况下文字页作为可搜索矢量内容保留（不去噪）。仅当OCR扫描件底层图像有噪点时启用，会损失文字可选性。
- **页面范围** (text): 指定要去噪的页面（例如：1-3,5,7-9）。留空则处理所有页面。

## 适用场景

- 扫描版PDF文档中存在大量细小墨点、椒盐噪点或纸张随机颗粒，影响阅读体验时。
- 影印件背景发灰、有暗影或灰雾，需要将背景调至纯白、文字调至纯黑以提升对比度时。
- 带有OCR文字层的PDF扫描件底层图像仍有噪点，需要强制栅格化并清理背景时。

## 工作原理

- 解析PDF文档并识别页面类型，将扫描图片页进行栅格化处理，而原生矢量文字页和空白页则原样保留以维持可搜索性。
- 对栅格化后的像素缓冲区运行所选的去噪算子，如中值滤波、Otsu自适应二值化或自动去斑处理。
- 将清理重建后的高清晰度图像重新嵌入并生成新的PDF文件。

## 使用案例

- 历史文献与档案数字化：清除老旧扫描书籍中的纸张黄斑、墨迹污点和颗粒噪点。
- 打印合同与发票清理：通过二值化算法消除打印件背景灰雾，使合同文字更加黑白分明、易于打印。
- 课件与讲义优化：去除复印版PDF课件上的杂乱黑点，提升学生阅读和打印时的视觉舒适度。

## 常见问题

### 去噪后PDF中的文字还能复制和搜索吗？

原生矢量文字页会原样保留，文字依然可搜索。若启用了“栅格化文字页”强制去噪，文字将转化为图片，失去可选性。

### 什么是“二值化”模式？适合什么场景？

二值化采用Otsu自适应阈值算法，将发灰的背景变为纯白，文字变为纯黑，非常适合提升纯文字扫描件的清晰度。

### “自动”模式和“中值滤波”模式有什么区别？

自动模式结合了3x3中值滤波与孤立斑点去除，能保留色调；中值滤波则专门针对椒盐和脉冲噪点进行多次平滑。

### 可以只对PDF的特定页面进行去噪吗？

可以，在“页面范围”中输入指定的页码或范围（例如“1-3,5”），未指定的页面将保持原样。

### 为什么有些带噪点的扫描件处理后没有变化？

如果扫描件含有OCR文字层，系统默认会将其识别为文字页而不做处理。此时需将“栅格化文字页”选项设置为“是”。

## 相关工具

- [PDF 清理工具](https://elysiatools.com/zh/tools/pdf-clean): 移除PDF文件中的元数据、注释、书签和表单字段
- [PDF页面裁剪](https://elysiatools.com/zh/tools/pdf-crop-page): 通过移除边缘边距来裁剪PDF页面
- [PDF删除页面](https://elysiatools.com/zh/tools/pdf-delete-page): 从PDF文档中删除指定页面
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- [PDF文本提取器](https://elysiatools.com/zh/tools/pdf-text-extractor): 从PDF文档中提取文本内容，支持页面选择、格式选项和多语言处理
- [批量条码生成器](https://elysiatools.com/zh/tools/barcode-batch-generator): 从 CSV 或多行文本批量生成 Code 128、EAN-13、UPC-A、ITF-14、QR Code 和 Data Matrix，并导出 PNG ZIP 或 PDF
- [PDF 安全脱敏清理器](https://elysiatools.com/zh/tools/pdf-secure-redaction-sanitizer): 通过重建图片型 PDF 永久移除文本和隐藏页面对象。
- [PDF高级优化](https://elysiatools.com/zh/tools/pdf-optimize-advanced): 高级PDF优化：移除元数据、清理结构、重新压缩内容

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [WebRTC 实时通信示例](https://elysiatools.com/zh/samples/webrtc-samples): 全面的 WebRTC 示例，用于点对点音视频通信、数据通道、屏幕共享和信令服务器实现
- [Docker镜像标签示例](https://elysiatools.com/zh/samples/docker-image-tag): 各种Docker镜像引用集合，包含不同的registry、repository、tag和digest

## 相关内容

- [PDF 归档、可访问性与可信交付审查](https://elysiatools.com/zh/hubs/pdf-archival-accessibility-trust): 清理扫描页、添加 OCR、准备 PDF/A、检查可访问结构、补充书签，并在归档交付前验证签名。
