# PDF 公式提取器（LaTeX / MathML / MathJax，保留 AMS 编号）

从矢量 PDF 中检测并重建内嵌数学公式：识别数学字体（CMMI/CMSY/CMEX、STIX、Cambria Math）与 Unicode 数学符号，恢复上下标与堆叠分式，保留 AMS 编号（含 (2a)/(2b) 子编号），输出可复制的 LaTeX、Presentation MathML（MathJax/KaTeX 兼容）与可下载的 .tex 公式包。

> 标准页面: https://elysiatools.com/zh/tools/pdf-latex-mathml-mathjax-formula-extractor-and-equation-number-preserver

- **分类:** Document Tools

- **关键词:** PDF 公式提取, LaTeX 提取, 公式编号保留, AMS 编号, MathML, MathJax, KaTeX, CMMI 字体识别, 子编号, 学术论文工作流, 公式识别替代

## 概述

原理：LaTeX 生成的 PDF 中，公式以专用数学字体的文本运行编码（CMMI 数学斜体、CMSY/CMEX 符号、MSAM/MSBM AMS 符号）；本工具经 pdf.js 操作符列表读取真实字体名（含子集前缀剥离），结合 Unicode 数学区、基线偏移（上下标）与垂直对齐行对（分式）重建公式；右页边距的 (N)/(Na) 编号按 amsmath equation/subequations 规则保留。每条 LaTeX 经 temml 渲染验证并生成 Presentation MathML（MathJax v3 可直接接受 MathML 输入）。局限：扫描版/图片型 PDF 无文本层，会被明确拒绝（需先行 OCR）；复杂矩阵、多行对齐环境为尽力重建。

## 输入项

- **PDF 文件** (file)
- **公式范围** (select)
- **最大扫描页数** (number)
- **渲染 MathML 预览** (checkbox)
- **生成 .tex 打包文件** (checkbox)

## 适用场景

- 需要从 arXiv 或学术论文矢量 PDF 中批量复制 LaTeX 公式代码时。
- 将 PDF 文档中的数学公式迁移至网页端（MathJax/KaTeX）或 Markdown 笔记中。
- 需要保留论文中原有的公式序号及子编号（如 (2a)、(2b)）并导出独立 .tex 文件时。

## 工作原理

- 解析 PDF 文本层与操作符列表，识别专用数学字体（如 CMMI、CMSY、CMEX、STIX、Cambria Math）及 Unicode 数学符号。
- 依据字符基线偏移与垂直对齐关系还原上下标、分式和积分等结构，并提取右侧边距的 AMS 编号与子编号。
- 通过 Temml 引擎对重建的 LaTeX 语法进行校验，生成 Presentation MathML 预览并提供 .tex 源码包下载。

## 使用案例

- 科研人员从已发表的 PDF 文献中提取复杂公式并插入自己的 LaTeX 论文草稿。
- 技术博主与教育工作者将教材 PDF 中的数学公式转换为网页 MathML 或 Markdown 格式。
- 开发者批量提取论文核心公式集并打包为 .tex 源码进行算法复现与推导归档。

## 常见问题

### 支持扫描件或纯图片生成的 PDF 吗？

不支持。该工具基于矢量文本层和字体信息解析，扫描件需先经过 OCR 处理建立文本层后再使用。

### 输出的 MathML 格式是否兼容 MathJax 和 KaTeX？

兼容。输出为标准的 Presentation MathML，MathJax v3 及兼容 MathML 的渲染器均可直接调用。

### 公式子编号（如 (1a)、(1b)）能被正确识别吗？

可以。解析器遵循 amsmath 的 equation 与 subequations 规则，能准确保留右侧边距的子编号。

### 行内公式和独立块级公式是否可以分开提取？

可以通过设置“公式范围”参数，选择仅提取显示公式、仅提取编号公式或同时提取全部公式。

### 上传的 PDF 文件大小和页数有限制吗？

单文件最大支持 25MB，扫描页数支持自定义设置，最大可处理 200 页。

## 相关工具

- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF/A 转换](https://elysiatools.com/zh/tools/pdf-a-convert): 将 PDF 转换为自声明 PDF/A 归档格式，零外部依赖
- [PDF文本提取器](https://elysiatools.com/zh/tools/pdf-text-extractor): 从PDF文档中提取文本内容，支持页面选择、格式选项和多语言处理
- [PDF转Excel](https://elysiatools.com/zh/tools/pdf-to-excel): 从PDF文件中提取表格数据并转换为Excel电子表格，支持自定义解析选项
- [PDF转PowerPoint](https://elysiatools.com/zh/tools/pdf-to-powerpoint): 从PDF文件中提取文本内容并转换为PowerPoint演示文稿
- [PDF转文本增强版](https://elysiatools.com/zh/tools/pdf-to-text-advanced): 高级PDF转文本转换器，支持页码选择、格式选项和元数据提取
- [公式 / 图表密集型 PDF 分析器](https://elysiatools.com/zh/tools/formula-chart-heavy-pdf-analyzer): 比较 OpenDataLoader 的本地与 hybrid 抽取结果，识别哪些 PDF 页面更适合使用 AI 辅助解析
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [手机号提取器示例](https://elysiatools.com/zh/samples/phone-number-extractor): 包含来自多个国家的电话号码的混合文本集合，用于提取测试
- [数字和货币示例](https://elysiatools.com/zh/samples/number-currency-samples): 用于测试货币提取的各种数字和货币格式文本
