# Extractor de fórmulas PDF (LaTeX / MathML / MathJax, conserva numeración AMS)

Detecta y reconstruye fórmulas matemáticas embebidas en PDF vectoriales: identifica fuentes matemáticas (CMMI/CMSY/CMEX, STIX, Cambria Math) y símbolos Unicode, recupera super/subíndices y fracciones apiladas, conserva la numeración AMS (incluidas subnumeraciones (2a)/(2b)) y produce LaTeX copiable, MathML de presentación (compatible con MathJax/KaTeX) y un paquete .tex descargable.

> Página canónica: https://elysiatools.com/es/tools/pdf-latex-mathml-mathjax-formula-extractor-and-equation-number-preserver

- **Categoría:** Document Tools

- **Palabras clave:** extractor de fórmulas pdf, latex de pdf, numeración de ecuaciones, numeración AMS, mathml, mathjax, katex, fuentes cmmi, subecuaciones, flujo académico, alternativa a ocr de fórmulas

## Descripción general

Fundamento: en los PDF generados por LaTeX, las fórmulas se codifican como ejecuciones de texto en fuentes matemáticas dedicadas (CMMI cursiva, símbolos CMSY/CMEX, MSAM/MSBM); la herramienta lee los nombres reales de fuente vía la lista de operadores de pdf.js (con despojo del prefijo de subconjunto), combina bloques Unicode matemáticos, desplazamientos de línea base (super/subíndices) y pares de líneas alineadas verticalmente (fracciones); los números (N)/(Na) del margen derecho se conservan según equation/subequations de amsmath. Cada LaTeX se valida con temml y genera MathML de presentación (MathJax v3 acepta MathML directamente). Limitaciones: los PDF escaneados sin capa de texto se rechazan explícitamente (requieren OCR previo); matrices complejas y entornos multilínea son reconstrucción de mejor esfuerzo.

## Entradas

- **Archivo PDF** (file)
- **Alcance de fórmulas** (select)
- **Páginas máximas a escanear** (number)
- **Renderizar vista previa MathML** (checkbox)
- **Generar paquete .tex** (checkbox)

## Cuándo usarlo

- Cuando necesitas extraer ecuaciones matemáticas editables en LaTeX o MathML desde artículos científicos o libros en formato PDF vectorial.
- Al digitalizar o migrar publicaciones académicas a plataformas web compatibles con MathJax o KaTeX manteniendo intacta la numeración original de ecuaciones (incluidas subecuaciones como (1a) o (1b)).
- Cuando requieres generar rápidamente un archivo de paquete `.tex` descargable con todas las fórmulas de un documento sin transcribir símbolos a mano.

## Cómo funciona

- Carga el archivo PDF vectorial y define el alcance de extracción (ecuaciones en bloque display, expresiones en línea o solo ecuaciones numeradas) y el límite de páginas.
- El motor examina las listas de operadores gráficos y fuentes matemáticas (CMMI, CMSY, CMEX, STIX) para identificar símbolos Unicode, desplazamientos de línea base para índices y alineaciones verticales para fracciones.
- El sistema detecta las referencias de numeración en el margen derecho conforme al estándar de amsmath y valida cada expresión matemática reconstruida mediante temml.
- Obtén la vista previa renderizada en MathML, copia el código LaTeX directamente al portapapeles o descarga el paquete `.tex` listo para compilar.

## Casos de uso

- Recuperación de fórmulas en artículos de arXiv o conferencias para reutilizar expresiones algebraicas en nuevas investigaciones en LaTeX.
- Conversión de documentos técnicos y manuales de ingeniería en PDF a páginas HTML interactivas con renderizado MathML y MathJax.
- Extracción sistemática de sistemas de ecuaciones numeradas para verificar derivaciones teóricas en software de álgebra computacional.

## Preguntas frecuentes

### ¿Puede extraer fórmulas de documentos PDF escaneados o imágenes?

No, la herramienta requiere PDFs vectoriales con capa de texto y metadatos de fuentes matemáticas; los archivos basados únicamente en imágenes escaneadas se rechazan.

### ¿Cómo se preservan las numeraciones de ecuaciones y subecuaciones?

El extractor detecta las etiquetas numéricas alineadas en el margen derecho y las asocia con la fórmula correspondiente siguiendo los esquemas de amsmath.

### ¿Qué formato de salida genera la herramienta?

Genera código LaTeX copiable, Presentation MathML compatible directamente con MathJax y KaTeX, y opcionalmente un paquete descargable en formato `.tex`.

### ¿Cuál es la diferencia entre el alcance 'display', 'all' y 'numbered'?

'Display' extrae solo fórmulas en bloque independiente, 'all' incluye tanto fórmulas en bloque como expresiones dentro del párrafo, y 'numbered' filtra exclusivamente las que poseen numeración.

### ¿Existe un límite en el tamaño del archivo o número de páginas a procesar?

El tamaño máximo de archivo admitido es de 25 MB y permite escanear de 1 a 200 páginas por ejecución según el parámetro configurado.

## Herramientas relacionadas

- [Puente de PDF (OCR) a JSON estructurado](https://elysiatools.com/es/tools/ocr-pdf-to-structured-json-bridge): Extrae la capa de texto del PDF con geometría (líneas por posición y, tablas por huecos de columna, títulos por tamaño de fuente, pares clave-valor con dos puntos) y rellena campo a campo un JSON Schema del usuario — etiquetas emparejadas por claves normalizadas, valores coaccionados a los tipos declarados y validados con ajv.
- [Conversión PDF/A](https://elysiatools.com/es/tools/pdf-a-convert): Convierte documentos PDF a un perfil PDF/A autodeclarado sin dependencias externas
- [Extractsor de Texto PDF](https://elysiatools.com/es/tools/pdf-text-extractor): Extrae contenido de texto de documentos PDF con soporte para selección de páginas, opciones de formato y procesamiento multiidioma
- [PDF a Excel](https://elysiatools.com/es/tools/pdf-to-excel): Extrae datos tabulares de archivos PDF y los convierte a hojas de cálculo Excel con opciones de análisis personalizables
- [PDF a PowerPoint](https://elysiatools.com/es/tools/pdf-to-powerpoint): Extrae el contenido de texto de archivos PDF y lo convierte a diapositivas de presentación PowerPoint
- [PDF a Texto Avanzado](https://elysiatools.com/es/tools/pdf-to-text-advanced): Conversor avanzado de PDF a texto con selección de páginas, opciones de formato y extracción de metadatos
- [Analizador de PDF con formulas y graficos](https://elysiatools.com/es/tools/formula-chart-heavy-pdf-analyzer): Compara la extraccion local e hybrid de OpenDataLoader para identificar paginas que requieren ayuda de IA
- [Eliminador de ruido de encabezado y pie PDF](https://elysiatools.com/es/tools/pdf-header-footer-noise-remover): Compara la extraccion con y sin encabezados/pies para detectar ruido repetido en el texto

## Ejemplos

- [Muestras PDF](https://elysiatools.com/es/samples/pdf-samples): Muestras PDF generadas por herramientas 2026-02-01 a 2026-02-10
- [Ejemplos de Presentaciones Markdown](https://elysiatools.com/es/samples/md-slide-deck-to-pdf): Mazos Markdown estilo Remark/Marp para probar la exportacion a PDF
- [Ejemplos de Extractor de Números de Teléfono](https://elysiatools.com/es/samples/phone-number-extractor): Colección de texto mixto que contiene números de teléfono de varios países para pruebas de extracción
- [Muestras de Números y Monedas](https://elysiatools.com/es/samples/number-currency-samples): Texto que contiene varios formatos de números y monedas para probar la extracción de moneda
