# Extracteur de formules PDF (LaTeX / MathML / MathJax, numérotation AMS conservée)

Détecte et reconstruit les formules mathématiques intégrées aux PDF vectoriels : identifie les polices mathématiques (CMMI/CMSY/CMEX, STIX, Cambria Math) et les symboles Unicode, restitue exposants/indices et fractions empilées, conserve la numérotation AMS (y compris les sous-numéros (2a)/(2b)) et produit du LaTeX copiable, du MathML de présentation (compatible MathJax/KaTeX) et un paquet .tex téléchargeable.

> Page canonique: https://elysiatools.com/fr/tools/pdf-latex-mathml-mathjax-formula-extractor-and-equation-number-preserver

- **Catégorie:** Document Tools

- **Mots-clés:** extraction formules pdf, latex depuis pdf, numérotation équations, numérotation AMS, mathml, mathjax, katex, polices cmmi, sous-équations, flux académique, alternative ocr formules

## Présentation

Principe : dans les PDF issus de LaTeX, les formules sont codées comme des séquences de texte en polices mathématiques dédiées (italique CMMI, symboles CMSY/CMEX, MSAM/MSBM) ; l'outil lit les vrais noms de polices via la liste d'opérateurs pdf.js (avec retrait du préfixe de sous-ensemble), combine blocs Unicode mathématiques, décalages de ligne de base (exposants/indices) et paires de lignes alignées verticalement (fractions) ; les numéros (N)/(Na) en marge droite sont conservés selon equation/subequations d'amsmath. Chaque LaTeX est validé par temml et produit du MathML de présentation (MathJax v3 accepte MathML directement). Limites : les PDF scannés sans couche texte sont rejetés (OCR préalable nécessaire) ; matrices complexes et environnements multilignes en reconstruction au mieux.

## Entrées

- **Fichier PDF** (file)
- **Portée des formules** (select)
- **Pages max à analyser** (number)
- **Rendre l'aperçu MathML** (checkbox)
- **Générer le paquet .tex** (checkbox)

## Quand l'utiliser

- Vous devez récupérer le code source LaTeX d'équations publiées dans un article de recherche au format PDF.
- Vous souhaitez convertir des formules PDF vers du MathML de présentation pour les intégrer sur le web via MathJax ou KaTeX.
- Vous devez archiver ou réutiliser des séries d'équations numérotées en conservant la structure des sous-équations (2a, 2b) du package amsmath.

## Fonctionnement

- L'outil analyse les flux d'instructions du PDF vectoriel pour identifier les polices mathématiques dédiées, les symboles Unicode et les décalages de ligne de base.
- Il reconstruit les structures d'équations (fractions empilées, exposants, indices) et repère les numéros d'équations placés dans la marge droite.
- Chaque expression LaTeX générée est validée avec Temml afin de produire le MathML de présentation correspondant.
- L'interface affiche les formules détectées, propose un aperçu interactif et prépare un paquet d'équations .tex téléchargeable selon la portée sélectionnée.

## Cas d'usage

- Extraction de blocs d'équations complexes depuis des prépublications arXiv pour les intégrer dans un nouveau manuscrit.
- Conversion de publications scientifiques PDF en pages HTML accessibles enrichies en MathML.
- Récupération de modèles théoriques et de systèmes d'équations chiffrés pour alimenter des notebooks Jupyter ou des calculatrices formelles.

## Questions fréquentes

### L'outil fonctionne-t-il sur les PDF scannés ou sous forme d'images ?

Non, l'outil nécessite une couche de texte vectorielle pour lire les polices mathématiques. Les documents scannés doivent d'abord subir un traitement OCR.

### Comment les sous-numéros d'équations comme (1a) et (1b) sont-ils traités ?

L'analyseur repère les étiquettes en marge droite et préserve la hiérarchie du bloc subequations d'amsmath dans le résultat LaTeX.

### Quelles polices mathématiques sont automatiquement reconnues ?

Il identifie les polices TeX standard (CMMI, CMSY, CMEX, MSAM, MSBM) ainsi que STIX, Cambria Math et les glyphes du bloc mathématique Unicode.

### Quelle est la différence entre les options de portée (scope) ?

L'option « display » extrait uniquement les équations hors texte centrées, « numbered » cible celles avec un numéro, et « all » inclut également les fragments mathématiques en ligne.

### Le MathML produit est-il directement intégrable dans un navigateur ?

Oui, le MathML de présentation généré est standard et compatible avec les moteurs de rendu web modernes ainsi que les bibliothèques MathJax v3 et KaTeX.

## Outils associés

- [Pont PDF (OCR) vers JSON structuré](https://elysiatools.com/fr/tools/ocr-pdf-to-structured-json-bridge): Extrait la couche texte du PDF avec la géométrie (lignes par position y, tableaux par écarts de colonnes, titres par taille de police, paires clé-valeur à deux-points) puis remplit champ par champ un JSON Schema fourni — libellés appariés par clés normalisées, valeurs coercées vers les types déclarés et validées par ajv.
- [Conversion PDF/A](https://elysiatools.com/fr/tools/pdf-a-convert): Convertit les PDF en un profil PDF/A autodéclaré sans dépendance externe
- [PDF Text Extractor](https://elysiatools.com/fr/tools/pdf-text-extractor): Extract text content from PDF documents with support for page selection, formatting options, and multi-language processing
- [PDF vers Excel](https://elysiatools.com/fr/tools/pdf-to-excel): Extrait les données tabulaires des fichiers PDF et les convertit en feuilles de calcul Excel avec des options d'analyse personnalisables
- [PDF vers PowerPoint](https://elysiatools.com/fr/tools/pdf-to-powerpoint): Extrait le contenu textuel des fichiers PDF et le convertit en diapositives de présentation PowerPoint
- [PDF vers Texte Avancé](https://elysiatools.com/fr/tools/pdf-to-text-advanced): Convertisseur PDF vers texte avancé avec sélection de pages, options de format et extraction de métadonnées
- [Analyseur de PDF riches en formules et graphiques](https://elysiatools.com/fr/tools/formula-chart-heavy-pdf-analyzer): Compare lextraction locale et hybrid dOpenDataLoader afin didentifier les pages qui meritent une aide IA
- [Nettoyeur de bruit den-tete/pied PDF](https://elysiatools.com/fr/tools/pdf-header-footer-noise-remover): Compare lextraction avec et sans en-tetes/pieds pour reperer le bruit repetitif dans le texte

## Exemples

- [Exemples PDF](https://elysiatools.com/fr/samples/pdf-samples): Exemples PDF generes par les outils du 2026-02-01 au 2026-02-10
- [Exemples de Slides Markdown](https://elysiatools.com/fr/samples/md-slide-deck-to-pdf): Presentations Markdown style Remark/Marp pour tester l export PDF
- [Exemples d'Extracteur de Numéros de Téléphone](https://elysiatools.com/fr/samples/phone-number-extractor): Collection de texte mixte contenant des numéros de téléphone de divers pays pour les tests d'extraction
- [Échantillons de Nombres et Devises](https://elysiatools.com/fr/samples/number-currency-samples): Texte contenant divers formats de nombres et de devises pour tester l'extraction de devises
