# PDF-Formel-Extraktor (LaTeX / MathML / MathJax, AMS-Nummerierung bleibt erhalten)

Erkennt und rekonstruiert eingebettete Formeln aus vektorbasierten PDFs: identifiziert Mathematik-Fonts (CMMI/CMSY/CMEX, STIX, Cambria Math) und Unicode-Symbole, stellt Ober-/Unterindizes und gestapelte Brüche wieder her, bewahrt die AMS-Nummerierung (inkl. Unternummern (2a)/(2b)) und liefert kopierbares LaTeX, Presentation-MathML (MathJax/KaTeX-kompatibel) und ein herunterladbares .tex-Paket.

> Kanonische Seite: https://elysiatools.com/de/tools/pdf-latex-mathml-mathjax-formula-extractor-and-equation-number-preserver

- **Kategorie:** Document Tools

- **Schlagwörter:** PDF-Formel-Extraktion, LaTeX aus PDF, Gleichungsnummerierung, AMS-Nummerierung, MathML, MathJax, KaTeX, CMMI-Fonts, Subgleichungen, akademischer Workflow, Formel-OCR-Alternative

## Überblick

Prinzip: In LaTeX-PDFs sind Formeln als Textläufe in eigenen Mathe-Fonts kodiert (CMMI-Kursiv, CMSY/CMEX-Symbole, MSAM/MSBM); das Tool liest die echten Fontnamen über die pdf.js-Operatorliste (mit Entfernen des Subset-Präfixes), kombiniert mathematische Unicode-Blöcke, Baseline-Versätze (Indizes) und vertikal ausgerichtete Zeilenpaare (Brüche); die (N)/(Na)-Nummern am rechten Rand bleiben gemäß amsmath equation/subequations erhalten. Jedes LaTeX wird per temml validiert und erzeugt Presentation-MathML (MathJax v3 nimmt MathML direkt an). Grenzen: gescannte PDFs ohne Textebene werden abgelehnt (vorher OCR nötig); komplexe Matrizen und mehrzeilige Umgebungen sind Best-Effort.

## Eingaben

- **PDF-Datei** (file)
- **Formelumfang** (select)
- **Max. zu scannende Seiten** (number)
- **MathML-Vorschau rendern** (checkbox)
- **.tex-Paket erstellen** (checkbox)

## Wann verwenden

- Wenn mathematische Gleichungen aus wissenschaftlichen PDF-Artikeln zur Weiterverarbeitung in LaTeX oder Markdown kopiert werden müssen.
- Wenn mathematische Publikationen für Webplattformen mit MathJax oder KaTeX in Presentation-MathML konvertiert werden sollen.
- Wenn Formeln aus Dokumenten inklusive ihrer exakten AMS-Gleichungsnummern wie (1) oder (2a) digitalisiert werden müssen.

## Funktionsweise

- Das Dokument wird analysiert, um mathematische Schriftarten wie CMMI, CMSY, STIX oder Cambria Math sowie Unicode-Symbole auf der Textebene zu identifizieren.
- Vertikale Zeilenausrichtungen und Grundlinienversätze werden ausgewertet, um Brüche, Hochzahlen und Tiefstellungen präzise zu rekonstruieren.
- Gleichungsnummern am rechten Rand werden nach amsmath-Standard zugeordnet und mit temml auf syntaktische Gültigkeit geprüft.
- Die Ergebnisse werden als Presentation-MathML für die Vorschau formatiert und wahlweise als eigenständiges .tex-Paket bereitgestellt.

## Anwendungsfälle

- Extrahieren von Referenzformeln aus wissenschaftlichen Konferenzpapieren für eigene Publikationen.
- Übertragen von Gleichungen aus PDF-Skripten in webbasierte Lernsysteme via MathML.
- Archivieren und Sammeln von mathematischen Modellen aus Fachaufsätzen in einem sauberen .tex-Paket.

## Häufig gestellte Fragen

### Können Formeln aus eingescannten PDF-Dokumenten extrahiert werden?

Nein, rein bildbasierte Scans ohne eingebettete Vektor-Textebene werden abgelehnt und erfordern vorab eine OCR-Texterkennung.

### Welche mathematischen Formate unterstützt die Ausgabe?

Die extrahierten Formeln werden als LaTeX-Code, als Presentation-MathML für MathJax/KaTeX und optional als herunterladbares .tex-Paket ausgegeben.

### Wie wird die Gleichungsnummerierung verarbeitet?

Gleichungsnummern am rechten Rand werden erkannt und im LaTeX-Format inklusive Unternummern wie (2a) oder (2b) beibehalten.

### Worin liegt der Unterschied zwischen den Formelumfang-Optionen?

Sie können festlegen, ob nur abgesetzte Display-Gleichungen, alle Formeln inklusive Inline-Mathematik oder ausschließlich nummerierte Gleichungen erfasst werden.

### Gibt es eine Begrenzung der verarbeitbaren Seitenzahl?

Über die Einstellung für maximale Seiten lässt sich der Scanbereich flexibel zwischen 1 und 200 Seiten festlegen.

## Ähnliche Tools

- [OCR-PDF-zu-strukturiertes-JSON-Brücke](https://elysiatools.com/de/tools/ocr-pdf-to-structured-json-bridge): Extrahiert die PDF-Textebene mit Geometrie (Zeilen nach y-Position, Tabellen nach Spaltenlücken, Überschriften nach Schriftgröße, Doppelpunkt-Schlüsselwerte) und füllt Feld für Feld ein benutzerdefiniertes JSON Schema — Labels werden über normalisierte Schlüssel gepaart, Werte zu deklarierten Typen konvertiert und mit ajv validiert.
- [PDF/A-Konvertierung](https://elysiatools.com/de/tools/pdf-a-convert): Konvertiert PDFs in ein selbsterklärtes PDF/A-Profil ohne externe Abhängigkeiten
- [PDF Text Extractor](https://elysiatools.com/de/tools/pdf-text-extractor): Extract text content from PDF documents with support for page selection, formatting options, and multi-language processing
- [PDF zu Excel](https://elysiatools.com/de/tools/pdf-to-excel): Extrahiert Tabellendaten aus PDF-Dateien und konvertiert sie in Excel-Tabellenkalkulationen mit anpassbaren Parsing-Optionen
- [PDF zu PowerPoint](https://elysiatools.com/de/tools/pdf-to-powerpoint): Extrahiert Textinhalt aus PDF-Dateien und konvertiert ihn in PowerPoint-Präsentationsfolien
- [PDF zu Text Erweitert](https://elysiatools.com/de/tools/pdf-to-text-advanced): Erweiterter PDF-zu-Text-Konverter mit Seitenauswahl, Formatierungsoptionen und Metadatenextraktion
- [PDF-Analysator fuer formel- und grafiklastige Dateien](https://elysiatools.com/de/tools/formula-chart-heavy-pdf-analyzer): Vergleicht lokale und Hybrid-Extraktion von OpenDataLoader, um Seiten mit sinnvoller KI-Unterstuetzung zu finden
- [PDF-Header-Footer-Rauschfilter](https://elysiatools.com/de/tools/pdf-header-footer-noise-remover): Vergleicht Extraktion mit und ohne Header/Footer, um wiederkehrendes Textrauschen zu erkennen

## Beispiele

- [PDF-Beispiele](https://elysiatools.com/de/samples/pdf-samples): Generierte PDF-Beispiele von Tools zwischen 2026-02-01 und 2026-02-10
- [Markdown Foliensatz Beispiele](https://elysiatools.com/de/samples/md-slide-deck-to-pdf): Remark/Marp Markdown Decks zum Testen des PDF Exports
- [Telefonnummern-Extraktor Beispiele](https://elysiatools.com/de/samples/phone-number-extractor): Sammlung von gemischtem Text mit Telefonnummern aus verschiedenen Ländern für Extraktionstests
- [Zahlen- und Währungsmuster](https://elysiatools.com/de/samples/number-currency-samples): Text mit verschiedenen Zahlen- und Währungsformaten zum Testen der Währungsextraktion
