# PDF-Lesereihenfolge-Debugger

Vergleicht rohe PDF-Zeichenreihenfolge mit XY-Cut++, um Probleme in komplexen Layouts zu finden

> Kanonische Seite: https://elysiatools.com/de/tools/pdf-reading-order-debugger

- **Kategorie:** Developer Tools

- **Schlagwörter:** pdf, reading order, xycut

## Überblick

Laden Sie ein PDF hoch. Das Tool fuehrt OpenDataLoader mit `readingOrder=off` und `readingOrder=xycut` aus und erstellt einen Seitenvergleich. Das ist besonders hilfreich bei mehrspaltigen Berichten, Broschueren und komplexen Layouts.

## Eingaben

- **PDF-Datei** (file)
- **Strukturbaum verwenden** (checkbox)
- **Header/Footer einbeziehen** (checkbox)
- **Seiten** (text): e.g. 1,3,5-7

## Wann verwenden

- Wenn Text aus mehrspaltigen PDF-Dokumenten in der falschen logischen Reihenfolge extrahiert wird.
- Zur Validierung, ob der XY-Cut++ Algorithmus die Lesbarkeit komplexer Layouts im Vergleich zur Standard-Extraktion verbessert.
- Bei der Fehlersuche in automatisierten Datenextraktions-Pipelines für Broschüren, Fachzeitschriften oder Geschäftsberichte.

## Funktionsweise

- Laden Sie das gewünschte PDF-Dokument hoch und geben Sie optional den zu prüfenden Seitenbereich an.
- Das Tool führt zwei parallele Extraktionen durch: eine basierend auf der rohen Zeichenreihenfolge und eine mit aktiviertem XY-Cut++ Layout-Parsing.
- Die Ergebnisse werden pro Seite verglichen, um Abweichungen in der Textabfolge und potenzielle Strukturfehler zu ermitteln.
- Sie erhalten einen detaillierten HTML-Bericht, der die Unterschiede visualisiert und zeigt, welche Methode die logische Struktur besser erhält.

## Anwendungsfälle

- Analyse von wissenschaftlichen Papieren mit zweispaltigem Layout zur Sicherstellung der korrekten Zitations- und Textreihenfolge.
- Überprüfung von Geschäftsberichten mit komplexen Infografiken, Randnotizen und Textumfluss.
- Debugging von digitalen PDFs vor der Einspeisung in Large Language Models (LLMs) oder Datenbanken zur Vermeidung von Kontextverlust.

## Häufig gestellte Fragen

### Was ist XY-Cut++?

Ein Algorithmus zur Layout-Analyse, der Textblöcke in komplexen Dokumenten erkennt und in die korrekte logische Lesereihenfolge bringt.

### Warum ist die rohe Zeichenreihenfolge oft fehlerhaft?

PDFs speichern Text oft in der Reihenfolge der Erstellung, nicht der visuellen Position, was besonders bei Spalten zu vermischten Texten führt.

### Kann ich Kopf- und Fußzeilen vom Vergleich ausschließen?

Ja, über die Option 'Header/Footer einbeziehen' können Sie steuern, ob diese Bereiche in die Analyse einfließen sollen.

### Was bewirkt die Option 'Strukturbaum verwenden'?

Sie nutzt vorhandene Metadaten (Tagged PDF), um die logische Struktur des Dokuments für den Vergleich heranzuziehen.

### Welche Dateiformate werden unterstützt?

Dieses Tool ist ausschließlich für die Analyse von PDF-Dateien konzipiert.

## Ähnliche Tools

- [PDF-Analysator fuer formel- und grafiklastige Dateien](https://elysiatools.com/de/tools/formula-chart-heavy-pdf-analyzer): Vergleicht lokale und Hybrid-Extraktion von OpenDataLoader, um Seiten mit sinnvoller KI-Unterstuetzung zu finden
- [PDF-Header-Footer-Rauschfilter](https://elysiatools.com/de/tools/pdf-header-footer-noise-remover): Vergleicht Extraktion mit und ohne Header/Footer, um wiederkehrendes Textrauschen zu erkennen
- [Tagged-PDF-Inspektor](https://elysiatools.com/de/tools/tagged-pdf-inspector): Vergleicht Extraktion mit und ohne StructTree, um nuetzliche Tagged-Struktur im PDF zu erkennen
- [PDF-zu-JSON-Struktur-Explorer](https://elysiatools.com/de/tools/pdf-to-json-structure-explorer): Extrahiert OpenDataLoader-JSON aus einem PDF und zeigt Ueberschriften, Absaetze, Tabellen, Listen und Bounding Boxes
- [OCR-PDF-zu-strukturiertes-JSON-Brücke](https://elysiatools.com/de/tools/ocr-pdf-to-structured-json-bridge): Extrahiert die PDF-Textebene mit Geometrie (Zeilen nach y-Position, Tabellen nach Spaltenlücken, Überschriften nach Schriftgröße, Doppelpunkt-Schlüsselwerte) und füllt Feld für Feld ein benutzerdefiniertes JSON Schema — Labels werden über normalisierte Schlüssel gepaart, Werte zu deklarierten Typen konvertiert und mit ajv validiert.
- [PDF-Prompt-Injection-Scanner](https://elysiatools.com/de/tools/pdf-prompt-injection-scanner): Vergleicht sichere und unsichere Extraktion, um versteckten Text, Off-Page-Inhalte und andere PDF-Risiken zu erkennen
- [PDF zu Markdown Konverter](https://elysiatools.com/de/tools/pdf-to-markdown): Konvertiert PDF-Dokumente in Markdown-Format mit Textextraktion und Formatierungserhaltung
- [PDF zu Text Erweitert](https://elysiatools.com/de/tools/pdf-to-text-advanced): Erweiterter PDF-zu-Text-Konverter mit Seitenauswahl, Formatierungsoptionen und Metadatenextraktion

## Beispiele

- [PDF-Beispiele](https://elysiatools.com/de/samples/pdf-samples): Generierte PDF-Beispiele von Tools zwischen 2026-02-01 und 2026-02-10
- [Markdown Foliensatz Beispiele](https://elysiatools.com/de/samples/md-slide-deck-to-pdf): Remark/Marp Markdown Decks zum Testen des PDF Exports
- [ICS-Beispiele fuer den Zeitzonen-Workflow-Planer](https://elysiatools.com/de/samples/time-zone-workflow-scheduler-ics-samples): ICS-Dateien im gleichen Rueckgabeformat wie beim Time Zone Workflow Scheduler, mit mehreren VEVENT-Meetingkandidaten
- [OFD-Beispiele](https://elysiatools.com/de/samples/ofd-samples): OFD-Beispiele fur Tests mit GB/T 33190 Fixed-Layout-Dokumenten

## Verwandte Inhalte

- [PDF-Extraktion und Debugging-Workflows](https://elysiatools.com/de/hubs/pdf-extraction-debugging-workflows): Debuggen Sie schwierige PDF-Extraktion mit Verschlusselung, Sicherheit, Seitenbereich, Lesereihenfolge, OCR, Tabellen und Struktur.
