Text absichtlich brechen, nicht versehentlich
Schmutziger Text hält sich an seinen eigenen Zeitplan. Das Formular, das ein Einfügen aus der Tabellenkalkulation übersteht, die OCR-Ausgabe mit einem verlorenen Buchstaben in jedem dritten Wort, das Support-Ticket mit Zeilen in falscher Reihenfolge — Pipelines treffen irgendwann auf all das. Dieser Workflow läuft absichtlich in die Gegenrichtung: Er nimmt sauberen Text, den Sie kontrollieren, und beschädigt ihn in den Formen, die Sie wählen, damit ein Parser, ein Korrektor oder ein Leseexperiment an dokumentiertem statt an zufälligem Schaden gemessen wird. Der Unterschied zum sinnlosen Verstümmeln einer Datei im Editor ist die Reproduzierbarkeit — eine Korruption, die sich neu erzeugen lässt, ist ein Test-Asset; eine, die das nicht hergibt, ist nur eine kaputte Datei.
Sätze vor Wörtern, Wörter vor Zeichen
Arbeiten Sie vom groben zum feinen Korn. Satzwerkzeuge formen die Struktur um — filtern Sie den Korpus auf die Sätze, die das Experiment wirklich braucht, entfernen Sie diejenigen, die Störung in das Material tragen, duplizieren Sie Sätze für ein Vorher-Nachher Seite an Seite und spiegeln Sie Sätze für Spiegelmaterial. Wortwerkzeuge stören danach Wortschatz und Reihenfolge, ohne die Struktur anzutasten — filtern Sie, welche Wörter der Parser aushalten muss, duplizieren Sie Wörter, um die Behandlung von Wiederholungen zu üben, spiegeln Sie Wörter für Palindrom-Material und tauschen Sie benachbarte Wortpaare, um die Syntax zu verbiegen und dabei jedes Wort zu behalten. Zeichenebene-Rauschen kommt zuletzt und ahmt die physische Welt nach — eingefügte Buchstaben stehen für danebengegriffene Tasten, entfernte für verlorene Striche und gesäuberte Symbole für Scanner-Schmutz. Ebenen zu überspringen erzeugt lauten, aber sinnlosen Schaden; ein Material, das zweimal gemischt und mit zufälligen Symbolen übersät ist, prüft nichts Bestimmtes.
Zufällig heißt nicht verantwortungslos
Die Zufallswerkzeuge streuen zwischen Läufen, und genau das ist ihr Sinn — aber die Größenordnung muss beschreibbar bleiben. Einfüger sollen die Zeichen- oder Wortzahl um einen vorab genannten Betrag vergrößern, Entferner sie um ebenso viel verkleinern, und ein Mix soll die Reihenfolge ändern und sonst nichts. Notieren Sie die Einstellungen jedes Durchgangs, und wenn ein Test stabiles Material braucht, erzeugen Sie die beschädigte Kopie einmal und archivieren sie neben dem Original, statt sie bei jedem Lauf neu zu erzeugen. Das verbündete Werkzeug dafür ist der Diff — der Vergleich der mutierten Ausgabe mit dem unangetasteten Archiv macht aus „ich hab es kaputt gemacht“ die Aussage „hier ist genau das kaputt, absichtlich und in dieser Stärke“.
Wo dieser Workflow endet
Die Operationen hier ändern Inhalt und Reihenfolge, nie Sauberkeit — leere Zeilen entfernen, eine Liste sortieren oder Werte in Anführungszeichen hüllen gehört zu den Workflows für Listenbereinigung und für Präfix-, Suffix- und Symbolhüllung, die Text bereiten statt ihn zu beschädigen. Die Statistik, die das Ergebnis beschreibt — Wort-, Zeichen- und Musterhäufigkeiten —, kommt aus dem Textanalyse-Workflow, der Diff selbst aus dem Datei- und Datenvergleichs-Workflow. Zeichenforensik bei verdächtigem Unicode gehört zum Emoji- und Zeichen-Debugging-Workflow. Wahren Sie diese Grenzen, dann bleibt diese Seite das eine: die gezielte, dokumentierte Korruption eines Textes, der sauber begann.