Commencer par la forme de la source
L'extraction semi-structuree echoue quand tout est traite comme un simple CSV. Un rapport a largeur fixe, un export avec separateurs melanges, un tableau Markdown et une trace logfmt exigent des premiers gestes differents. Utilisez fixed-width-column-parser, messy-text-to-structured-data-workbench ou structured-log-analyzer pour classer la source et garder quelques lignes representatives.
Normaliser avant de faire confiance
Le flux le plus sur separe nettoyage et conversion. Avec text-pipeline-builder, vous rognez les espaces, retirez les en-tetes repetes, standardisez les separateurs et rendez les transformations reproductibles. Cela evite qu'une correction manuelle cache la regle exacte qui a change les donnees.
Convertir selon la destination
Une fois le texte stable, choisissez le format avec intention. text-to-csv et text-to-excel servent les analystes, text-to-json les API ou jeux d'essai, et text-to-xml les echanges structures. Pour les tableaux existants, markdown-to-csv et html-table-to-csv conservent les cellules au lieu de les deviner depuis du texte brut.
Terminer par les anomalies
Les logs et les lignes cassees meritent une passe dediee. log-parser, logfmt-to-json-structured-log-bridge et structured-log-analyzer gardent les champs coherents; csv-malformed-row-surgeon intervient quand longueurs ou guillemets cassent l'import. La livraison doit mentionner hypotheses, volumes, reparations et exceptions.