Définir d’abord le résultat à vérifier
Ce parcours sert à obtenir des signaux contrôlables à partir de texte brut, HTML, Markdown ou journaux. Avant d’ouvrir un outil, conservez la source et définissez les champs, le format, la règle des doublons et le contexte nécessaire au relecteur. Quelques cas positifs et négatifs représentatifs forment une meilleure base d’acceptation qu’une demande vague d’extraire tout le contenu.
Commencer large, puis respecter le format source
Utilisez text-extractor lorsque les champs ne sont pas encore arrêtés. Si vous savez déjà qu’il faut collecter des URL, bulk-url-extractor fixe une limite plus claire. Ne transformez pas le HTML en texte avant de décider si les attributs ou les sources d’image font partie du résultat : utilisez d’abord html-attribute-extractor ou image-source-extractor, puis new-html-tag-stripper pour une version lisible. Dans Markdown, markdown-link-extractor conserve des informations de syntaxe que le texte seul peut masquer.
Garder la preuve du journal avec la correspondance
ip-address-extractor et date-extractor fournissent des champs candidats, mais le résultat n’est vérifiable que si la ligne d’origine, l’événement voisin et l’hypothèse de fuseau sont conservés. Comparez les quantités et les valeurs représentatives à l’exemple. Une IP trouvée reste une valeur extraite, pas une conclusion d’identité, et une date n’est pas automatiquement un événement métier.
Faire des champs sensibles une étape de contrôle de livraison
Si l’entrée peut contenir des identifiants de contact ou de réseau, définissez l’autorisation et le périmètre minimal avant d’utiliser bulk-email-extractor, phone-number-extractor ou ip-address-extractor. Limitez l’accès aux valeurs brutes, notez les champs et lignes livrés et masquez ou pseudonymisez la copie de livraison si nécessaire. Acceptez le résultat seulement lorsque les champs attendus sont présents, les correspondances inattendues sont expliquées, le contexte est préservé et l’artefact respecte la règle de traitement.