Defina primeiro o resultado da extração
Este fluxo serve para obter sinais verificáveis de texto bruto, HTML, Markdown ou logs. Antes de abrir uma ferramenta, preserve a fonte e defina campos, formato, regra de duplicatas e o contexto que o revisor precisará. Uma amostra pequena de casos positivos e negativos é uma base de aceitação melhor do que pedir uma extração indiscriminada.
Comece amplo e respeite o formato da fonte
Use text-extractor quando os campos ainda não estiverem definidos. Se a tarefa já for coletar URLs, bulk-url-extractor estabelece um limite mais claro. Não transforme HTML em texto antes de decidir se atributos ou fontes de imagem fazem parte do resultado: use primeiro html-attribute-extractor ou image-source-extractor, depois new-html-tag-stripper para uma derivação legível. No Markdown, markdown-link-extractor preserva informações de sintaxe que o texto simples pode esconder.
Mantenha a evidência do log junto da correspondência
ip-address-extractor e date-extractor fornecem campos candidatos, mas o resultado só é revisável se a linha original, o evento próximo e a suposição de fuso forem preservados. Compare quantidades e valores representativos com a amostra. Um IP encontrado continua sendo um valor extraído, não uma conclusão de identidade, e uma data não é automaticamente um evento de negócio.
Trate campos sensíveis como uma barreira de entrega
Se a entrada puder conter identificadores de contato ou rede, defina autorização e escopo mínimo antes de usar bulk-email-extractor, phone-number-extractor ou ip-address-extractor. Limite o acesso aos valores brutos, registre quais campos e linhas foram entregues e mascare ou pseudonimize a cópia de entrega quando necessário. Aceite o resultado somente quando os campos esperados estiverem presentes, correspondências inesperadas forem explicadas, o contexto for preservado e o artefato seguir a política de tratamento.