Define primero el resultado de extracción
Este flujo está pensado para obtener señales comprobables desde texto bruto, HTML, Markdown o logs. Antes de abrir una herramienta, conserva la fuente y define los campos, el formato, la regla de duplicados y el contexto que verá el revisor. Una pequeña muestra de casos positivos y negativos es una mejor base de aceptación que pedir que se extraiga todo.
Empieza de forma amplia y respeta el formato
Usa text-extractor cuando los campos todavía no están decididos. Si ya sabes que necesitas una colección de URLs, bulk-url-extractor fija un límite más claro. No conviertas HTML en texto plano antes de decidir si los atributos o las fuentes de imagen son parte del resultado: usa primero html-attribute-extractor o image-source-extractor, y después new-html-tag-stripper para una derivación legible. En Markdown, markdown-link-extractor conserva información de la sintaxis que el texto plano puede ocultar.
Mantén la evidencia del log junto a la coincidencia
ip-address-extractor y date-extractor dan campos candidatos, pero el resultado solo se puede revisar si conserva la línea original, el evento cercano y la zona horaria asumida. Compara cantidades y valores representativos con la muestra. Una IP coincidente sigue siendo un valor extraído, no una conclusión sobre identidad, y una fecha no es automáticamente un evento de negocio.
Convierte los campos sensibles en una puerta de entrega
Si la entrada puede contener identificadores de contacto o de red, define autorización y alcance mínimo antes de usar bulk-email-extractor, phone-number-extractor o ip-address-extractor. Limita el acceso a los valores brutos, registra qué campos y filas se entregan y enmascara o seudonimiza la copia de entrega cuando sea necesario. Acepta el resultado solo cuando los campos esperados estén presentes, las coincidencias inesperadas tengan explicación, el contexto se conserve y el artefacto cumpla la política de manejo.