Сначала определите проверяемый результат
Этот процесс помогает получить контролируемые сигналы из обычного текста, HTML, Markdown или журналов. До запуска инструмента сохраните источник и определите поля, формат, правило дубликатов и контекст, который понадобится проверяющему. Небольшой набор положительных и отрицательных примеров лучше подходит для приемки, чем расплывчатое требование извлечь все.
Начните широко, затем учитывайте формат источника
Используйте text-extractor, если набор полей еще не определен. Если требуется именно список URL, bulk-url-extractor задает более узкую границу. Не превращайте HTML в обычный текст до решения, входят ли атрибуты или источники изображений в результат: сначала примените html-attribute-extractor или image-source-extractor, затем new-html-tag-stripper для читаемой производной. В Markdown markdown-link-extractor сохраняет синтаксические сведения, которые могут исчезнуть в простом тексте.
Оставляйте доказательство из журнала рядом с совпадением
ip-address-extractor и date-extractor дают поля-кандидаты, но результат можно проверить только вместе с исходной строкой, соседним событием и предположением о часовом поясе. Сравните количество и характерные значения с примером. Найденный IP остается извлеченным значением, а не выводом о личности; дата также не становится автоматически деловым событием.
Сделайте чувствительные поля отдельным шлюзом передачи
Если во входе могут быть контактные или сетевые идентификаторы, до использования bulk-email-extractor, phone-number-extractor или ip-address-extractor определите разрешение и минимальный объем. Ограничьте доступ к исходным значениям, зафиксируйте переданные поля и строки и при необходимости замаскируйте или псевдонимизируйте копию. Принимайте результат только если целевые поля присутствуют, неожиданные совпадения объяснены, контекст сохранен, а артефакт соответствует правилам обработки.