可描述的手术还是随机噪声?
句级与词级工具以可审阅、可解释的方式改变文本,适合语料准备与阅读实验;随机注入工具制造不可预测的损伤,适合健壮性测试——按测试要证明什么来选。
Elysia Tools
导航
Workflow Playbook
把干净的文本按计划弄坏——按句和词过滤、复制、反转,注入随机字母与符号,乱序整行整词,并证明每一次变形都在掌控之内,服务于解析器压力测试、OCR 校对演练与语言学实验。
专题
脏文本从不缺席。从表格粘贴后仍然活着的表单、每第三个词丢一个字母的 OCR 输出、行序错乱的支持工单——管线迟早要面对这一切。本工作流反其道而行:拿一份你可控的干净文本,按你选定的方式损坏它,让解析器、校对器或阅读实验在有名有据的损伤面前接受检验,而不是在事故面前碰运气。它与在编辑器里随手搅烂一个文件的区别在于可复现性——能重新生成的损坏才是测试资产,不能重新生成的只是一个坏文件。
从粗粒度往细粒度走。句级工具重塑结构——把语料过滤到实验真正需要的句子,删除那些把干扰带进素材的句子,复制句子让前后对照并排可见,反转句子构造镜像测试材料。词级工具随后扰乱词汇与顺序而不动结构——筛出解析器必须承受的词,复制单词以锻炼重复处理,反转单词构造回文式素材,交换相邻词对让句法弯曲而词汇分毫未损。字符级噪声最后登场,负责模仿物理世界——插入的字母顶替误触打字,删除的字母顶替丢笔,清除的杂散符号顶替扫描残渣。跳层操作只会制造响亮而无意义的损伤:一份同时被乱序两遍又撒满随机符号的素材,什么也检验不了。
随机工具每次运行都有差异,这正是它的用意——但幅度必须始终可描述。插入工具应让字符数或词数增长你事先报出的量,删除工具应让它相应缩减,乱序工具只改顺序、不改其他。每一轮参数都要记下;当测试需要稳定素材时,把损坏副本生成一次并与原件一起存档,而不是每次运行重新生成。这一切的搭档是差异对照——把损坏输出与完好存档一比,“我把它弄坏了”就变成了“这里精确地坏了我计划的这些,强度是这一档”。
这里的操作改变内容与顺序,从不负责整洁——删空行、排序、给值加引号属于列表清理与前后缀包裹工作流,它们是在准备文本而不是损坏文本。描述结果的统计量——词数、字符数、模式频次——来自文本分析工作流,差异对照本身来自文件与数据比较工作流。可疑 Unicode 的字符级取证则属于 emoji 与字符调试工作流。守住这些边界,本页就始终是一件事:把本来干净的文本,有计划、有记录地损坏掉。
工作流指南
把语料收窄到实验真正需要的句子,删掉引入干扰的句子,复制句子以便并排对照,反转句子以构造镜像测试素材。
过滤出解析器必须承受的词汇,复制单词以测试重复处理,反转单词构造回文式素材,交换相邻词对以在不丢词的前提下打乱语序。
在词内插入随机字母、在随机位置插入随机词来模拟误触与填充损伤,删除随机字母来模拟丢字,清除杂散符号来近似扫描残渣。
按行、词或字符乱序文本以检验顺序不敏感性,随后记录所用参数,让同样的损伤可以重新生成,变形始终是测试资产而不是事故。
句级与词级工具以可审阅、可解释的方式改变文本,适合语料准备与阅读实验;随机注入工具制造不可预测的损伤,适合健壮性测试——按测试要证明什么来选。
句级变形重塑结构,词级变形扰乱词汇与顺序,字符级注入模仿打字与扫描差错——多数压力测试组合其中两层,而不是三层同时上。
过滤与删除工具会丢内容,适合验证管线能否扛住缺失;复制、反转与乱序工具不丢任何内容,只改顺序或镜像——当差异必须可解释时选无损。