输入应按换行拆分,还是按自定义分隔符拆分?
一项一行的粘贴内容使用 text-splitter 的按行模式;逗号、分号或标记分隔的内容使用自定义分隔符。只有空部分代表真实分组或字段时,才开启保留空部分。
Elysia Tools
导航
Workflow Playbook
先定义行边界,再规范空白、删除重复项、筛选条目,并明确保留原顺序还是按规则排序,把粘贴或导出的文本整理成可复核清单。
专题
先定义行边界,再规范空白、删除重复项、筛选条目,并明确保留原顺序还是按规则排序,把粘贴或导出的文本整理成可复核清单。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
保存未修改的原文,并确认条目之间是换行、自定义分隔符,还是复制粘贴后混合形成的格式。
先决定是否区分大小写、行首尾空白是否属于条目,以及重复项保留首次出现还是最后出现。
确认空行是可删除的占位行还是有意义的分组分隔,再确定筛选条件和最终顺序。
决策点: 输入应按换行拆分,还是按自定义分隔符拆分?. 一项一行的粘贴内容使用 text-splitter 的按行模式;逗号、分号或标记分隔的内容使用自定义分隔符。只有空部分代表真实分组或字段时,才开启保留空部分。
决策点: 空白和空行是否可以改变?. 如果重复空格、制表符和行边缘空白只是噪声,用 whitespace-normalizer 统一它们。紧凑清单才使用 text-empty-lines-remover;空行表达章节时要保留,或另存一份带结构的结果。
决策点: 什么条件下算重复项?. 用 advanced-duplicate-line-remover 的全局模式并保留首次出现,得到稳定清单。编号、代码等大小写有意义的值使用区分大小写;只有大小写属于展示噪声时才关闭区分,不能把相似但不相同的行当成重复。
决策点: 最终清单应保留来源顺序还是重新排序?. 如果来源顺序代表优先级或时间,就不要重新排序。否则用 text-basic-sorter 选择字母、数字或长度排序,并记录方向;需要复现时不要使用随机打乱。
普通粘贴清单使用 text-splitter 的按行模式,紧凑分隔文本则指定自定义分隔符。保留原文并记录拆出的行数或部分数;只有空位置有意义时才保留空部分。 使用 text-splitter.
允许改变行内空白时,用 whitespace-normalizer 合并多余空格或制表符并修剪行边缘。要交付紧凑清单就再用 text-empty-lines-remover;如果空行表示分组,则保留结构或另存紧凑副本。 使用 whitespace-normalizer, text-empty-lines-remover.
用 advanced-duplicate-line-remover 的全局检测和 keep-first。根据数据契约设置是否区分大小写;已经完成规范化后,如果还要保留显示文本,就不要再次用 trimLines 改写行内容,并保存删除统计。 使用 advanced-duplicate-line-remover.
用 text-line-filter 按包含、完全匹配、前缀、后缀、正则、格式或非空条件筛选。明确大小写和空行匹配方式,并保存模式或正则,避免下次运行悄悄选出不同子集。 使用 text-line-filter.
顺序没有业务含义时,用 text-basic-sorter 选择字母、数字或长度排序并记录方向。关闭 removeDuplicates 和 trimLines,避免重复执行已决定的规则;不要使用 shuffle。若顺序有意义,就直接保留筛选结果。 使用 text-basic-sorter.
Alpha 和 alpha 会被视为重复吗? 只有关闭区分大小写时才会视为重复。编号、代码和大小写有语义的值应区分大小写;大小写只是展示差异时,才适合使用不区分大小写的匹配。工作流指南
普通粘贴清单使用 text-splitter 的按行模式,紧凑分隔文本则指定自定义分隔符。保留原文并记录拆出的行数或部分数;只有空位置有意义时才保留空部分。
允许改变行内空白时,用 whitespace-normalizer 合并多余空格或制表符并修剪行边缘。要交付紧凑清单就再用 text-empty-lines-remover;如果空行表示分组,则保留结构或另存紧凑副本。
用 advanced-duplicate-line-remover 的全局检测和 keep-first。根据数据契约设置是否区分大小写;已经完成规范化后,如果还要保留显示文本,就不要再次用 trimLines 改写行内容,并保存删除统计。
用 text-line-filter 按包含、完全匹配、前缀、后缀、正则、格式或非空条件筛选。明确大小写和空行匹配方式,并保存模式或正则,避免下次运行悄悄选出不同子集。
顺序没有业务含义时,用 text-basic-sorter 选择字母、数字或长度排序并记录方向。关闭 removeDuplicates 和 trimLines,避免重复执行已决定的规则;不要使用 shuffle。若顺序有意义,就直接保留筛选结果。
一项一行的粘贴内容使用 text-splitter 的按行模式;逗号、分号或标记分隔的内容使用自定义分隔符。只有空部分代表真实分组或字段时,才开启保留空部分。
如果重复空格、制表符和行边缘空白只是噪声,用 whitespace-normalizer 统一它们。紧凑清单才使用 text-empty-lines-remover;空行表达章节时要保留,或另存一份带结构的结果。
用 advanced-duplicate-line-remover 的全局模式并保留首次出现,得到稳定清单。编号、代码等大小写有意义的值使用区分大小写;只有大小写属于展示噪声时才关闭区分,不能把相似但不相同的行当成重复。
如果来源顺序代表优先级或时间,就不要重新排序。否则用 text-basic-sorter 选择字母、数字或长度排序,并记录方向;需要复现时不要使用随机打乱。