输入是列对齐文本、分隔符记录、日志,还是表格标记?
列对齐记录用定宽解析,分隔符不稳定时用混乱文本工具,事件行用日志工具,Markdown 或 HTML 中的表格用专门提取工具。
Elysia Tools
导航
Workflow Playbook
将定宽记录、混乱分隔文本、日志、Markdown 表格和 HTML 表格解析为 CSV、JSON、XML 或 Excel,并保留可复核的清理过程。
专题
半结构化提取最容易失败的地方,是把所有输入都当成普通 CSV。定宽报表、混合分隔符客服导出、Markdown 表格和 logfmt 跟踪日志,第一步完全不同。先用 fixed-width-column-parser、messy-text-to-structured-data-workbench 或 structured-log-analyzer 判断来源,并在改动前保留几行代表性样本。
安全的流程会把清理和转换分开。用 text-pipeline-builder 裁剪空白、移除重复表头、统一分隔符,并让每一步转换规则可以重复执行。这样不会把一次手工修补变成没人能复现的数据变化。
文本稳定后,再有意识地选择导出格式。面向分析人员可用 text-to-csv 或 text-to-excel,面向 API 或测试夹具可用 text-to-json,需要结构化交换时可用 text-to-xml。如果来源本来就是表格,使用 markdown-to-csv 或 html-table-to-csv 能保留单元格边界,而不是从纯文本重新猜测。
日志和坏行需要单独复核。用 log-parser、logfmt-to-json-structured-log-bridge 和 structured-log-analyzer 保持事件字段一致;当行长或引号问题会破坏导入时,再用 csv-malformed-row-surgeon 修复。完整交付应包含解析假设、行数、被修复记录和已知例外。
工作流指南
先确认材料是定宽文本、混乱分隔记录、粘贴表格还是日志行,并保留一小组失败样本用于校验。
建立可重复的清理流水线,完成裁剪、拆分、噪声替换和分隔符稳定化,再导出记录。
把已稳定的文本、Markdown 表格或 HTML 表格导出为目标交换格式,同时保留表头与单元格边界。
分别处理应用日志、Web 日志和 logfmt 记录,再修复异常 CSV 行并复核最终表格。
列对齐记录用定宽解析,分隔符不稳定时用混乱文本工具,事件行用日志工具,Markdown 或 HTML 中的表格用专门提取工具。
当空白、引号、混合分隔符、重复表头或断裂行可能造成错列时,应先规范化再转换。