来源是文件批次、API 落地,还是对象存储前缀?
分页 JSON 需要先进入工作表时选择 API To Sheet;处理获准的存储前缀时选择 S3 Batch Processor;分隔符或编码不稳定的 CSV 则先用检测/规范化和批量转换工具。每个落地产物都要写回来源分支。
Elysia Tools
导航
Workflow Playbook
把多个工作簿和 CSV 来源整理成可追溯、带 schema 依据的 SQL、Parquet 与对象存储批处理输入。
专题
把多个工作簿和 CSV 来源整理成可追溯、带 schema 依据的 SQL、Parquet 与对象存储批处理输入。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
为每个文件、API 响应或对象存储前缀准备稳定的来源 ID、批次 ID、采集时间,以及预期工作表或区域。
准备一份正常批次和若干坏样例,包括表头变化、混合类型、重复键、错误编码和空工作表。
先定义规范字段名、业务键或增量游标、空值策略、目标 SQL 方言,以及最终要交付 Parquet、NDJSON 还是 CSV 包。
确定拒绝行和中间产物的保存位置,确保修复后可以重跑且不会覆盖原始输入。
决策点: 来源是文件批次、API 落地,还是对象存储前缀?. 分页 JSON 需要先进入工作表时选择 API To Sheet;处理获准的存储前缀时选择 S3 Batch Processor;分隔符或编码不稳定的 CSV 则先用检测/规范化和批量转换工具。每个落地产物都要写回来源分支。
决策点: 应该拆表、重塑,还是直接合并?. 工作表各自代表独立数据集时先拆分或抽取命名区域;合并前先映射字段;月份或类别横向展开时用 unpivot 变成长表;只有目标契约确实需要嵌套结构时才使用 JSON 转换。
决策点: 下游契约和交付格式是什么?. 把 JSON Schema 推断结果当作待审查提案,用迁移规划器设计表和字段,再在确认类型、键、转义规则和方言后生成 INSERT。分析管道可选择 Parquet 或 NDJSON,需要逐表检查时则选择带 manifest 的 CSV 包。
需要时把分页 API 记录写入工作表,处理获准的对象存储批次,并在批量转换 CSV 前识别分隔符和编码。先分配来源与批次标识,保留原始输入到落地文件的关系,再改变字段值。 使用 xlsx-api-to-sheet, xlsx-s3-batch-processor, xlsx-csv-detect-normalize, xlsx-csv-batch-converter.
拆开多工作表工作簿或只抽取批准的区域,然后统一字段名、顺序和保留列。目标是按行存储时,把月份等宽列转换成长表;只有下游契约明确需要时,才压平或恢复嵌套 JSON。 使用 xlsx-multi-sheet-splitter, xlsx-range-extractor, xlsx-column-mapper, xlsx-unpivot-normalizer, xlsx-json-transformer.
只合并工作表和字段契约兼容的工作簿。周期性导入使用经过审查的时间列或主键游标追加新行;同时比较来源、保留、重复和拒绝计数,并将游标与批次血缘一起保存,保证重跑可解释。 使用 xlsx-workbook-merger, xlsx-append-incremental.
从代表性行推断候选 JSON Schema,把确认后的字段转换成数据库迁移计划,再按选定方言生成 SQL INSERT。执行外部写入前检查日期、数字、空值、标识符、转义和目标列顺序。 使用 xlsx-sheet-to-json-schema, csv-to-database-migration-planner, xlsx-sql-insert-generator.
把确认后的表结构导出为分析管道可消费的 Parquet 或 NDJSON,或者把每个工作表打成带 manifest 的 CSV 包以便检查和传输。交付时附上行数、字段和血缘信息;上传、权限和最终提交仍由接收系统负责。 使用 xlsx-parquet-exporter, xlsx-sheet-to-csv-pack.
工作流指南
需要时把分页 API 记录写入工作表,处理获准的对象存储批次,并在批量转换 CSV 前识别分隔符和编码。先分配来源与批次标识,保留原始输入到落地文件的关系,再改变字段值。
拆开多工作表工作簿或只抽取批准的区域,然后统一字段名、顺序和保留列。目标是按行存储时,把月份等宽列转换成长表;只有下游契约明确需要时,才压平或恢复嵌套 JSON。
只合并工作表和字段契约兼容的工作簿。周期性导入使用经过审查的时间列或主键游标追加新行;同时比较来源、保留、重复和拒绝计数,并将游标与批次血缘一起保存,保证重跑可解释。
从代表性行推断候选 JSON Schema,把确认后的字段转换成数据库迁移计划,再按选定方言生成 SQL INSERT。执行外部写入前检查日期、数字、空值、标识符、转义和目标列顺序。
把确认后的表结构导出为分析管道可消费的 Parquet 或 NDJSON,或者把每个工作表打成带 manifest 的 CSV 包以便检查和传输。交付时附上行数、字段和血缘信息;上传、权限和最终提交仍由接收系统负责。
分页 JSON 需要先进入工作表时选择 API To Sheet;处理获准的存储前缀时选择 S3 Batch Processor;分隔符或编码不稳定的 CSV 则先用检测/规范化和批量转换工具。每个落地产物都要写回来源分支。
工作表各自代表独立数据集时先拆分或抽取命名区域;合并前先映射字段;月份或类别横向展开时用 unpivot 变成长表;只有目标契约确实需要嵌套结构时才使用 JSON 转换。
把 JSON Schema 推断结果当作待审查提案,用迁移规划器设计表和字段,再在确认类型、键、转义规则和方言后生成 INSERT。分析管道可选择 Parquet 或 NDJSON,需要逐表检查时则选择带 manifest 的 CSV 包。