1. 三分类情感文本数据集分层切分
NLP 算法工程师背景
正在开发一个用户评论情感分类模型,数据集包含正面、负面、中立三种标签,样本总量较少且各类别数量不均。
问题
普通随机划分容易导致验证集或测试集中缺少中立评论,影响模型评测客观性。
如何使用
粘贴包含 text、length 和 label 列的 CSV 内容,将目标列设为 label,选择标准模式(70/15/15),设置随机种子为 42 并导出 ZIP。
目标列: label, 切分模式: standard, 训练集: 70%, 验证集: 15%, 随机种子: 42, 按目标列分层: true, 导出 ZIP: true结果
生成 16/5/3 的样本划分,各切分内三种类别的占比偏差极小,同时导出了 train.csv、validation.csv、test.csv 及切分报告。