1. 标注英文客服片段
客服数据分析人员背景
需要检查一段英文客服文本中的词元和邮箱实体,并保留结构化 JSON 结果。
问题
手动拆分文本和查找邮箱实体效率较低。
如何使用
粘贴“The quick fox emailed [email protected].”,选择英语和 JSON,启用停用词移除、词干提取、词形还原及实体识别,并将 N-gram 大小设为 2。
结果
得到包含语言、词元数量和 EMAIL 实体信息的 JSON 结果。
Elysia Tools
导航
Text Processing
使用可解释的本地规则完成分词、句子切分、停用词、词形、词干、实体和 n-gram 标注,并导出 JSONL 或 CoNLL。
执行
填写表单、运行工具,并在同一页面查看结果。
案例
相关内容
等待运行
工具使用指南
文本 NLP 标注工作台使用可解释的本地规则处理文本,支持分词、句子切分、停用词处理、词干提取、词形还原、实体识别和 n-gram 标注,并可输出 JSON、JSONL 或 CoNLL。
背景
需要检查一段英文客服文本中的词元和邮箱实体,并保留结构化 JSON 结果。
问题
手动拆分文本和查找邮箱实体效率较低。
如何使用
粘贴“The quick fox emailed [email protected].”,选择英语和 JSON,启用停用词移除、词干提取、词形还原及实体识别,并将 N-gram 大小设为 2。
结果
得到包含语言、词元数量和 EMAIL 实体信息的 JSON 结果。
背景
需要整理“北京欢迎你。数据安全很重要。”这段中文语料,并保留中文停用词。
问题
需要获得逐行的中文词元及基础标签,便于后续查看和使用。
如何使用
粘贴文本,选择中文和 CoNLL,关闭停用词移除、词干提取和词形还原,启用实体识别,并将 N-gram 大小设为 2。
结果
生成带有中文词元、词性和实体标签的逐行 CoNLL 数据。
背景
需要从多语言文本样本中观察连续词元组合,同时保留 JSONL 的逐词元结构。
支持自动检测、英语、中文、西班牙语、法语、德语、俄语和葡萄牙语。
支持 JSON、JSONL 和 CoNLL。
可以,关闭“移除停用词”即可保留停用词。
可设置为 1、2 或 3。
工具会在结构化结果中标注识别到的实体类型,例如 EMAIL。
问题
普通文本难以直接对照词元及其 n-gram 标注。
如何使用
粘贴语料,选择语言或使用自动检测,选择 JSONL,并将 N-gram 大小设为 2 或 3;其他标注选项按分析目标启用。
结果
获得每行一个词元的 JSONL 标注结果,便于检查短语组合。