一、任务背景
某健康咨询平台收集了 5000 条用户问诊文本,用于训练症状分类模型。数据存在:缺失主诉、重复提问、错别字、同一症状多种表述等问题。请你制定一套清洗与标注规范,交给两名标注员执行。
二、任务要求
- 清洗规范:覆盖缺失值、重复值、文本规范三类问题,每类给出可判定的标准
- 标注规范:定义标注类别、边界情形处理、一致性校验方式
- 说明规范如何落地执行(标注员怎么用、怎么复核)
三、作答框架(建议结构)
| 部分 | 写什么 | 篇幅参考 |
|---|---|---|
| 清洗规则 | 问题类型 / 判定标准 / 处理动作(表格形式) | 3 类 6-9 行 |
| 标注规范 | 类别定义+边界规则+示例 | 6-8 行 |
| 执行与复核 | 标注流程、一致性检查、争议处理 | 3-5 行 |
四、参考要点(先自己写,再展开对照)
点击展开参考要点清单
- 判定标准要可操作:如"主诉缺失=文本中无明确症状描述且长度<5 字",而不是"内容不完整的删除"
- 重复值:定义"重复"(完全一致 / 语义相似度阈值),处理(保留时间最早或信息最全的一条)
- 文本规范:错别字与口语表述先建对照表(如"咳嗽/咳嗦/咳嗽了"归并),不直接改写原意
- 标注类别:类别数量适中(如 8-12 类),每类给出 2 个示例;"多症状"情况规定主类别判定规则
- 一致性校验:双人独立标注 10% 样本,一致率不达标则回训规范;争议样本由第三方裁决并补入规范
五、常见扣分点
- 规范只有动作没有判定标准("清洗异常数据"式表述)
- 标注类别无边界规则,多症状/模糊样本没有处理办法
- 没有一致性校验设计
- 把规范写成一次性说明,没有迭代机制