第二个模块落在“训练”本身:一边是数据处理规范制定(数据清洗与标注怎么做才可复现),一边是算法测试(怎么验证一个模型是否可用)。这一模块考的是规范意识与测试方法。
一、考核方向拆解
| 单元 | 典型任务形态 | 能力落点 |
|---|---|---|
| 数据处理规范制定 | 为一个数据集制定清洗与标注规范 | 规范要有判定标准,别人照着能做出一样的结果 |
| 算法测试 | 设计测试方案并记录测试结果 | 会选测试指标,测试样本有代表性,结论有数据支撑 |
二、准备清单(逐项打勾)
- 清洗规范要覆盖:缺失值处理、异常值判定、重复数据、格式统一,每类给出判定标准
- 标注规范要覆盖:标注类型定义、边界情形处理(模糊样本怎么办)、一致性校验方式
- 掌握常用评估指标的含义与适用场景:准确率、精确率、召回率、F1 分数
- 能说清测试集与训练集的划分原则,以及为什么测试集不能参与训练
- 会写测试记录:测试时间、样本范围、指标结果、异常案例、结论
三、常见失误
- 规范只有动作没有标准:写了“清洗异常值”,但没写什么算异常
- 测试样本没有代表性:只挑容易的样本测,结果虚高
- 指标混用:不平衡数据里只报准确率,掩盖少数类问题
- 测试记录缺失:只有结论没有过程,无法复核
四、自测要点
- 给定一份脏数据,能否写出三条可执行的清洗规则(含判定标准)?
- “准确率 95%”这个结论,你会追问哪两个问题?(样本分布、测试集来源)
- 标注规范里,遇到边界模糊样本应该怎么处理?