# 从样本到项目：开工前十项检查

本页是培训的项目复核补充。56种样本是任务结构图谱，不代表市场上所有任务，也不是56项岗位资质。每次承接新任务都要核对客户的模型目标和批准规范；不要直接套用公开教学阈值。

| 检查 | 必须拿到的产物 | 不能放量的例子 |
|---|---|---|
| 目标与计量 | 任务用途、有效量定义、去重规则、配额与计费单位 | 原始小时与有效小时混算；图像按文件数收费但按目标数验收 |
| 内容标准 | 冻结指南、正反例、争议升级路径、专家认可的参考 | 方言归类未确认；可见框和完整框混用 |
| 来源与权利 | 素材血缘、适用用途授权、人员同意、保存及删除期限 | 来历不明；公开可下载就默认可用于训练 |
| 敏感信息 | 数据分类、最小访问、脱敏检查、隔离及事件联系人 | 员工将客户数据发到公开格式化网站；导出含密钥 |
| 工程可用 | 客户认可的字段规范、媒体索引、版本和完整性验证 | JSON语法正确但关联音频错误；路径与内容不对应 |
| 内容质量 | 错误定义、抽样计划、严重项、复验和批次判定规则 | 只看整体均值；把100条零缺陷宣称为全批无缺陷 |
| 分桶能力 | 按语言/场景/难度的实测合格产能、返工与等待 | 用全基地月采集量承诺单语种月有效交付 |
| 商业与现金 | 同口径成本、返工条款、账期、付款触发、风险准备 | 将客户收入当成供应商采购预算；先付后验无人担责 |
| 变更与发布 | 有权审批人、变更影响、交付版本、回滚与接收证据 | 口头说配额差一点没关系就自行替换 |
| 人员与退出 | 校准产物、抽检监督、适当休息与敏感内容保护、权限回收 | 一次培训后直接量产；离场人员仍能读客户数据 |

每项写：结论、证据版本、责任人、截止、阻塞范围、谁可解除阻塞。允许先做有边界的试标，不将未知事项默认写成“已通过”。

## 六类任务的特殊失败方式

| 任务 | 格式检查通过仍可能失败 | 至少补一项实际核查 |
|---|---|---|
| 预训练文本 | 重复、来源不适用、乱码、训练/评测交叉泄漏 | 近重复与来源抽检；客户指定的切分和污染检查 |
| 语音/ASR | 词边界、数值或否定词改变含义；参考稿也可能错 | 获授权真人音频、母语独立听审；冻结WER/CER分词、规范化和参考口径 |
| 图像/视频 | 框规则、遮挡、跨帧身份或时间基准错误 | 逐帧查看与规范校准；检查轨迹/类别/坐标和时标 |
| Coding | 偷看参考解、只跑新增测试、依赖环境不一致 | 独立环境复跑、原有回归、失败定位；保留代码与日志版本，不上传密钥 |
| API/Agent | 轨迹看起来成功，但副作用重复、权限错误或状态未变化 | 在沙箱检查最终状态、幂等、超时、权限与失败路径；区分模拟器和真实系统 |
| 偏好/推理/专业领域 | 评审同偏差、答案无依据、偏好被当事实正确性 | 独立判断后仲裁，核对任务定义及专业证据；专业负责人批准审核范围 |

工具评分应声明覆盖与不覆盖。自动逐稿比对不是WER，不是独立听审，也不能判断参考稿正确性。WER=(替换数+删除数+插入数)/参考词数；可能超过100%，不得自动等同“准确率=100%-WER”。中文按词或按字必须事先约定，按字指标通常是CER。

## 人工审核如何打分

需求20、产出30、缺陷20、追溯20、沟通10：逐维度写得分依据及文件位置，而不是只填总分。80分是本培训建议阈值，公司可以冻结其他阈值。任何严重项未关闭都不能用其他维度高分抵消。

- 需求：口径、配额、授权人和未知事项齐全才给高分；漏一个阻塞项须解释影响。
- 产出：实际文件能由另一人按步骤复现，检查范围明确；只有材料位置文字不能证明产出。
- 缺陷：主动定位、隔离、返工和独立复验；只改抽检发现的几条不算关闭根因。
- 追溯：需求、素材、指南、提交和批准可串到同一版本；修改后必须复评相关结论。
- 沟通：提出有成本和权限边界的可执行方案，并观察实际培训/会议表现；写了脚本不等于会带队。

新任务考核由公司另出未见材料、独立收卷、留存评分与试岗记录。公开网页不能保密试题、证明身份或签发正式准入。至少安排一次小规模真实交付闭环：试标→有限生产→返工复验→客户接收→付款对账→复盘，由负责人批准范围后再扩大规模。
