AI数据全链路说明书
适用对象:AI数据采购与项目Owner、需求方、标注基地负责人、采集标注人员和质量负责人。版本:教学版1.0,2026年10月9日。
目标:把“为什么要这种数据、需要什么、如何生产、怎样判定交付”放在同一条链上。覆盖56种代表性任务;这些条目包含训练、评测、治理和数据载体,既非互斥分类,也不是所有行业任务的穷尽目录。
01 全链路总图
Brief定义目标 → 需求明细对接冻结规格 → 采集或构造并预处理 → 按标准标注或加工 → 独立审核与仲裁 → 按约定验收和放行。
流程可以回退:审核发现缺陷回标注,素材不适合回采集,需求不明确回对接。返工和变更必须区分;原规格未满足是返工,客户改变已确认范围则需要评估变更。
“标准”是贯穿每个环节的规则;“标注”是产生标签、答案或加工结果的动作。本书第四环节同时讲两者。采集后的格式和最终交付格式不一定相同,应有可追溯映射。
02 谁对什么负责
| 角色 | 主要责任 | 应留记录 |
| AI需求负责人及算法团队 | 说明用途、能力缺口、分布和模型验证办法 | Brief、规格确认、技术反馈 |
| 采购或项目Owner | 协调需求、供应、成本、周期、风险和变更 | 对接表、决策记录、进度与验收结论 |
| 基地生产负责人 | 人员、设备、排班、生产执行和异常上报 | 批次计划、采集与提交记录 |
| 标注员和领域专家 | 按规则产生结果,处理语言/专业判断 | 标注结果、依据、疑难项 |
| 质量审核员 | 复核、缺陷分级、仲裁和复验 | 审核记录、问题单、复验报告 |
| 有权限的客户验收人 | 按约定接收、拒收或批准偏差 | 验收确认、偏差批准和条件 |
一人可以兼任某些角色,但关键参考答案和最终复核应按项目要求设置独立性。Owner能决定隔离、升级、排期和方案,不应以商业压力替代语言或技术正确性的判断。
03 Brief到底写什么
Brief是一页任务说明,用来让双方对“做什么和为什么做”形成共同理解;它不等于已经冻结全部细节。
最少包括:业务问题、目标AI能力、数据用途、任务类型、范围和排除项、交付物、预计规模、里程碑、关键风险、技术确认人和验收人。未知项标待确认,不能写成客户已同意。
示范:为识别某类泰语口语场景中的问题,拟提供语音与转写配对数据。用途为训练还是独立评测待需求方确认;需先明确方言、场景、说话人分布及转写口径,再试标。数量、单价、阈值及截止时间未确认前,不能承诺规模化交付。
本书各任务页提供任务定制Brief,带有未确认项。直接复制后应替换示例数据和项目条件,不能拿合成DEMO宣称真实生产已完成。
04 需求明细对接必须问清的12项
| 对接项 | 必须明确 | 没明确会怎样 |
| 用途 | 训练、验证、测试、检索索引或治理 | 混用可能造成泄漏或交付错误 |
| 能力目标 | 想改善或测量什么,现有失败样本是什么 | 生产了数据却不解决目标问题 |
| 数量单位 | 条、段、文档、有效小时、episode、token等 | 报价、进度和结算分母不同 |
| 分布 | 语种、方言、场景、难度、类别和人员配额 | 总量够但关键覆盖不足 |
| 来源 | 采集、授权导入、人工构造、模型生成 | 来源限制和质量方法不同 |
| 输入与环境 | 素材、工具schema、仓库版本、环境权限 | 无法开工或复现 |
| 标准 | 标签、边界、时间/坐标单位及疑难处理 | 同一任务各人理解不同 |
| 质量指标 | 公式、方向、参考、抽样方法与阈值 | “99%”没有可比较意义 |
| 交付格式 | 文件目录、ID、schema、编码和命名 | 数据不能被正确接入 |
| 审核机制 | 一标、复核、仲裁、退回与复验责任 | 争议无人决策 |
| 商务交付 | 计费口径、返工、版本、里程碑 | 隐性成本和交期争议 |
| 变更权限 | 谁批准、通过什么记录、何时生效 | 单方告知被误当成同意 |
冻结后生成规格版本,如SPEC-v1,并记录何时生效。更改字段、配额、验收公式或环境版本都要评估影响,不能只改表格而不通知生产和审核人员。
05 采集或构造完成的判定
采集不是只指拍照录音。文本任务可以收集文档,Coding可以准备仓库与问题,偏好任务可以生成候选回答,Agent可以录制操作轨迹。来源方法影响后续验证。
完成后应有原始材料或构造输入、唯一ID、来源和时间、必要元数据、可用性检查以及缺失/异常清单。需要授权或用途确认但未完成时,仍应保留待处理状态。
保留原始版本与处理版本。音频切片、视频抽帧、文本清洗、仓库过滤,都要能回溯。模型预标注是上游建议,不自动是正确标签。
采集放行检查:文件可读;输入满足任务最低要求;分布与规模可盘点;来源状态明确;处理映射存在。确认后才能交给标注,不能把缺素材问题全部交给标注员猜。
06 标注标准怎样变成可执行动作
规范至少写:任务目标、输入、字段、标签定义、操作步骤、正例、反例、边界样本、不确定处理、提交条件。每条规则最好能回答“看哪里、做什么、写到哪个字段、怎样检查”。
培训顺序:讲规则 → 共同练习 → 独立试做 → 对比差异 → 专家仲裁 → 修订指南 → 再试做。不是看完课件就认为可以量产。
一个示范:检测框任务明确像素xyxy、左上原点、右下是否包含、遮挡怎么处理;员工画框后,检查坐标范围、类别和漏标。ASR则要明确按实际发音转写,提示稿只能辅助,不能原样复制替代听音。
标注完成只表示结果已提交或加工完成;参考答案、审核状态、实际通过必须分别记录。新手、预标注与专家产出都需要适用的审核路径。
07 审核与仲裁的执行
自动检查适合结构、类型、路径、属性、唯一性等可编码规则;人工或专家检查负责语义、语言、边界和疑难判断。代码和Agent还可能需要隔离环境执行验证。
审核方案应约定母体、抽样单位、分层方法、样本量、选择方式、错误分类和处理规则。不能照搬统一抽检百分比;小样本“全过”不能无条件推断全部质量。
缺陷记录:批次版本、行号或sample_id、违反规则、实际情况、期望、证据、严重性、责任人、修复方式、复验结果。一条样本有多个缺陷,问题项数与问题样本数要分开。
有分歧先隔离并查规范。语言结论交给具备对应能力的专家和证据,不能简单多数票;工程结论应核对执行和状态。仍无法判定则保持待仲裁,而不是为进度改成通过。
08 验收和审核有什么区别
审核关注“结果是否符合具体规则”;验收关注“这一批是否按双方约定完成,可以接收多少、哪些暂缓、哪些退回”。审核可能由基地内部完成,最终验收由约定的授权角色作决定。
验收至少核对:规格版本、输入输出清单、数量与有效单位、分布配额、素材和标注关联、质量报告、未解决缺陷、来源和使用状态、实际接收范围。完成传输或导出不等于客户验收通过。
质量通过不等于模型效果已改善。需要证明效果时,应由算法团队设计有独立评测集和可比较条件的实验;控制模型、训练配置与评测口径,记录局限。采购Owner负责把验证需求纳入计划,不伪造模型收益。
09 指标要写成可计算的定义
WER=(替换词数+删除词数+插入词数)/参考词数,越低越好;CER采用字符粒度。分词、大小写、标点、数字、空参考、汇总方式均应先约定。“准确率100%”不能自动替换为WER,也不能由“验收通过”倒推出无错误。
分类/实体可能使用准确率或F1,检测/分割可能使用IoU等定位指标,代码可使用约定测试通过情况,Agent可使用目标达成与违规率。它们不是可互换的质量标准,也不意味着同一个阈值适用所有任务。
每个项目填写指标卡:名称、公式、方向、单位、分母、参考来源、测试/抽样范围、阈值、工具版本、例外处理。指标名称不完整或未明确时,先澄清,不擅自解释。
10 成本产能与试标放量
按真正的有效交付单位比较成本:采集、标注、质检、专家、返工、管理和基础设施中适用的成本都要计入。原始小时、有效小时、客户接收小时不是一回事。
产能需拆成每环节可用人员、熟练度、有效工作时间、处理速度、质量损耗和在手项目占用。原始采集快,不代表专家审核也能跟上。未知参数先做试标测量,不直接拿基地总产能保证某个新任务。
试标放量条件:规则分歧已处理;关键素材和字段可用;审核结果满足约定;合格成本和周期可承受;风险有责任人;有明确放量批准。先小批次,再滚动扩大;本书不提供统一的通过阈值或市场价格。
11 交期与配额冲突怎么处理
例:方言样本存在争议,剔除后时长和配额不足,备用材料只有标准语言。
先隔离争议项,量化缺口并核实补采/替代资源。向客户提供可执行选项,例如先交合格部分、延时补齐,或在明确批准后接受单列的替代数据。不要猜客户流水线一定需要足量,也不要称方言缺口“不影响训练”。
书面通知不等于批准变更。没有获得有权限角色确认前,不将替代数据标为满足原配额,也不将不完整批次标为完全接收。交付/暂缓方式按已有约定执行,并准确列明当前状态。
12 对外展示与学习方法
本书全部样本为合成教学材料;界面为原创示意。语音部分存在待真人采集的提示稿,视频为合成帧,代码和轨迹中的期望结果不是虚构的实际测试记录。空白审核和批准字段有意保留,不能为了好看填成通过。
可向客户表述:“这是我们理解任务、字段和生产流程的合成DEMO。真实交付能力通过有权限展示的项目证据和试标验证。”不要称其为客户真实脱敏成果。
学习顺序:先读本总则;选熟悉的33 ASR,把六环节讲给别人听;再比较35 TTS、09偏好、16 Coding、25 Agent;最后按任务页填写一份真实待确认表。现场看输入、动作、新增产物,再问用途和下一环节,避免只看软件外观猜任务。
13 研究依据与教学归纳的边界
下列研究用于支持相关能力与数据形态的关系;本书的六环节流程、需求表和审核建议属于教学归纳,不是这些论文提供的商业采购标准。实际模型效果依赖数据分布、质量、训练和评测设计。
• SFT示范和偏好反馈:Training language models to follow instructions with human feedback。
• 偏好对可用于DPO:Direct Preference Optimization。
• 检索与生成结合:Retrieval-Augmented Generation。
• 多语种语音与文本监督:Robust Speech Recognition via Large-Scale Weak Supervision。
• 图文配对表征:Learning Transferable Visual Models From Natural Language Supervision。
• 仓库问题与代码修复:SWE-bench。
• API选择、参数与结果使用:Toolformer。
• 视觉语言与机器人动作:RT-2。