# 56类任务对AI的意义

任务、模态、治理和载体是不同维度，不能相加为56个独立模型能力。下表为用途说明，不承诺实际效果。

| 编号 | 类型 | 对AI的意义 | 可能用途 | 不能据此证明 |
|---|---|---|---|---|
| 01 | 预训练语料清洗 | 减少导航、乱码和重复等干扰，为语言学习提供更一致的正文。 | 预训练语料加工，也可用于检索语料治理。 | 清洗不能把错误事实自动变成正确事实；过度清洗会损失有用信息。 |
| 02 | 来源授权与数据履历 | 让数据是否可使用、可追溯和需撤回的范围能够被管理。 | 数据治理和准入；通常不是直接训练模型能力的标签。 | 有审核字段不等于有真实授权证明。 |
| 03 | 实体与意图标注 | 帮助系统从自然语言中识别意图和关键信息，例如订单号。 | 分类器、信息抽取模型或指令微调/评测。 | 实体识别不等于身份验证，且无法推断用户未表达的信息。 |
| 04 | 单轮SFT与结构化输出 | 示范如何按指令给出内容正确、格式合适的答案。 | 监督微调SFT或指令遵循评测。 | 格式合法并不保证事实正确；一条示例不能保证泛化。 |
| 05 | 多轮记忆与约束遵循 | 训练或检验模型在多轮中保留约束、接受用户修改并保持一致。 | 多轮SFT或会话评测。 | 上下文长度和覆盖有限；不能证明长期记忆系统有效。 |
| 06 | 翻译与本地化 | 建立跨语言意义、语气和文化表达之间的对应。 | 翻译/本地化训练与质量评测。 | 通顺不等于忠实；不能用通用译员替代必要的专业审核。 |
| 07 | RAG有据问答 | 示范依据检索到的材料回答并提供可定位依据。 | RAG回答训练、引用质量评测；检索索引是另一交付项。 | 答案有引用不等于引用真的支持结论，也不保证检索器找到正确文档。 |
| 08 | 长上下文跨段推理 | 检验或训练模型整合远隔段落中的约束和证据。 | 长上下文SFT与评测。 | 文本长不自动意味着题目难；答案可能被局部捷径泄露。 |
| 09 | 成对偏好与DPO样本 | 提供在相同输入下哪个回答更符合要求的比较信号。 | 偏好优化如DPO，也可训练奖励模型或做评测。 | 偏好对不自动决定训练算法；单一偏好可能引入风格偏差。 |
| 10 | Rubric多维评分 | 把回答质量拆成多个维度，让训练或评测信号更可解释。 | 奖励建模、质量筛选与模型评测。 | 人工分数不是绝对真值，评分尺度需要校准。 |
| 11 | 安全分类与适度拒答 | 提供风险识别和恰当响应示例，兼顾正常请求的可用性。 | 安全训练、分类或安全评测。 | 拒答越多不等于越安全，需要同时看误拒和漏判。 |
| 12 | 提示注入与不可信内容 | 训练或测试模型区分用户任务与外部内容中的伪装指令。 | 提示注入鲁棒性训练或对抗评测。 | 少量模板不能证明抵御所有注入。 |
| 13 | 可验证数学与RLVR | 用可检查答案提供明确的正确性反馈。 | 数学监督训练、可验证奖励训练或评测。 | 验证器漏洞会产生错误奖励；答案对不代表推导每步都对。 |
| 14 | 过程推理错误定位 | 帮助识别推导过程何处开始出错，提供细粒度纠错信号。 | 过程监督、步骤评分或推理评测。 | 解释像样不保证步骤正确，专家分歧需仲裁。 |
| 15 | 专家文档问答与可追溯依据 | 使专业问答与规定材料及领域依据关联。 | 领域SFT、专业RAG或评测。 | 不能据少量专业样本宣称具备专业执业或全面专家能力。 |
| 16 | 代码生成与单元测试 | 建立自然语言需求到可执行代码的映射。 | 代码生成SFT或功能评测。 | 通过给定测试不等于无缺陷或安全。 |
| 17 | 仓库修复与回归验证 | 让模型学习理解已有代码库并针对问题提出修复。 | 仓库修复训练或执行型评测。 | 补丁能应用不等于解决问题，基准成绩也不等于生产可靠性。 |
| 18 | 代码评审与缺陷定位 | 提供代码缺陷定位、严重性和修改建议的监督信号。 | 代码评审助手训练或评测。 | 泛泛建议难以训练可靠定位，误报也有成本。 |
| 19 | Text-to-SQL与执行结果 | 把业务语言映射成数据库查询操作。 | Text-to-SQL训练与执行评测。 | 某个数据快照上结果相同，不能证明查询逻辑始终等价。 |
| 20 | 单工具选择与参数提取 | 示范何时选择工具以及如何从请求提取参数。 | 工具调用SFT或接口使用评测。 | JSON正确不代表工具选择、参数语义或权限正确。 |
| 21 | 多工具依赖编排 | 示范有依赖的多步工具编排和中间结果传递。 | 多工具训练或Agent评测。 | 动作序列看似合理不等于环境执行成功。 |
| 22 | 并行与无关工具判断 | 训练或评测哪些工具可并行、哪些无关或应省略。 | 工具调度和任务规划。 | 并行不总能提速，依赖和外部限制可能禁止并发。 |
| 23 | 工具失败与恢复 | 示范调用失败时重试、降级、澄清或如实告知。 | 工具鲁棒性训练与失败恢复评测。 | 重试可能有副作用，不能对所有错误无限重试。 |
| 24 | GUI定位与操作轨迹 | 建立屏幕观察、任务与点击/输入/滚动动作的对应。 | GUI操作训练或视觉操作评测。 | 坐标准确只代表定位，未必完成业务目标。 |
| 25 | 业务Agent政策与状态验收 | 把业务目标、政策约束和环境状态连接起来。 | 业务Agent训练、轨迹筛选或评测。 | 只看“已完成”的回答容易漏掉未执行和违规。 |
| 26 | RL环境与验证器 | 提供可重复交互和反馈的任务环境。 | 强化学习训练环境或Agent评测环境。 | 环境本身不是一批普通标签；奖励可能被利用。 |
| 27 | 图像描述与事实核对 | 学习把可见内容表达成语言描述。 | 视觉语言SFT、图像描述或相关评测。 | 描述流畅可能夹带不可见细节。 |
| 28 | VQA与视觉依据 | 学习根据图片回答指定问题。 | 视觉问答VQA训练与评测。 | 文本常识可形成捷径，不一定真正使用图像。 |
| 29 | 目标检测框 | 让视觉系统定位对象并识别类别。 | 目标检测监督训练或检测评测。 | 矩形框不包含像素轮廓，也不能直接替代分割。 |
| 30 | 实例与语义分割 | 给出像素级区域归属，实例分割还区分同类不同对象。 | 语义/实例分割训练与评测。 | 粗糙边界会影响细粒度应用，语义与实例标签不能混用。 |
| 31 | OCR与表格结构 | 将图像中的文字与版面转成机器可处理的信息。 | OCR、文档理解和表格结构训练。 | 识字正确不等于行列或字段归属正确。 |
| 32 | 关键点与可见性 | 提供对象关键部位的位置和可见性。 | 姿态估计、关键点定位及相关评测。 | 点标签不等于完整形状或动作意图。 |
| 33 | ASR转写与文本规范 | 建立语音与实际说出文字之间的对应。 | ASR训练或识别评测。 | 转写正确不代表模型一定学好；分布和参考口径同样重要。 |
| 34 | 说话人分离与重叠 | 提供谁在什么时候说话及重叠情况。 | 说话人分离、会议理解或分离评测。 | speaker_id只是样本身份，不自动对应现实人物身份。 |
| 35 | TTS采集brief与录音QC | 提供文字到声音的配对，以及说话人和表达条件。 | TTS训练、声音质量或可懂度评测。 | 合成声音用途受授权约束；音质指标不代替听感评价。 |
| 36 | 情绪与韵律标注 | 给声音表达增加情绪或韵律方面的标签。 | 情绪识别或可控语音生成。 | 情绪判断主观且受文化影响，不能当成心理状态诊断。 |
| 37 | 音频事件检测 | 让系统辨认非语音声音事件及发生时段。 | 声音事件检测、音频理解与评测。 | 合成提示音不能代表真实环境声分布。 |
| 38 | 语音翻译与跨语言对齐 | 把源语言语音的意义映射到目标语言文字。 | 语音翻译训练或跨语言评测。 | 先转写再翻译与端到端任务的交付要求可能不同。 |
| 39 | 视频事件分段 | 为视频中的事件提供时间定位。 | 视频事件识别、时序定位或片段检索。 | 事件类别正确但边界错误仍可能不可用。 |
| 40 | 多目标跟踪与身份保持 | 让系统在跨帧观察中保持对象身份。 | 多目标跟踪或时序感知。 | 逐帧框都准确仍可能出现身份交换。 |
| 41 | 视频问答与时间证据 | 示范依据视频时间过程回答问题。 | 视频语言理解训练与评测。 | 只靠单帧可回答的问题不能充分测时间理解。 |
| 42 | 音画时间同步 | 让多模态记录的声音和画面对应同一时刻。 | 音画联合学习的数据准备或同步评测。 | 同步处理是质量基础，不必然是独立训练标签。 |
| 43 | 3D点云框与坐标系 | 提供空间对象的位置、尺寸、类别和方向。 | 3D感知、空间理解训练或评测。 | 坐标系错会让看似合理的框整体失效。 |
| 44 | 机器人轨迹与动作分段 | 把任务观察、机器人状态与动作联系起来。 | 模仿学习、动作策略训练或机器人任务评测。 | 数值轨迹或仿真成功不保证真机安全与泛化。 |
| 45 | 传感器异常区间 | 为时间序列提供异常发生的区间或类型。 | 异常检测训练与评测。 | 与阈值偏离不必然是真故障，标签依据需明确。 |
| 46 | 结构化数据质量与异常记录 | 让表格/结构化数据适合后续分析和建模。 | 数据质量治理，也可构成纠错训练样本。 | 修正不应凭经验伪造缺失事实。 |
| 47 | 检索相关性与排序 | 告诉检索系统哪些文档更符合查询。 | 相关性模型或重排序训练/评测。 | 相关文档不等于可靠事实，也不等于完整答案。 |
| 48 | 合成数据去重与质量筛选 | 筛除合成候选中的重复、错误和低质量内容。 | 训练数据筛选和合成数据治理。 | 模型生成不自动正确，多模型一致也可能共同出错。 |
| 49 | 评测集设计与污染检查 | 提供相对独立的测量工具，帮助比较能力和发现缺口。 | 评测基础设施；主要测能力而非直接增加能力。 | 一旦泄漏到训练中，分数可能高估真实能力。 |
| 50 | 语音Agent端到端任务 | 连接听懂语音、理解意图、调用工具和达成任务。 | 语音Agent训练或端到端评测。 | 单独ASR准确不代表端到端任务成功。 |
| 51 | 文本预训练语料记录 | 为语言模型提供语言规律、概念表达和知识线索。 | 文本预训练或领域继续预训练。 | 模型不是逐条可靠记忆库；知识可能过时或相互矛盾。 |
| 52 | 代码预训练语料记录 | 让模型接触代码语法、惯用结构及软件上下文。 | 代码预训练或领域继续训练。 | 原始仓库代码可能有缺陷，不能当作每段都正确的题解。 |
| 53 | 图文配对语料 | 使视觉内容与自然语言描述建立联系。 | 图文表征学习、多模态预训练或检索。 | 仅有配对文本不代表细粒度定位，错误配对会产生噪声。 |
| 54 | 检索对比学习三元组 | 提供查询与相关/不相关内容之间的对比信号。 | 向量检索或相关性模型训练。 | 容易负例不保证处理相近难例；假负例会误导训练。 |
| 55 | 真实语音交付清单结构 | 把音频、文本、说话人及质量状态组织成可追溯记录。 | 语音数据工程与交付载体，不是额外一种模型能力。 | 填写manifest本身不等于录音已采集或ASR已标注。 |
| 56 | 知识图谱三元组 | 把文本中的实体与关系组织为结构化知识。 | 信息抽取、知识检索或图谱相关任务。 | 图谱完整不代表事实永久正确，来源和时间仍重要。 |