Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/00-Foundations/02-Annotation-Human-Data-and-Evaluation.md
T

5.8 KiB

type, tags, status, created
type tags status created
guide
llm-evaluation
foundations
active 2026-08-21

数据标注、Human Data 与 Evaluation 是什么关系

先区分三个概念

很多岗位和文章会把“数据标注”“人工反馈”“模型评测”混在一起,但它们不是同一个概念。

Annotation
   └─ 人对数据做结构化判断或加工

Human Data
   └─ 更大的集合:人类产生、选择、修改或评价的数据

Evaluation
   └─ 用数据 + 规则判断模型或系统表现

它们会大量重叠,但目的不同。

什么是数据标注 Annotation

数据标注的本质是:

按照给定规则,把原始数据转换成带有结构化意义的数据。

传统机器学习中的例子:

图片 → cat / dog
文本 → positive / negative
句子 → entity spans
语音 → transcript

LLM 场景中的标注更加复杂,例如:

  • 判断回答是否事实正确
  • A/B 比较哪个回答更好
  • 标记安全风险
  • 为代码任务写参考解
  • 标注工具调用参数是否正确
  • 对 Agent trace 进行失败分类
  • 修改一个较差答案成为 ideal answer

所以现代 LLM 数据标注经常已经不是“打标签”,而是执行复杂 rubric 的判断工作

什么是 Human Data

Human Data 可以理解为:

为训练、对齐、评测或产品改进而产生的人类判断与示范数据。

它可能包括:

Demonstration Data

人直接给出理想输出:

Instruction
    ↓
Human Ideal Answer

常见于 SFT 数据。

Preference Data

比较候选输出:

Answer A
Answer B
    ↓
A preferred / B preferred / tie

Critique / Reason Data

不仅给标签,还解释:

  • 哪里错
  • 为什么错
  • 缺什么
  • 哪个规则被违反

Evaluation Labels

为评测集产生:

  • pass / fail
  • 0 / 1 / 2
  • severity
  • failure type
  • confidence
  • escalation reason

因此“Human Data”比“Annotation”覆盖面更大。

Annotation 与 Training Data 的关系

标注数据可能被用于训练:

Raw Data
   ↓
Annotation / Curation
   ↓
Training Dataset
   ↓
SFT / Preference Optimization / Other Training

此时目标是:

让模型从这些样本中学习行为。

关键关注点包括:

  • 数据质量
  • 覆盖度
  • 一致性
  • 偏差
  • 许可与隐私
  • train / validation / test 隔离

Annotation 与 Evaluation Data 的关系

同样的人工判断,也可能用于评测:

Eval Case
   ↓
Model Output
   ↓
Human Annotation
   ↓
Evaluation Result

此时目标不是训练模型,而是:

测量当前系统是否满足标准。

最重要的区别是用途。

对比项 Training / Alignment Data Evaluation Data
主要目的 改变模型行为 测量系统行为
是否给模型学习 原则上不应
是否需要冻结 训练集可演化 正式 eval 需要版本冻结
数据泄漏风险 训练数据质量问题 eval contamination 会使结果失真
核心问题 “模型应该学什么?” “系统现在做得怎么样?”

数据标注与 Evaluation 为什么经常混在一个岗位里

因为 Evaluation 的很多 grader 最初需要人来执行。

例如:

Case
  ↓
Output
  ↓
Human reads rubric
  ↓
Pass / Fail + Reason

所以评测体系建设往往经历:

人工判断
   ↓
发现规则歧义
   ↓
修 rubric
   ↓
建立稳定人工基准
   ↓
规则自动化 / LLM Judge

因此,人工标注不是 Evaluation 的低级阶段

它承担两个关键职责:

  1. 帮助定义“什么叫正确”;
  2. 校准自动 grader 是否可信。

数据清洗、数据治理、数据标注有什么区别

Data Cleaning

处理数据本身的技术质量:

  • 编码问题
  • 格式错误
  • 空值
  • 重复
  • 乱码
  • 非法字段

Data Curation

围绕使用目的选择和组织数据:

  • 选哪些来源
  • 去掉哪些低质量数据
  • 控制分布
  • 去重
  • 记录来源与许可
  • 处理 PII

NVIDIA NeMo Curator 将清洗、过滤、去重、PII 处理等视为可重复的数据整理流程。[1]

Annotation

给数据增加人工或机器产生的结构化判断:

  • 标签
  • preference
  • rationale
  • reference
  • failure type

Data Governance

保证数据资产可管理:

  • 来源
  • 许可
  • 访问权限
  • PII
  • 版本
  • lineage
  • retention

Hugging Face 的 Dataset Card 也强调记录数据内容、使用语境、创建方式、许可和潜在偏差。[2]

数据标注质量为什么难

传统分类任务可能有明确答案:

spam / not spam

LLM 场景常常存在:

  • 多个正确答案
  • 部分正确
  • 风格与事实混杂
  • 边界情况
  • 规则冲突
  • 领域专业判断
  • 安全风险

因此高质量标注依赖:

Task Definition
      ↓
Rubric
      ↓
Examples / Counterexamples
      ↓
Calibration
      ↓
Disagreement Analysis
      ↓
Guideline Revision

真正重要的不是:

标了多少条

而是:

不同标注者能否依据同一规则得到稳定判断

对程序员而言最值得迁移的能力

如果已有开发经验,最有价值的不是追求纯人工标注吞吐量,而是向以下方向升级:

  • Dataset / Schema validation
  • Rubric 设计
  • Label consistency 分析
  • Failure taxonomy
  • Eval harness
  • Agent trace evaluation
  • LLM Judge calibration
  • Regression suite
  • CI quality gate
  • Data lineage / versioning

也就是:

把人工判断变成可复现、可审计、可自动化的质量系统。

参考资料

[1] NVIDIA, NeMo Curator / LLM dataset curation
https://developer.nvidia.com/blog/curating-custom-datasets-for-llm-training-with-nvidia-nemo-curator/

[2] Hugging Face, Dataset Cards
https://huggingface.co/docs/hub/datasets-cards