Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/00-Foundations/02-Annotation-Human-Data-and-Evaluation.md
T

5.8 KiB

type, tags, status, created
type tags status created
guide
llm-evaluation
foundations
active 2026-08-21

数据标注、Human Data 与 Evaluation 是什么关系

先区分三个概念

很多岗位和文章会把“数据标注”“人工反馈”“模型评测”混在一起,但它们不是同一个概念。

Annotation
   └─ 人对数据做结构化判断或加工

Human Data
   └─ 更大的集合:人类产生、选择、修改或评价的数据

Evaluation
   └─ 用数据 + 规则判断模型或系统表现

它们会大量重叠,但目的不同。

什么是数据标注 Annotation

数据标注的本质是:

按照给定规则,把原始数据转换成带有结构化意义的数据。

传统机器学习中的例子:

图片 → cat / dog
文本 → positive / negative
句子 → entity spans
语音 → transcript

LLM 场景中的标注更加复杂,例如:

  • 判断回答是否事实正确
  • A/B 比较哪个回答更好
  • 标记安全风险
  • 为代码任务写参考解
  • 标注工具调用参数是否正确
  • 对 Agent trace 进行失败分类
  • 修改一个较差答案成为 ideal answer

所以现代 LLM 数据标注经常已经不是“打标签”,而是执行复杂 rubric 的判断工作。

什么是 Human Data

Human Data 可以理解为:

为训练、对齐、评测或产品改进而产生的人类判断与示范数据。

它可能包括:

Demonstration Data

人直接给出理想输出:

Instruction
    ↓
Human Ideal Answer

常见于 SFT 数据。

Preference Data

比较候选输出:

Answer A
Answer B
    ↓
A preferred / B preferred / tie

Critique / Reason Data

不仅给标签,还解释:

  • 哪里错
  • 为什么错
  • 缺什么
  • 哪个规则被违反

Evaluation Labels

为评测集产生:

  • pass / fail
  • 0 / 1 / 2
  • severity
  • failure type
  • confidence
  • escalation reason

因此“Human Data”比“Annotation”覆盖面更大。

Annotation 与 Training Data 的关系

标注数据可能被用于训练:

Raw Data
   ↓
Annotation / Curation
   ↓
Training Dataset
   ↓
SFT / Preference Optimization / Other Training

此时目标是:

让模型从这些样本中学习行为。

关键关注点包括:

  • 数据质量
  • 覆盖度
  • 一致性
  • 偏差
  • 许可与隐私
  • train / validation / test 隔离

Annotation 与 Evaluation Data 的关系

同样的人工判断,也可能用于评测:

Eval Case
   ↓
Model Output
   ↓
Human Annotation
   ↓
Evaluation Result

此时目标不是训练模型,而是:

测量当前系统是否满足标准。

最重要的区别是用途。

对比项 Training / Alignment Data Evaluation Data
主要目的 改变模型行为 测量系统行为
是否给模型学习 是 原则上不应
是否需要冻结 训练集可演化 正式 eval 需要版本冻结
数据泄漏风险 训练数据质量问题 eval contamination 会使结果失真
核心问题 “模型应该学什么?” “系统现在做得怎么样?”

数据标注与 Evaluation 为什么经常混在一个岗位里

因为 Evaluation 的很多 grader 最初需要人来执行。

例如:

Case
  ↓
Output
  ↓
Human reads rubric
  ↓
Pass / Fail + Reason

所以评测体系建设往往经历:

人工判断
   ↓
发现规则歧义
   ↓
修 rubric
   ↓
建立稳定人工基准
   ↓
规则自动化 / LLM Judge

因此,人工标注不是 Evaluation 的低级阶段。

它承担两个关键职责:

  1. 帮助定义“什么叫正确”;
  2. 校准自动 grader 是否可信。

数据清洗、数据治理、数据标注有什么区别

Data Cleaning

处理数据本身的技术质量:

  • 编码问题
  • 格式错误
  • 空值
  • 重复
  • 乱码
  • 非法字段

Data Curation

围绕使用目的选择和组织数据:

  • 选哪些来源
  • 去掉哪些低质量数据
  • 控制分布
  • 去重
  • 记录来源与许可
  • 处理 PII

NVIDIA NeMo Curator 将清洗、过滤、去重、PII 处理等视为可重复的数据整理流程。[1]

Annotation

给数据增加人工或机器产生的结构化判断:

  • 标签
  • preference
  • rationale
  • reference
  • failure type

Data Governance

保证数据资产可管理:

  • 来源
  • 许可
  • 访问权限
  • PII
  • 版本
  • lineage
  • retention

Hugging Face 的 Dataset Card 也强调记录数据内容、使用语境、创建方式、许可和潜在偏差。[2]

数据标注质量为什么难

传统分类任务可能有明确答案:

spam / not spam

LLM 场景常常存在:

  • 多个正确答案
  • 部分正确
  • 风格与事实混杂
  • 边界情况
  • 规则冲突
  • 领域专业判断
  • 安全风险

因此高质量标注依赖:

Task Definition
      ↓
Rubric
      ↓
Examples / Counterexamples
      ↓
Calibration
      ↓
Disagreement Analysis
      ↓
Guideline Revision

真正重要的不是:

标了多少条

而是:

不同标注者能否依据同一规则得到稳定判断

对程序员而言最值得迁移的能力

如果已有开发经验,最有价值的不是追求纯人工标注吞吐量,而是向以下方向升级:

  • Dataset / Schema validation
  • Rubric 设计
  • Label consistency 分析
  • Failure taxonomy
  • Eval harness
  • Agent trace evaluation
  • LLM Judge calibration
  • Regression suite
  • CI quality gate
  • Data lineage / versioning

也就是:

把人工判断变成可复现、可审计、可自动化的质量系统。

参考资料

[1] NVIDIA, NeMo Curator / LLM dataset curation
https://developer.nvidia.com/blog/curating-custom-datasets-for-llm-training-with-nvidia-nemo-curator/

[2] Hugging Face, Dataset Cards
https://huggingface.co/docs/hub/datasets-cards