Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/02-Human-Evaluation.md
T

26 KiB
Raw Blame History

type, tags, status, created, source
type tags status created source
reference
llm-evaluation
evaluation-guidebook
human-evaluation
active 2026-08-21 https://github.com/huggingface/evaluation-guidebook

人工评测(Human Evaluation

来源:HuggingFace LLM Evaluation Guidebook — Human Evaluation 章节提炼 原文章节:basics / using-human-annotators / tips-and-tricks 本笔记为提炼式笔记(非逐字翻译),覆盖原文核心概念、实操建议与经验教训。

三篇原文的关系(阅读地图):

  1. basics.md —— 概念层:什么是人工评测、三种系统化方式、两种非正式方式、优缺点。
  2. using-human-annotators.md —— 组织层:如何选择、付费、培训、质量控制标注者。
  3. tips-and-tricks.md —— 实操层:任务设计、标注过程中的注意事项、人机混合标注与端到端教程。

原文建议的阅读顺序:先读 using-human-annotators,再读 tips-and-tricks

什么是人工评测

人工评测(human evaluation 的定义非常简单:让人类来评估模型。与用另一个模型来打分的 LLM-as-a-judge 路线不同,人工评测以人类判断为最终裁判。

本文档聚焦于**事后评测(post-hoc evaluation**这一场景:

  • 模型已经训练完成;
  • 你心里有一个明确的任务(given task);
  • 人类为模型的输出提供分数。

也就是说,这里不涉及训练过程中的即时反馈,而是模型成型之后、针对特定任务的能力度量。

系统化评测:三种主要方式

原文把系统化人工评测归纳为三种方式,区别在于你手上已经拥有什么资源(数据集、分数):

场景 你提供什么 人类做什么 示例
① 无数据集 一个任务 + 评分指南(scoring guidelines+ 一个(或多个)可交互的模型 与模型交互后,给出分数和推理(reasoning 「试着让这两个模型输出有毒语言;模型有毒得 0 分,无毒得 1 分」
② 已有数据集 用数据集中的 prompt 去问模型,然后把 prompt + 模型输出 + 评分指南 一起交给标注者 按指南对每条输出打分 「模型若回答了隐私信息得 0 分,否则得 1 分」
③ 已有数据集 + 已有分数 你已有的评测方法、数据集和分数 error annotation(错误标注/错误审查),审查评测方法本身是否合理

第三种方式需要特别说明:

  • error annotation 是检验一个新评测系统时非常重要的一步。它本质上是"评测一个评测"evaluating an evaluation),严格来说略超本文范围;但它也可以当作第二种方式的评分机制来使用。
  • 参考阅读:Error Annotations to EvaluateEhud Reiter 的博客,解释了如何用错误标注来评估评测系统)。

两个补充说明(Notes):

  • 对于已部署的生产模型,也可以直接收集用户反馈,并在此基础上做 A/B 测试(不需要专门组织标注团队)。
  • AI audits外部系统化评测,即对模型的外部系统性审查)通常基于人类判断,也属于人工评测范畴,但不在本文档范围内。

三种方式的选型速记

  • 探索一组能力、还没有现成数据 → 用方式①,给人类一个任务和评分指南,让他们自由与模型交互。
  • 想确认模型在特定输入上不会出错(如"不该回答的 prompt")→ 用方式②,把 prompt、输出、指南一起给标注者。
  • 验证新评测方法是否靠谱 → 用方式③,让人类对已有分数做 error annotation。

非正式评测(Casual Evaluation

除了系统化评测,还有两种更随意的、同样基于人类的评测方式。

Vibes-checks(氛围检查/体感评测)

  • 定义:由个人完成的手动评测,通常使用未公开的 promptundisclosed prompts,以获得对模型在大量用例上表现的整体感受——用例范围从写代码到"小黄文质量(quality of smut written"这种五花八门的场景。
  • 传播方式:结果经常被分享到 Twitter 和 Reddit 上。
  • 本质局限:这些结果大多构成轶事证据(anecdotal evidence,并且高度敏感于确认偏误(confirmation bias——换句话说,人们往往会找到他们想找的东西
  • 价值定位:尽管证据强度低,它仍然可以作为你自己用例的良好起点(例如用别人的 vibes-check 结果来挑选值得深入测试的模型方向)。
  • 参考:Vibe Checks Are All You Need

Arenas(竞技场)与 Elo 排名

  • 定义众包式人工评测(crowdsourced human evaluation,目的是给模型排名。
  • 典型例子LMSYS chatbot arena:社区用户被邀请与模型聊天,直到判断出某个模型比另一个更好。
  • 机制:投票被聚合进 Elo 排名(Elo ranking——一种基于对局/两两比较(matches)的排名系统——用来选出"最好的"模型。
  • 特点:把"哪个更好"的主观判断拆解成大量成对比较,再通过 Elo 算法聚合成全局排名,是社区评测模型的主流玩法。

人工评测的优缺点

总体优点(为什么值得做人工评测)

  • 灵活性(Flexibility:只要你能把"在评测什么"定义得足够清楚,几乎任何东西都能得到分数——从安全性到写作质量到特定领域知识。
  • 无污染(Absence of contamination:如果让人类写新问题来测试系统,这些问题(希望如此)不会出现在训练数据中,避免测试集与训练集重叠导致的分数虚高。
  • 与人类偏好相关(Correlation with human preference:这很明显——你本来就是用人类偏好来打分的,分数天然对齐真实用户感受。
    • ⚠️ 注意:用人类做评测时,必须确保你的 annotators(标注者)足够多样化,否则结果无法泛化到更广泛的人群。

总体缺点:四类人类偏见

偏见 含义 关键细节 出处
First impressions bias(首因效应) 人类评估者倾向于基于第一印象估计答案质量,而不是基于实际的事实性或忠实性(factuality / faithfulness 第一印象好(如文笔流畅)的答案可能获得虚高评分 2309.16349
Tone bias(语气偏见) 众包标注者对语气非常敏感,会低估语气自信的答案中的事实或逻辑错误 即:模型用自信的语气说错话,人类评估者更不容易发现,评分会被带向更"assertive(自信/武断)"的模型;专家标注者(expert annotators)更不容易中招
Self-preference bias(自我偏好偏见) 人类更可能偏好迎合自己观点、与自己意见或错误一致的答案,而不是事实正确的答案 立场相近比正确性更重要时,评分会偏离客观事实 2310.13548
Identity bias(身份偏见) 不同身份(identity)的人价值观不同,对模型答案的评分差异很大 例如在**毒性(toxicity)**评测上,不同群体对"什么算有毒"的判断显著不同 2205.00501

应对思路(源自原文):tone bias 等偏见对专家标注者影响更小,因此在关键评测中考虑使用受过训练的/领域专家标注者;同时保持标注者群体的多样性以支撑结果泛化。

系统化人工评测的优缺点

优点(尤其在使用付费标注者时):

  • 获得高质量数据(high quality data:得到适合你用例的高质量数据,之后可以继续在此基础上构建——例如开发 preference models(偏好模型) 时作为训练信号。
  • 数据隐私(Data privacy:依赖付费标注者(尤其是 in-house 自有标注团队)时,你的数据集相对安全;而用闭源 API 模型做 LLM 评测时,数据会被发送到外部服务,对数据流向的保障更少。
  • 可解释性(Explainability:模型得到的分数,可以由标注它的人类来解释——这是纯模型评测很难提供的。

缺点:

  • 成本(Cost:如果正确地给标注者付酬,成本会很快升高;而且很可能需要多轮迭代评测iterative evaluation)来打磨指南,进一步增加成本。
  • 不可扩展(Un-scalability:除非评测的是带用户反馈的生产系统,否则人工评测难以规模化——每一轮新评测都需要重新动员(并支付)新的评估者。
  • 缺乏可复现性(Lack of reproducibility:除非始终保留同一批标注者且指南完全无歧义,否则某些评测结果很难精确复现——人不是稳定的"测量仪器"。

非正式评测的优缺点

优点:

  • 成本更低(Lesser cost:依赖社区人群的善意(crowd's good will),不需要付酬。
  • 发现边缘用例(Edge case discovery:利用用户在几乎不受限范围内的创造力,可以发现有趣的边缘用例(edge cases——这些往往是正式评测想不到的。
  • 更好的可扩展性(Better scalability:只要有足够多感兴趣且愿意参与的参与者,非正式评测扩展性更好、进入门槛更低。

缺点(不进行标注者筛选时):

  • 高度主观(High subjectivity:用宽泛的指南让大量社区成员保持一致的评分非常困难,因为标注者的偏好往往是文化绑定的(culturally bound2404.16019)。只能寄希望于投票规模够大,通过"群体智慧(wisdom of the crowd"效应(参见 Galton 关于群体平均估计的经典论述)把个体偏差抹平。
  • 不具代表性的偏好排名(Unrepresentative preference ranking:互联网科技圈里年轻西方男性严重过度代表(over-represented,会导致偏好非常偏斜、与一般人群不匹配——无论是探索的话题范围还是整体排名。
  • 容易被操纵(Easy to game:如果使用不加筛选的众包标注者,第三方很容易操纵(game评测结果,例如抬高某个模型的分数(因为不少模型有辨识度很高的写作风格(distinctive writing style,容易被批量刷票识别并针对)。

系统化 vs 非正式:一张表对比

维度 系统化人工评测 非正式评测(vibes-check / arena
标注者 付费、可筛选(人口学、质量) 社区志愿者,不筛选
成本 高(付酬 + 迭代) 低(依赖善意)
可扩展性 差(每轮重新动员) 好(参与者多)
数据质量 高、贴合用例 高主观性、质量参差
数据隐私 好(in-house 更佳) 公开传播
代表性 可通过筛选控制 偏向特定人群(年轻西方男性)
可操纵性 高(易被刷票)
可复现性 中等(取决于标注者与指南)

基于原文优缺点的决策指引:

  • 要严谨的评测结论、要沉淀高质量数据(如为偏好模型积累训练信号)→ 走系统化人工评测:筛选标注者、认真写指南、付费、迭代、用 IAA 把关。
  • 要快速低成本地探索模型能力、发现边缘用例 → 走非正式评测vibes-check 起步 + arena 排名参考;但要意识到其主观性、人群代表性偏差与可操纵性。
  • 已有生产系统 → 优先考虑用户反馈 + A/B 测试,而不是专门组织一轮人工评测。
  • 新评测方法上线前 → 一定要补一轮 error annotation,让人类审查"评测本身是否合理"。
  • 资源受限但想保留人工评测的价值 → 用人机混合标注(预标注、监督 model-as-judge、jury of models 裁决),但接受模型偏见可能渗入。

如何使用人工标注者(Using Human Annotators

总纲:建议先阅读 数据标注质量良好实践综述第 3 节(该综述汇总了 2023 年以来的相关论文)。如果你追求生产级质量、并且有能力实施其中所有方法,尽管去做!

配套示意图:Best annotation practices

无论项目规模大小,在定义好任务和评分指南之后,以下都是重要的指导原则:

1. 标注者选择与报酬(Workforce selection & monetary incentive

你希望做任务的人满足以下条件:

  1. 人口学条件(demographics——例如:目标语言的母语者更高的教育水平、特定领域的专家地理来源多样化等。具体需求因任务而异。
  2. 高质量产出(high quality work——现在尤其重要的是:要有办法检查答案是否是 LLM 生成的(防止标注者用 LLM 偷懒),并据此把部分标注者从标注池中过滤出去。

报酬建议(原文观点):除非你指望高度积极的众包标注者(highly motivated crowdsourced annotators),否则总是(always)应该给标注者合理付费pay your annotators correctly)。 合理付酬既是质量保障,也是"系统化评测成本高"这一缺点的来源——两者是同一枚硬币的两面。

2. 指南编写(Guideline design

  • 一定要花大量时间认真头脑风暴你的指南(guidelines)——这是整个流程里最容易低估的工作量。
  • 原文作者自述:这是他们构建 GAIA 数据集时花费时间最多的环节之一

3. 迭代式标注(Iterative annotation

  • 准备好进行多轮标注(several rounds of annotations:你的标注者一定会误解你的指南——它们比你想象的更有歧义!
  • 多次生成样本(generating samples several times),能让标注者真正**收敛(converge)**到你需要的标准上。

4. 质量评估与人工筛选(Quality estimation & Manual curation

  • 控制答案质量:尤其可以通过 inter-annotator agreement(标注者间一致性,IAA 来度量——如果不同标注者对同一条数据的判断差异很大,说明指南或任务有问题。
  • 最终人工筛选(manual curation:做最后一道选择,只保留最高质量/最相关的答案。

5. 专业工具

  • 构建高质量标注数据集的专用工具可以显著提效,例如 Argilla

延伸阅读(Going further

Tips and Tricks(实操技巧)

本页是使用人工标注者构建评测数据集时的实用建议清单。原文建议:如果还没读过「Using human annotators」一节,先读那节再回到本页(推荐阅读顺序)。

任务设计(Designing the task

技巧 要点 展开
Simple is better(简单为佳) 标注任务容易变得不必要地复杂,尽量保持简单 把标注者的认知负荷(cognitive load降到最低,有助于他们保持专注、产出更高质量的标注
Check what you show(检查展示内容) 只展示标注者完成任务所需的信息 确保不包含任何可能引入额外偏见的内容(多余的信息本身就是偏见源)
Consider your annotators' time(考虑标注者的时间) 内容的位置和展示方式会影响工作量与认知负荷,进而影响结果质量 例:确保文本和任务同时可见、避免不必要的滚动;如果任务间有依赖(一个任务的结果会影响另一个),可以顺序展示。最后:审视标注工具里的一切展示方式,看能否进一步简化
Test the setup(测试设置) 任务设计和指南就绪后,先在几个样本上自己测试 再让整个团队参与,并按需迭代(iterate

标注过程中(During the annotation

  • 标注者应独立工作(work independently
    • 标注者之间最好不要互相帮助、也不要看到彼此的工作——否则会传播各自的偏见,导致 annotation drift(标注漂移)
    • 对齐(alignment)应始终通过全面的指南来实现,而不是通过标注者之间的口头沟通。
    • 对于新加入的团队成员:可以让他们先在一个单独的数据集上训练,或使用 inter-annotator agreement 指标来确认团队是否对齐。
  • 一致性是关键(Consistency is key
    • 如果对指南做了重要修改(例如改了一个定义或指令、增删了标签),要考虑是否需要对已标注数据重新迭代
    • 至少要在数据集中通过元数据值(如 guidelines-v1追踪指南的版本变更,否则历史标注无法解释。

人机混合标注(Hybrid human-machine annotation

背景:有些团队在时间和资源上受限,但不想牺牲人工评测的优点。此时可以用模型来帮忙提高效率——本质是在"纯人工"与"纯模型"之间取折中。

方法 做法 注意点
Model-aided annotation(模型辅助标注) 用模型的预测或生成结果作为预标注(pre-annotations,让标注团队不必从零开始 ① 可能把模型的偏见引入人类标注;② 如果模型准确率差,反而增加标注者的工作量
Supervise model-as-a-judge(监督模型裁判) 结合 "model as a judge" 方法(见该章节)与人类监督者,由人类验证或丢弃模型裁判的结果 "人工评测的优缺点"一节讨论的人类偏见在这里同样适用
Identify edge cases(识别边缘用例) 用**一组模型(jury of models做评判,然后由人类监督者在模型意见分歧或平局(tie)**时介入裁决 再次提醒:注意 "Pros and cons of human evaluation" 中讨论的人类偏见

三者的共同逻辑:让模型做"体力活",让人类只做"关键判断"——人类介入越少越快,但人类偏见始终存在,需要纳入设计考量。

端到端教程(End-to-end tutorial

  • 想按这些技巧搭建自己的定制评测设置,可参考 Argilla 的实用教程argilla-cookbookdomain-eval 目录)。
  • 教程流程概要:
    1. 从**领域文档(domain documents**出发;
    2. 使用合成数据(synthetic data + 人工评测(借助 Argilla 标注与 distilabel 数据管道);
    3. 产出一个定制评测任务(custom evaluation task
    4. 最终用 lighteval 来评测你自己的模型。

术语对照表(均出自原文)

英文术语 中文译名 / 说明
human evaluation 人工评测:让人类评估模型
post-hoc evaluation 事后评测:模型训练完成后、针对既定任务的评测
scoring guidelines 评分指南:交给标注者的打分规则
error annotation 错误标注/错误审查:用人类审查评测方法本身
vibes-check 氛围检查/体感评测:个人对模型整体感受的随性评测
arena 竞技场:众包式两两比较评测
Elo ranking Elo 排名:基于对局(matches)聚合的排名系统
annotator 标注者:执行打分/标注任务的人
inter-annotator agreementIAA 标注者间一致性:衡量不同标注者判断一致程度的指标
annotation drift 标注漂移:标注者互相影响导致标准逐渐偏离
first impressions bias 首因效应:基于第一印象而非事实性评分
tone bias 语气偏见:低估语气自信答案中的事实/逻辑错误
self-preference bias 自我偏好偏见:偏好与自己观点一致的答案
identity bias 身份偏见:不同身份群体评分差异大
confirmation bias 确认偏误:人们倾向于找到自己想找的东西
wisdom of the crowd 群体智慧:大量投票平均抹平个体偏差的效应
culturally bound preferences 文化绑定的偏好:标注者偏好受文化背景影响
model-aided annotation 模型辅助标注:用模型输出做预标注
pre-annotations 预标注:标注团队在其基础上修正的初始标注
model-as-a-judge 模型裁判:用模型来评判模型(另见该章节)
jury of models 模型评审团:多模型投票,人类在分歧/平局时裁决
preference model 偏好模型:以人类偏好为训练信号训练的模型
cognitive load 认知负荷:标注者完成任务所需的脑力开销
crowdcrowdsourced 众包/社区人群:非付费、未筛选的参与者

核心要点速记

  • 人工评测 = 让人类给模型打分(事后评测视角);适合追求数据质量、隐私、可解释性的场景。
  • 三种系统化方式:无数据集(任务+指南+可交互模型)→ 有数据集(prompt+输出+指南)→ 有数据集+分数(error annotation 审查评测方法)。
  • 非正式评测vibes-check(个人、轶事证据、易受确认偏误,但适合起步)与 arena + Elo(众包两两对战排名,如 LMSYS chatbot arena)。
  • 四大人为偏见first impressions bias / tone bias / self-preference bias / identity bias专家标注者更不易中招
  • 用标注者的流程:选人(人口学 + 质量过滤 + LLM 生成检测)→ 认真写指南 → 迭代多轮 → 用 inter-annotator agreement 控制质量并人工筛选;务必给标注者合理付费
  • 实操技巧:任务越简单越好、只展示必要信息、考虑标注者时间、先自测;标注者独立工作、指南变更用 guidelines-v1 类元数据追踪;人机混合标注(预标注、监督 model-as-judge、jury of models 裁决平局)可提效,但小心偏见引入
  • 选择路线:要严谨、可复现、要数据 → 系统化人工评测;要快、要省、要发现边缘用例 → 非正式评测。

参考资料

原文 GitHub 链接(Human Evaluation 章节)

文中提到的外部链接

博客 / 文章

论文(arXiv / ACL

平台 / 工具