26 KiB
type, tags, status, created, source
| type | tags | status | created | source | |||
|---|---|---|---|---|---|---|---|
| reference |
|
active | 2026-08-21 | https://github.com/huggingface/evaluation-guidebook |
人工评测(Human Evaluation)
来源:HuggingFace LLM Evaluation Guidebook — Human Evaluation 章节提炼 原文章节:basics / using-human-annotators / tips-and-tricks 本笔记为提炼式笔记(非逐字翻译),覆盖原文核心概念、实操建议与经验教训。
三篇原文的关系(阅读地图):
basics.md—— 概念层:什么是人工评测、三种系统化方式、两种非正式方式、优缺点。using-human-annotators.md—— 组织层:如何选择、付费、培训、质量控制标注者。tips-and-tricks.md—— 实操层:任务设计、标注过程中的注意事项、人机混合标注与端到端教程。
原文建议的阅读顺序:先读
using-human-annotators,再读tips-and-tricks。
什么是人工评测
人工评测(human evaluation) 的定义非常简单:让人类来评估模型。与用另一个模型来打分的 LLM-as-a-judge 路线不同,人工评测以人类判断为最终裁判。
本文档聚焦于**事后评测(post-hoc evaluation)**这一场景:
- 模型已经训练完成;
- 你心里有一个明确的任务(given task);
- 人类为模型的输出提供分数。
也就是说,这里不涉及训练过程中的即时反馈,而是模型成型之后、针对特定任务的能力度量。
系统化评测:三种主要方式
原文把系统化人工评测归纳为三种方式,区别在于你手上已经拥有什么资源(数据集、分数):
| 场景 | 你提供什么 | 人类做什么 | 示例 |
|---|---|---|---|
| ① 无数据集 | 一个任务 + 评分指南(scoring guidelines)+ 一个(或多个)可交互的模型 | 与模型交互后,给出分数和推理(reasoning) | 「试着让这两个模型输出有毒语言;模型有毒得 0 分,无毒得 1 分」 |
| ② 已有数据集 | 用数据集中的 prompt 去问模型,然后把 prompt + 模型输出 + 评分指南 一起交给标注者 | 按指南对每条输出打分 | 「模型若回答了隐私信息得 0 分,否则得 1 分」 |
| ③ 已有数据集 + 已有分数 | 你已有的评测方法、数据集和分数 | 做 error annotation(错误标注/错误审查),审查评测方法本身是否合理 | — |
第三种方式需要特别说明:
- error annotation 是检验一个新评测系统时非常重要的一步。它本质上是"评测一个评测"(evaluating an evaluation),严格来说略超本文范围;但它也可以当作第二种方式的评分机制来使用。
- 参考阅读:Error Annotations to Evaluate(Ehud Reiter 的博客,解释了如何用错误标注来评估评测系统)。
两个补充说明(Notes):
- 对于已部署的生产模型,也可以直接收集用户反馈,并在此基础上做 A/B 测试(不需要专门组织标注团队)。
- AI audits(外部系统化评测,即对模型的外部系统性审查)通常基于人类判断,也属于人工评测范畴,但不在本文档范围内。
三种方式的选型速记
- 想探索一组能力、还没有现成数据 → 用方式①,给人类一个任务和评分指南,让他们自由与模型交互。
- 想确认模型在特定输入上不会出错(如"不该回答的 prompt")→ 用方式②,把 prompt、输出、指南一起给标注者。
- 想验证新评测方法是否靠谱 → 用方式③,让人类对已有分数做 error annotation。
非正式评测(Casual Evaluation)
除了系统化评测,还有两种更随意的、同样基于人类的评测方式。
Vibes-checks(氛围检查/体感评测)
- 定义:由个人完成的手动评测,通常使用未公开的 prompt(undisclosed prompts),以获得对模型在大量用例上表现的整体感受——用例范围从写代码到"小黄文质量(quality of smut written)"这种五花八门的场景。
- 传播方式:结果经常被分享到 Twitter 和 Reddit 上。
- 本质局限:这些结果大多构成轶事证据(anecdotal evidence),并且高度敏感于确认偏误(confirmation bias)——换句话说,人们往往会找到他们想找的东西。
- 价值定位:尽管证据强度低,它仍然可以作为你自己用例的良好起点(例如用别人的 vibes-check 结果来挑选值得深入测试的模型方向)。
- 参考:Vibe Checks Are All You Need
Arenas(竞技场)与 Elo 排名
- 定义:众包式人工评测(crowdsourced human evaluation),目的是给模型排名。
- 典型例子:LMSYS chatbot arena:社区用户被邀请与模型聊天,直到判断出某个模型比另一个更好。
- 机制:投票被聚合进 Elo 排名(Elo ranking)——一种基于对局/两两比较(matches)的排名系统——用来选出"最好的"模型。
- 特点:把"哪个更好"的主观判断拆解成大量成对比较,再通过 Elo 算法聚合成全局排名,是社区评测模型的主流玩法。
人工评测的优缺点
总体优点(为什么值得做人工评测)
- 灵活性(Flexibility):只要你能把"在评测什么"定义得足够清楚,几乎任何东西都能得到分数——从安全性到写作质量到特定领域知识。
- 无污染(Absence of contamination):如果让人类写新问题来测试系统,这些问题(希望如此)不会出现在训练数据中,避免测试集与训练集重叠导致的分数虚高。
- 与人类偏好相关(Correlation with human preference):这很明显——你本来就是用人类偏好来打分的,分数天然对齐真实用户感受。
- ⚠️ 注意:用人类做评测时,必须确保你的 annotators(标注者)足够多样化,否则结果无法泛化到更广泛的人群。
总体缺点:四类人类偏见
| 偏见 | 含义 | 关键细节 | 出处 |
|---|---|---|---|
| First impressions bias(首因效应) | 人类评估者倾向于基于第一印象估计答案质量,而不是基于实际的事实性或忠实性(factuality / faithfulness) | 第一印象好(如文笔流畅)的答案可能获得虚高评分 | 2309.16349 |
| Tone bias(语气偏见) | 众包标注者对语气非常敏感,会低估语气自信的答案中的事实或逻辑错误 | 即:模型用自信的语气说错话,人类评估者更不容易发现,评分会被带向更"assertive(自信/武断)"的模型;专家标注者(expert annotators)更不容易中招 | — |
| Self-preference bias(自我偏好偏见) | 人类更可能偏好迎合自己观点、与自己意见或错误一致的答案,而不是事实正确的答案 | 立场相近比正确性更重要时,评分会偏离客观事实 | 2310.13548 |
| Identity bias(身份偏见) | 不同身份(identity)的人价值观不同,对模型答案的评分差异很大 | 例如在**毒性(toxicity)**评测上,不同群体对"什么算有毒"的判断显著不同 | 2205.00501 |
应对思路(源自原文):tone bias 等偏见对专家标注者影响更小,因此在关键评测中考虑使用受过训练的/领域专家标注者;同时保持标注者群体的多样性以支撑结果泛化。
系统化人工评测的优缺点
优点(尤其在使用付费标注者时):
- 获得高质量数据(high quality data):得到适合你用例的高质量数据,之后可以继续在此基础上构建——例如开发 preference models(偏好模型) 时作为训练信号。
- 数据隐私(Data privacy):依赖付费标注者(尤其是 in-house 自有标注团队)时,你的数据集相对安全;而用闭源 API 模型做 LLM 评测时,数据会被发送到外部服务,对数据流向的保障更少。
- 可解释性(Explainability):模型得到的分数,可以由标注它的人类来解释——这是纯模型评测很难提供的。
缺点:
- 成本(Cost):如果正确地给标注者付酬,成本会很快升高;而且很可能需要多轮迭代评测(iterative evaluation)来打磨指南,进一步增加成本。
- 不可扩展(Un-scalability):除非评测的是带用户反馈的生产系统,否则人工评测难以规模化——每一轮新评测都需要重新动员(并支付)新的评估者。
- 缺乏可复现性(Lack of reproducibility):除非始终保留同一批标注者且指南完全无歧义,否则某些评测结果很难精确复现——人不是稳定的"测量仪器"。
非正式评测的优缺点
优点:
- 成本更低(Lesser cost):依赖社区人群的善意(crowd's good will),不需要付酬。
- 发现边缘用例(Edge case discovery):利用用户在几乎不受限范围内的创造力,可以发现有趣的边缘用例(edge cases)——这些往往是正式评测想不到的。
- 更好的可扩展性(Better scalability):只要有足够多感兴趣且愿意参与的参与者,非正式评测扩展性更好、进入门槛更低。
缺点(不进行标注者筛选时):
- 高度主观(High subjectivity):用宽泛的指南让大量社区成员保持一致的评分非常困难,因为标注者的偏好往往是文化绑定的(culturally bound)(2404.16019)。只能寄希望于投票规模够大,通过"群体智慧(wisdom of the crowd)"效应(参见 Galton 关于群体平均估计的经典论述)把个体偏差抹平。
- 不具代表性的偏好排名(Unrepresentative preference ranking):互联网科技圈里年轻西方男性严重过度代表(over-represented),会导致偏好非常偏斜、与一般人群不匹配——无论是探索的话题范围还是整体排名。
- 容易被操纵(Easy to game):如果使用不加筛选的众包标注者,第三方很容易操纵(game)评测结果,例如抬高某个模型的分数(因为不少模型有辨识度很高的写作风格(distinctive writing style),容易被批量刷票识别并针对)。
系统化 vs 非正式:一张表对比
| 维度 | 系统化人工评测 | 非正式评测(vibes-check / arena) |
|---|---|---|
| 标注者 | 付费、可筛选(人口学、质量) | 社区志愿者,不筛选 |
| 成本 | 高(付酬 + 迭代) | 低(依赖善意) |
| 可扩展性 | 差(每轮重新动员) | 好(参与者多) |
| 数据质量 | 高、贴合用例 | 高主观性、质量参差 |
| 数据隐私 | 好(in-house 更佳) | 公开传播 |
| 代表性 | 可通过筛选控制 | 偏向特定人群(年轻西方男性) |
| 可操纵性 | 低 | 高(易被刷票) |
| 可复现性 | 中等(取决于标注者与指南) | 差 |
基于原文优缺点的决策指引:
- 要严谨的评测结论、要沉淀高质量数据(如为偏好模型积累训练信号)→ 走系统化人工评测:筛选标注者、认真写指南、付费、迭代、用 IAA 把关。
- 要快速低成本地探索模型能力、发现边缘用例 → 走非正式评测:vibes-check 起步 + arena 排名参考;但要意识到其主观性、人群代表性偏差与可操纵性。
- 已有生产系统 → 优先考虑用户反馈 + A/B 测试,而不是专门组织一轮人工评测。
- 新评测方法上线前 → 一定要补一轮 error annotation,让人类审查"评测本身是否合理"。
- 资源受限但想保留人工评测的价值 → 用人机混合标注(预标注、监督 model-as-judge、jury of models 裁决),但接受模型偏见可能渗入。
如何使用人工标注者(Using Human Annotators)
总纲:建议先阅读 数据标注质量良好实践综述 的 第 3 节(该综述汇总了 2023 年以来的相关论文)。如果你追求生产级质量、并且有能力实施其中所有方法,尽管去做!
无论项目规模大小,在定义好任务和评分指南之后,以下都是重要的指导原则:
1. 标注者选择与报酬(Workforce selection & monetary incentive)
你希望做任务的人满足以下条件:
- 人口学条件(demographics)——例如:目标语言的母语者、更高的教育水平、特定领域的专家、地理来源多样化等。具体需求因任务而异。
- 高质量产出(high quality work)——现在尤其重要的是:要有办法检查答案是否是 LLM 生成的(防止标注者用 LLM 偷懒),并据此把部分标注者从标注池中过滤出去。
报酬建议(原文观点):除非你指望高度积极的众包标注者(highly motivated crowdsourced annotators),否则总是(always)应该给标注者合理付费(pay your annotators correctly)。 合理付酬既是质量保障,也是"系统化评测成本高"这一缺点的来源——两者是同一枚硬币的两面。
2. 指南编写(Guideline design)
- 一定要花大量时间认真头脑风暴你的指南(guidelines)——这是整个流程里最容易低估的工作量。
- 原文作者自述:这是他们构建 GAIA 数据集时花费时间最多的环节之一。
3. 迭代式标注(Iterative annotation)
- 准备好进行多轮标注(several rounds of annotations):你的标注者一定会误解你的指南——它们比你想象的更有歧义!
- 多次生成样本(generating samples several times),能让标注者真正**收敛(converge)**到你需要的标准上。
4. 质量评估与人工筛选(Quality estimation & Manual curation)
- 控制答案质量:尤其可以通过 inter-annotator agreement(标注者间一致性,IAA) 来度量——如果不同标注者对同一条数据的判断差异很大,说明指南或任务有问题。
- 最终人工筛选(manual curation):做最后一道选择,只保留最高质量/最相关的答案。
5. 专业工具
- 构建高质量标注数据集的专用工具可以显著提效,例如 Argilla。
延伸阅读(Going further)
- ⭐ How to set up your own annotator platform in a couple minutes(作者 Moritz Laurer):不错的实操入门,用开源工具(如 Argilla 和 Hugging Face)亲手搭建自己的标注平台,理解大规模人工标注的 do's and don'ts。
- ⭐ A guide on annotation good practices:对 2023 年以来所有人工标注相关论文的综述,非常完整。稍显密集,但非常易懂。
- Another guide on annotation good practices(ScaleAI,专精人工评测方向):上面文档的更轻量补充。
- Assumptions and Challenges of Capturing Human Labels:论文,讲如何看待标注者分歧(annotator disagreement)的来源并在实践中缓解。
Tips and Tricks(实操技巧)
本页是使用人工标注者构建评测数据集时的实用建议清单。原文建议:如果还没读过「Using human annotators」一节,先读那节再回到本页(推荐阅读顺序)。
任务设计(Designing the task)
| 技巧 | 要点 | 展开 |
|---|---|---|
| Simple is better(简单为佳) | 标注任务容易变得不必要地复杂,尽量保持简单 | 把标注者的认知负荷(cognitive load)降到最低,有助于他们保持专注、产出更高质量的标注 |
| Check what you show(检查展示内容) | 只展示标注者完成任务所需的信息 | 确保不包含任何可能引入额外偏见的内容(多余的信息本身就是偏见源) |
| Consider your annotators' time(考虑标注者的时间) | 内容的位置和展示方式会影响工作量与认知负荷,进而影响结果质量 | 例:确保文本和任务同时可见、避免不必要的滚动;如果任务间有依赖(一个任务的结果会影响另一个),可以顺序展示。最后:审视标注工具里的一切展示方式,看能否进一步简化 |
| Test the setup(测试设置) | 任务设计和指南就绪后,先在几个样本上自己测试 | 再让整个团队参与,并按需迭代(iterate) |
标注过程中(During the annotation)
- 标注者应独立工作(work independently):
- 标注者之间最好不要互相帮助、也不要看到彼此的工作——否则会传播各自的偏见,导致 annotation drift(标注漂移)。
- 对齐(alignment)应始终通过全面的指南来实现,而不是通过标注者之间的口头沟通。
- 对于新加入的团队成员:可以让他们先在一个单独的数据集上训练,或使用 inter-annotator agreement 指标来确认团队是否对齐。
- 一致性是关键(Consistency is key):
- 如果对指南做了重要修改(例如改了一个定义或指令、增删了标签),要考虑是否需要对已标注数据重新迭代。
- 至少要在数据集中通过元数据值(如
guidelines-v1)追踪指南的版本变更,否则历史标注无法解释。
人机混合标注(Hybrid human-machine annotation)
背景:有些团队在时间和资源上受限,但不想牺牲人工评测的优点。此时可以用模型来帮忙提高效率——本质是在"纯人工"与"纯模型"之间取折中。
| 方法 | 做法 | 注意点 |
|---|---|---|
| Model-aided annotation(模型辅助标注) | 用模型的预测或生成结果作为预标注(pre-annotations),让标注团队不必从零开始 | ① 可能把模型的偏见引入人类标注;② 如果模型准确率差,反而增加标注者的工作量 |
| Supervise model-as-a-judge(监督模型裁判) | 结合 "model as a judge" 方法(见该章节)与人类监督者,由人类验证或丢弃模型裁判的结果 | "人工评测的优缺点"一节讨论的人类偏见在这里同样适用 |
| Identify edge cases(识别边缘用例) | 用**一组模型(jury of models)做评判,然后由人类监督者在模型意见分歧或平局(tie)**时介入裁决 | 再次提醒:注意 "Pros and cons of human evaluation" 中讨论的人类偏见 |
三者的共同逻辑:让模型做"体力活",让人类只做"关键判断"——人类介入越少越快,但人类偏见始终存在,需要纳入设计考量。
端到端教程(End-to-end tutorial)
- 想按这些技巧搭建自己的定制评测设置,可参考 Argilla 的实用教程(
argilla-cookbook的domain-eval目录)。 - 教程流程概要:
- 从**领域文档(domain documents)**出发;
- 使用合成数据(synthetic data) + 人工评测(借助 Argilla 标注与 distilabel 数据管道);
- 产出一个定制评测任务(custom evaluation task);
- 最终用 lighteval 来评测你自己的模型。
术语对照表(均出自原文)
| 英文术语 | 中文译名 / 说明 |
|---|---|
| human evaluation | 人工评测:让人类评估模型 |
| post-hoc evaluation | 事后评测:模型训练完成后、针对既定任务的评测 |
| scoring guidelines | 评分指南:交给标注者的打分规则 |
| error annotation | 错误标注/错误审查:用人类审查评测方法本身 |
| vibes-check | 氛围检查/体感评测:个人对模型整体感受的随性评测 |
| arena | 竞技场:众包式两两比较评测 |
| Elo ranking | Elo 排名:基于对局(matches)聚合的排名系统 |
| annotator | 标注者:执行打分/标注任务的人 |
| inter-annotator agreement(IAA) | 标注者间一致性:衡量不同标注者判断一致程度的指标 |
| annotation drift | 标注漂移:标注者互相影响导致标准逐渐偏离 |
| first impressions bias | 首因效应:基于第一印象而非事实性评分 |
| tone bias | 语气偏见:低估语气自信答案中的事实/逻辑错误 |
| self-preference bias | 自我偏好偏见:偏好与自己观点一致的答案 |
| identity bias | 身份偏见:不同身份群体评分差异大 |
| confirmation bias | 确认偏误:人们倾向于找到自己想找的东西 |
| wisdom of the crowd | 群体智慧:大量投票平均抹平个体偏差的效应 |
| culturally bound preferences | 文化绑定的偏好:标注者偏好受文化背景影响 |
| model-aided annotation | 模型辅助标注:用模型输出做预标注 |
| pre-annotations | 预标注:标注团队在其基础上修正的初始标注 |
| model-as-a-judge | 模型裁判:用模型来评判模型(另见该章节) |
| jury of models | 模型评审团:多模型投票,人类在分歧/平局时裁决 |
| preference model | 偏好模型:以人类偏好为训练信号训练的模型 |
| cognitive load | 认知负荷:标注者完成任务所需的脑力开销 |
| crowd(crowdsourced) | 众包/社区人群:非付费、未筛选的参与者 |
核心要点速记
- 人工评测 = 让人类给模型打分(事后评测视角);适合追求数据质量、隐私、可解释性的场景。
- 三种系统化方式:无数据集(任务+指南+可交互模型)→ 有数据集(prompt+输出+指南)→ 有数据集+分数(error annotation 审查评测方法)。
- 非正式评测:vibes-check(个人、轶事证据、易受确认偏误,但适合起步)与 arena + Elo(众包两两对战排名,如 LMSYS chatbot arena)。
- 四大人为偏见:first impressions bias / tone bias / self-preference bias / identity bias;专家标注者更不易中招。
- 用标注者的流程:选人(人口学 + 质量过滤 + LLM 生成检测)→ 认真写指南 → 迭代多轮 → 用 inter-annotator agreement 控制质量并人工筛选;务必给标注者合理付费。
- 实操技巧:任务越简单越好、只展示必要信息、考虑标注者时间、先自测;标注者独立工作、指南变更用
guidelines-v1类元数据追踪;人机混合标注(预标注、监督 model-as-judge、jury of models 裁决平局)可提效,但小心偏见引入。 - 选择路线:要严谨、可复现、要数据 → 系统化人工评测;要快、要省、要发现边缘用例 → 非正式评测。
参考资料
原文 GitHub 链接(Human Evaluation 章节)
文中提到的外部链接
博客 / 文章
- Error Annotations to Evaluate(error annotation)
- Vibe Checks Are All You Need
- How to set up your own annotator platform in a couple minutes ⭐(Moritz Laurer)
论文(arXiv / ACL)
- AI audits(2401.14462)
- First impressions bias(2309.16349)
- Self-preference bias(2310.13548)
- Identity bias / toxicity(2205.00501)
- Cultural preferences of annotators(2404.16019v1)
- Good practices in data annotation quality 综述 ⭐(ACL 2024 CL)
- Assumptions and Challenges of Capturing Human Labels(NAACL 2024)
平台 / 工具