- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope - resolve AWS workshop prerequisite contradiction in 04-Reference/01 - convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs - compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview - dedupe project templates and remove embedded template copy in 03-Practice/README
type, tags, status, created
| type | tags | status | created | |||
|---|---|---|---|---|---|---|
| moc |
|
active | 2026-08-21 |
LLM 评测学习专区
这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。
先怎么使用
学习过程分四段,有明确停止线:理论是有界的,读完必读部分就动手;04-Reference 不是现在读的,是按需查阅的工具书。
节奏自选(三选一): 每天 10 分钟(Start-Here / 工作表的十分钟动作,碎片推进)、首周 6–10 小时(Why Guide 首周计划)、或 72 小时冲刺(路线图第四节)。起点都是同一份工作表,差别只是投入速度。
阶段 1 · 有界理论(约 3-4 小时,一次性)
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|---|---|---|---|
| 1 | 00-Start-Here | 我究竟在学什么,如何不被概念和工具淹没? | 完成十分钟动作,能复述学习主线。 |
| 2 | 01-What-Is-LLM-Evaluation | 评测的对象、边界与常用术语是什么? | 能区分模型评测与系统评测、Benchmark 与 Product Eval。 |
| 3 | 02-Why-Guide | 为什么先做 case、rubric、盲评、run、失败分类与回归? | 能解释每个动作在防什么问题。 |
| 4 | 02-Annotation-Human-Data-and-Evaluation | 标注、人类数据与评测的区别是什么? | 能区分 Annotation / Human Data / Evaluation 三种用途。 |
| 5 | 03-Core-Concept-Map | 术语速查地图在哪? | 阅读与实践时能快速定位术语(速查用,不要求背诵)。 |
⛔ 停止线:理论到此为止。 不要继续读
04-Reference、guidebook 或归档——它们是"按需查阅的工具书",不是"要读完的教材"。
阶段 2 · 出口检查(判断"理论够了",而不是读完多少页)
| 检查项 | 材料 |
|---|---|
| 学习看板 Level 1 全部勾选(勾选时补日期) | 01-Learning-Board |
| 首周工作表第 0 节填完 | 02-First-Week-Worksheet |
阶段 3 · 实践(立即开始)
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|---|---|---|---|
| 1 | 02-First-Week-Worksheet | 今天应该写什么,卡住时怎样缩小范围? | 完成任务边界、10 个 case 与 rubric v0.1。 |
| 2 | 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README | 如何把工作表变成自己的项目仓库? | 复制 03-Practice/_template/ 建立项目并保存第一个 run。 |
阶段 4 · 按需回补(贯穿整个学习期)
04-Reference 的五篇各自标注了"前置阶段"(见 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README),按项目推进需要插入,不一次读完。
| 阅读材料 | 解决的问题 | 什么时候读 |
|---|---|---|
| 01-LLM-Evaluation-Roadmap | 怎样逐步走向 Judge、Agent、安全、数据资产与 CI? | 阶段 3 中随时查阅 |
| 01-Learning-Board | 我学到哪了?还差哪个闭环? | 全程,勾选时补日期 |
数量口径: 首周最低完成 10 个 case(结构见《首周工作表》第 2 节);若时间充裕,按路线图 Day 1 扩展至 20 个(配比见《实战路线图》Day 1 小节)。
进度记录: 学习过程(当前位置、周记、季度复盘)统一记在 01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步;学习看板只负责勾选。
目录结构为何这样设计
| 目录 | 放什么 | 不放什么 | 设计原因 |
|---|---|---|---|
00-Foundations |
基础概念、术语边界与速查地图(What) | 操作手册与个人项目数据 | 先建立共同语言,后续文档不再重复解释术语。 |
01-Getting-Started |
学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
02-Practical-Roadmap |
可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
03-Practice |
每个亲自完成的 Eval 项目、实验记录、复盘;_template/ 提供可复制的项目骨架 |
通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
04-Reference |
评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);guidebook 外部知识与旧草案归档于子目录 | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
05-Progress |
学习进度与自评:当前位置、学习周记、季度复盘、作品集清单 | 项目证据 | 学习过程有存档处,看板 / README 不被个人数据污染。 |
99-Attachments |
(已移除)二进制附件统一放全库 05_Attachments |
— | 避免"本地附件 vs 全库附件"二选一的歧义。 |
命名约定
README.md= 目录总览(hub)00-前缀 = 入口页或总览页(如00-Start-Here)01+前缀 = 按推荐阅读顺序的内容_前缀 = 模板 / 工具,非学习内容(如03-Practice/_template/)
三条使用规则
规则一:先写再读。 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。
规则二:项目笔记不放在通用材料旁。 每个项目单独放入
03-Practice/项目名/,防止模板、原理和实际 run 混在一起。
规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。
你的当前入口
打开 01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步,确认自己处在哪个阶段;从 00-Start-Here 完成十分钟动作;完成后填写 02-First-Week-Worksheet。想追踪进度时,对照 01-Learning-Board 勾选闭环条目(勾选时补日期)。
关联材料
- 职业与岗位背景:02_Areas/Job/llm_data_annotation_programmer_roadmap(原文存于 02_Areas/Job)
- 评测工程资源地图:01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README(五层能力框架与推荐精读顺序)
- 外部权威知识参考:01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/00-Overview(自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
- 外部精选资源(已归档):01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources(顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
- 归档总索引:01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/00-Material-List(早期草案与外部参考的定位总览)
- 学习进度与自评:01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步(当前位置 / 学习周记 / 季度复盘 / 作品集清单)