Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/README.md
T
windyboy 0dac58fb6f reconcile LLM_Evaluation zone: align stage numbering and scopes, standardize full-path wikilinks, slim old guidebook notes, dedupe templates
- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope
- resolve AWS workshop prerequisite contradiction in 04-Reference/01
- convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs
- compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview
- dedupe project templates and remove embedded template copy in 03-Practice/README
2026-08-24 11:15:37 +08:00

7.5 KiB
Raw Blame History

type, tags, status, created
type tags status created
moc
llm-evaluation
learning-zone
moc
active 2026-08-21

LLM 评测学习专区

这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。

先怎么使用

学习过程分四段,有明确停止线:理论是有界的,读完必读部分就动手;04-Reference 不是现在读的,是按需查阅的工具书。

节奏自选(三选一): 每天 10 分钟(Start-Here / 工作表的十分钟动作,碎片推进)、首周 6–10 小时(Why Guide 首周计划)、或 72 小时冲刺(路线图第四节)。起点都是同一份工作表,差别只是投入速度。

阶段 1 · 有界理论(约 3-4 小时,一次性)

顺序 阅读材料 解决的问题 完成标志
1 00-Start-Here 我究竟在学什么,如何不被概念和工具淹没? 完成十分钟动作,能复述学习主线。
2 01-What-Is-LLM-Evaluation 评测的对象、边界与常用术语是什么? 能区分模型评测与系统评测、Benchmark 与 Product Eval。
3 02-Why-Guide 为什么先做 case、rubric、盲评、run、失败分类与回归? 能解释每个动作在防什么问题。
4 02-Annotation-Human-Data-and-Evaluation 标注、人类数据与评测的区别是什么? 能区分 Annotation / Human Data / Evaluation 三种用途。
5 03-Core-Concept-Map 术语速查地图在哪? 阅读与实践时能快速定位术语(速查用,不要求背诵)。

停止线:理论到此为止。 不要继续读 04-Reference、guidebook 或归档——它们是"按需查阅的工具书",不是"要读完的教材"。

阶段 2 · 出口检查(判断"理论够了",而不是读完多少页)

检查项 材料
学习看板 Level 1 全部勾选(勾选时补日期) 01-Learning-Board
首周工作表第 0 节填完 02-First-Week-Worksheet

阶段 3 · 实践(立即开始)

顺序 阅读材料 解决的问题 完成标志
1 02-First-Week-Worksheet 今天应该写什么,卡住时怎样缩小范围? 完成任务边界、10 个 case 与 rubric v0.1。
2 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README 如何把工作表变成自己的项目仓库? 复制 03-Practice/_template/ 建立项目并保存第一个 run。

阶段 4 · 按需回补(贯穿整个学习期)

04-Reference 的五篇各自标注了"前置阶段"(见 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README),按项目推进需要插入,不一次读完。

阅读材料 解决的问题 什么时候读
01-LLM-Evaluation-Roadmap 怎样逐步走向 Judge、Agent、安全、数据资产与 CI? 阶段 3 中随时查阅
01-Learning-Board 我学到哪了?还差哪个闭环? 全程,勾选时补日期

数量口径: 首周最低完成 10 个 case(结构见《首周工作表》第 2 节);若时间充裕,按路线图 Day 1 扩展至 20 个(配比见《实战路线图》Day 1 小节)。

进度记录: 学习过程(当前位置、周记、季度复盘)统一记在 01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步;学习看板只负责勾选。

目录结构为何这样设计

目录 放什么 不放什么 设计原因
00-Foundations 基础概念、术语边界与速查地图(What) 操作手册与个人项目数据 先建立共同语言,后续文档不再重复解释术语。
01-Getting-Started 学习入口、进度看板与 Why Guide(Why 复杂工具的操作手册 让你每次打开专区都能立刻知道下一步与为什么。
02-Practical-Roadmap 可执行路线、清单、模板、阶段性任务(How) 一次性运行结果 将原则转成动作,且便于反复使用。
03-Practice 每个亲自完成的 Eval 项目、实验记录、复盘;_template/ 提供可复制的项目骨架 通用学习材料 学习材料与个人证据分离,项目才不会被笔记淹没。
04-Reference 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);guidebook 外部知识与旧草案归档于子目录 正在执行的任务 保留来路和背景,但不干扰当前学习。
05-Progress 学习进度与自评:当前位置、学习周记、季度复盘、作品集清单 项目证据 学习过程有存档处,看板 / README 不被个人数据污染。
99-Attachments (已移除)二进制附件统一放全库 05_Attachments 避免"本地附件 vs 全库附件"二选一的歧义。

命名约定

  • README.md = 目录总览(hub
  • 00- 前缀 = 入口页或总览页(如 00-Start-Here
  • 01+ 前缀 = 按推荐阅读顺序的内容
  • _ 前缀 = 模板 / 工具,非学习内容(如 03-Practice/_template/

三条使用规则

规则一:先写再读。 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。

规则二:项目笔记不放在通用材料旁。 每个项目单独放入 03-Practice/项目名/,防止模板、原理和实际 run 混在一起。

规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。

你的当前入口

打开 01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步,确认自己处在哪个阶段;从 00-Start-Here 完成十分钟动作;完成后填写 02-First-Week-Worksheet。想追踪进度时,对照 01-Learning-Board 勾选闭环条目(勾选时补日期)。

关联材料