Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/README.md
T

104 lines
8.1 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
type: moc
tags:
- llm-evaluation
- learning-zone
- moc
status: active
created: 2026-08-21
---
# LLM 评测学习专区
> 这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:**把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。**
## 先怎么使用
学习过程分四段,**有明确停止线**:理论是有界的,读完必读部分就动手;`04-Reference` 不是现在读的,是按需查阅的工具书。
> **节奏自选(三选一):** 每天 10 分钟(Start-Here / 工作表的十分钟动作,碎片推进)、首周 6–10 小时(Why Guide 首周计划)、或 72 小时冲刺(路线图第四节)。起点都是同一份工作表,差别只是投入速度。
### 阶段 1 · 有界理论(约 3-4 小时,一次性)
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|---:|---|---|---|
| 1 | [[00-Start-Here\|开始这里]] | 我究竟在学什么,如何不被概念和工具淹没? | 完成十分钟动作,能复述学习主线。 |
| 2 | [[01-What-Is-LLM-Evaluation\|什么是 LLM Evaluation]] | 评测的对象、边界与常用术语是什么? | 能区分模型评测与系统评测、Benchmark 与 Product Eval。 |
| 3 | [[02-Why-Guide\|从零开始做 LLM 评测:每一步背后的道理]] | 为什么先做 case、rubric、盲评、run、失败分类与回归? | 能解释每个动作在防什么问题。 |
| 4 | [[02-Annotation-Human-Data-and-Evaluation\|数据标注、Human Data 与 Evaluation]] | 标注、人类数据与评测的区别是什么? | 能区分 Annotation / Human Data / Evaluation 三种用途。 |
| 5 | [[03-Core-Concept-Map\|LLM Evaluation 核心概念地图]] | 术语速查地图在哪? | 阅读与实践时能快速定位术语(速查用,不要求背诵)。 |
| 6 | [[04-Concepts-and-Theory\|LLM 评测基础概念与理论]](**可选深读**) | 需要构念→测量→决策框架时查阅 | 知道存在即可;不在首周必读范围内 |
> ⛔ **停止线:理论到此为止。** 不要继续读 `04-Reference`、guidebook 或归档——它们是"按需查阅的工具书",不是"要读完的教材"。
>
> `04-Concepts-and-Theory` 是 0103 的教学整合深读版(约 2500 行),**不属于 3–4 小时有界理论**;卡住某个概念时再读对应章节,不要通读。
### 阶段 2 · 出口检查(判断"理论够了",而不是读完多少页)
| 检查项 | 材料 |
|---|---|
| 学习看板 Level 1 全部勾选(勾选时补日期) | [[01-Learning-Board\|学习看板]] |
| 首周工作表第 0 节填完 | [[02-First-Week-Worksheet\|首周工作表]] |
### 阶段 3 · 实践(立即开始)
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|---:|---|---|---|
| 1 | [[02-First-Week-Worksheet\|首周工作表]] | 今天应该写什么,卡住时怎样缩小范围? | 完成任务边界、10 个 case 与 rubric v0.1。 |
| 2 | [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README\|项目实践入口]] | 如何把工作表变成自己的项目仓库? | 复制 `03-Practice/_template/` 建立项目并保存第一个 run。 |
### 阶段 4 · 按需回补(贯穿整个学习期)
`04-Reference` 的五篇各自标注了"前置阶段"(见 [[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README\|04-Reference 资源地图]]),按项目推进需要插入,不一次读完。
| 阅读材料 | 解决的问题 | 什么时候读 |
|---|---|---|
| [[01-LLM-Evaluation-Roadmap\|LLM 评测工程实战路线图]] | 怎样逐步走向 Judge、Agent、安全、数据资产与 CI? | 阶段 3 中随时查阅 |
| [[01-Learning-Board\|学习看板]] | 我学到哪了?还差哪个闭环? | 全程,勾选时补日期 |
> **数量口径:** 首周最低完成 10 个 case(结构见《首周工作表》第 2 节);若时间充裕,按路线图 Day 1 扩展至 20 个(配比见《实战路线图》Day 1 小节)。
> **进度记录:** 学习过程(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps\|05-Progress]];学习看板只负责勾选。
## 目录结构为何这样设计
| 目录 | 放什么 | 不放什么 | 设计原因 |
|---|---|---|---|
| `00-Foundations` | 基础概念、术语边界与速查地图(What) | 操作手册与个人项目数据 | 先建立共同语言,后续文档不再重复解释术语。 |
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘;`_template/` 提供可复制的项目骨架 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
| `04-Reference` | 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);guidebook 外部知识与旧草案归档于子目录 | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
| `05-Progress` | 学习进度与自评:当前位置、学习周记、季度复盘、作品集清单 | 项目证据 | 学习过程有存档处,看板 / README 不被个人数据污染。 |
| `99-Attachments` | (已移除)二进制附件统一放全库 `05_Attachments` | — | 避免"本地附件 vs 全库附件"二选一的歧义。 |
## 命名约定
- `README.md` = 目录总览(hub
- `00-` 前缀 = 入口页或总览页(如 `00-Start-Here`
- `01+` 前缀 = 按推荐阅读顺序的内容
- `_` 前缀 = 模板 / 工具,非学习内容(如 `03-Practice/_template/`
## 三条使用规则
> **规则一:先写再读。** 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。
> **规则二:项目笔记不放在通用材料旁。** 每个项目单独放入 `03-Practice/项目名/`,防止模板、原理和实际 run 混在一起。
> **规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。** 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。
## 你的当前入口
打开 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|当前位置]],确认自己处在哪个阶段;从 [[00-Start-Here|开始这里]] 完成十分钟动作;完成后填写 [[02-First-Week-Worksheet|首周工作表]]。想追踪进度时,对照 [[01-Learning-Board|学习看板]] 勾选闭环条目(勾选时补日期)。
## 关联材料
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job
- 评测工程资源地图:[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README|04-Reference 资源地图]](五层能力框架与推荐精读顺序)
- 外部权威知识参考:[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
- 外部精选资源(已归档):[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
- 归档总索引:[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/00-Material-List|材料清单与归档说明]](早期草案与外部参考的定位总览)
- 学习进度与自评:[[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|05-Progress]](当前位置 / 学习周记 / 季度复盘 / 作品集清单)
[You have received this identical output 3 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/README.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]