2026-08-21 14:38:03 +08:00
|
|
|
|
---
|
|
|
|
|
|
type: moc
|
|
|
|
|
|
tags:
|
2026-08-21 14:47:11 +08:00
|
|
|
|
- llm-evaluation
|
|
|
|
|
|
- learning-zone
|
|
|
|
|
|
- moc
|
2026-08-21 14:38:03 +08:00
|
|
|
|
status: active
|
|
|
|
|
|
created: 2026-08-21
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
# LLM 评测学习专区
|
|
|
|
|
|
|
|
|
|
|
|
> 这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:**把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。**
|
|
|
|
|
|
|
|
|
|
|
|
## 先怎么使用
|
|
|
|
|
|
|
|
|
|
|
|
请不要按文件夹顺序随机阅读。第一次学习建议走下面这条主线:
|
|
|
|
|
|
|
|
|
|
|
|
```text
|
2026-08-21 15:12:28 +08:00
|
|
|
|
建立概念(What)
|
|
|
|
|
|
→ 理解为什么(Why)
|
2026-08-21 14:38:03 +08:00
|
|
|
|
→ 填写一份最小工作表
|
|
|
|
|
|
→ 做完第一个 10-case 小项目
|
2026-08-21 15:12:28 +08:00
|
|
|
|
→ 再进入完整工程路线(How)
|
2026-08-21 14:38:03 +08:00
|
|
|
|
```
|
|
|
|
|
|
|
2026-08-21 16:01:21 +08:00
|
|
|
|
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|
|
|
|
|
|
|---:|---|---|---|
|
|
|
|
|
|
| 1 | [[00-Start-Here\|开始这里]] | 我究竟在学什么,如何不被概念和工具淹没? | 完成十分钟动作,能复述学习主线。 |
|
|
|
|
|
|
| 2 | [[01-What-Is-LLM-Evaluation\|什么是 LLM Evaluation]] | 评测的对象、边界与常用术语是什么? | 能区分模型评测与系统评测、Benchmark 与 Product Eval。 |
|
|
|
|
|
|
| 3 | [[02-Why-Guide\|从零开始做 LLM 评测:每一步背后的道理]] | 为什么先做 case、rubric、盲评、run、失败分类与回归? | 能解释每个动作在防什么问题。 |
|
|
|
|
|
|
| 4 | [[02-First-Week-Worksheet\|首周工作表]] | 今天应该写什么,卡住时怎样缩小范围? | 完成任务边界、10 个 case 与 rubric v0.1。 |
|
|
|
|
|
|
| 5 | [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README\|项目实践入口]] | 如何把工作表变成自己的项目仓库? | 开始一个最小项目并保存第一个 run。 |
|
|
|
|
|
|
| 6 | [[01-LLM-Evaluation-Roadmap\|LLM 评测工程实战路线图]] | 怎样逐步走向 Judge、Agent、安全、数据资产与 CI? | 为自己选择一个 12 周内的下一阶段。 |
|
2026-08-21 14:38:03 +08:00
|
|
|
|
|
|
|
|
|
|
> **数量口径:** 首周最低完成 10 个 case;若时间充裕,按路线图 Day 1 扩展至 20 个(结构见《首周工作表》第 2 节)。
|
|
|
|
|
|
|
|
|
|
|
|
## 目录结构为何这样设计
|
|
|
|
|
|
|
|
|
|
|
|
| 目录 | 放什么 | 不放什么 | 设计原因 |
|
|
|
|
|
|
|---|---|---|---|
|
2026-08-21 15:12:28 +08:00
|
|
|
|
| `00-Foundations` | 基础概念、术语边界与速查地图(What) | 操作手册与个人项目数据 | 先建立共同语言,后续文档不再重复解释术语。 |
|
|
|
|
|
|
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
|
|
|
|
|
|
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
|
|
|
|
|
|
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
|
2026-08-21 14:45:32 +08:00
|
|
|
|
| `04-Reference-Archive` | 旧大纲与参考草案(职业定位原文存于 02_Areas/Job) | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
|
|
|
|
|
|
| `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments`) | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
|
2026-08-21 14:38:03 +08:00
|
|
|
|
|
|
|
|
|
|
## 三条使用规则
|
|
|
|
|
|
|
|
|
|
|
|
> **规则一:先写再读。** 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。
|
|
|
|
|
|
|
2026-08-21 15:12:28 +08:00
|
|
|
|
> **规则二:项目笔记不放在通用材料旁。** 每个项目单独放入 `03-Practice/项目名/`,防止模板、原理和实际 run 混在一起。
|
2026-08-21 14:38:03 +08:00
|
|
|
|
|
|
|
|
|
|
> **规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。** 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。
|
|
|
|
|
|
|
|
|
|
|
|
## 你的当前入口
|
|
|
|
|
|
|
2026-08-21 15:44:03 +08:00
|
|
|
|
打开 [[00-Start-Here|开始这里]],完成其中的十分钟动作;完成后再填写 [[02-First-Week-Worksheet|首周工作表]]。
|
2026-08-21 14:38:03 +08:00
|
|
|
|
|
|
|
|
|
|
## 关联材料
|
|
|
|
|
|
|
|
|
|
|
|
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job)
|
2026-08-21 15:44:03 +08:00
|
|
|
|
- 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]]
|
|
|
|
|
|
- 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]]
|
2026-08-21 16:19:12 +08:00
|
|
|
|
- 外部权威知识参考:[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
|