vault backup: 2026-09-16 17:56:55

This commit is contained in:
windyboy
2026-09-16 17:56:55 +08:00
parent 42953759ff
commit 700440499a
14 changed files with 254 additions and 2315 deletions
File diff suppressed because it is too large Load Diff
@@ -16,7 +16,9 @@ created: 2026-08-21
1. [[01-What-Is-LLM-Evaluation|什么是 LLM Evaluation]]
2. [[02-Annotation-Human-Data-and-Evaluation|数据标注、Human Data 与 Evaluation]]
3. [[03-Core-Concept-Map|LLM Evaluation 核心概念地图]]
4. [[04-Concepts-and-Theory|LLM 评测基础概念与理论:系统讲解]](前三篇的教学整合:构念→测量→决策主线、信度/效度、pass@k 与 pass^k、capability/regression eval、统计不确定性与失败分析等)
4. [[04-Concepts-and-Theory|LLM 评测基础概念与理论:系统讲解]](**可选深读,非首周必读**前三篇的教学整合:构念→测量→决策主线、信度/效度、pass@k 与 pass^k、capability/regression eval、统计不确定性与失败分析等)
> 首周有界理论 = 0103 三篇 + [[02-Why-Guide]]`04-Concepts-and-Theory` 按章节按需查阅,通读会超出 3–4 小时预算。
完成这一层后,继续阅读:
@@ -26,3 +28,6 @@ created: 2026-08-21
> ⚠️ **读完本层 ≠ 完成理论学习。** 理论阶段的出口是 [[01-Learning-Board|学习看板]] Level 1 全部勾选 + [[02-First-Week-Worksheet|首周工作表]] 第 0 节填完;本层只负责建立共同语言。读完就进入 Why 与工作表,而不是继续读 [[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README|04-Reference]]。
原则:这里回答 **What**,后续文档分别回答 **Why****How**
[You have received this identical output 3 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/00-Foundations/README.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]
@@ -13,21 +13,23 @@ created: 2026-08-21
> 这个看板只追踪“是否形成评测闭环”,不追踪看了多少篇文章或装了多少工具。
> **使用说明:** 勾选时在条目后补日期,例如 `- [x] 我已读完 [[02-Why-Guide]]2026-08-21)`。学习过程的详细记录(周记、卡点、复盘)见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|05-Progress]]。
> **使用说明:** 勾选时在条目后补日期,例如 `- [x] 我已读完 [[02-Why-Guide]]2026-08-21)`。学习过程的详细记录(周记、卡点、复盘)见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|05-Progress]]。
## Level 1:建立判断能力
> **本 Level 是理论阶段的出口、实践阶段的入口。** 全部勾选后,就从"读"切换到"写":填 [[02-First-Week-Worksheet|首周工作表]],然后复制 `03-Practice/_template/` 建立第一个项目。
- [ ] 我能用自己的话解释:为什么先定义成功条件,再运行模型。
- [ ] 我已读完 [[02-Why-Guide]]。
- [ ] 我已从公开资料中选定一个范围足够小的任务。
- [ ] 我已写出一个能回答的问题和一个不能回答的问题。
- [ ] 我已写出 rubric v0.1,包含有据性、资料不足处理与核心任务完成度三个维度。
- [x] 我能用自己的话解释:为什么先定义成功条件,再运行模型。2026-08-24
- [x] 我已读完 [[02-Why-Guide]]。2026-08-24
- [x] 我已从公开资料中选定一个范围足够小的任务。2026-08-26
- [x] 我已写出一个能回答的问题和一个不能回答的问题。2026-08-26
- [x] 我已写出 rubric v0.1,包含有据性、资料不足处理与核心任务完成度三个维度。2026-08-26
> 示例问答与 rubric 见 [[03-Practice/01-go-docs-qa/01-task-and-rubric|01-go-docs-qa/01-task-and-rubric]];首周工作表保持空白模板,内容已迁移至项目目录。
## Level 2:完成第一个最小闭环
- [ ] 我已在 [[02-First-Week-Worksheet]] 中写出 10 个 case。
- [ ] 我已在 [[02-First-Week-Worksheet]] 或项目 `02-case-design.md` 中写出 10 个 case。
- [ ] 我已得到至少一组候选输出。
- [ ] 我已对至少 5 个 case 写下通过/失败理由。
- [ ] 我已识别并命名 3—5 类失败。
@@ -35,7 +37,7 @@ created: 2026-08-21
## Level 3:项目化与证据链
- [ ] 我已在 `03-Practice/` 下创建自己的项目目录。
- [x] 我已在 `03-Practice/` 下创建自己的项目目录。2026-08-26
- [ ] 我已保存稳定的 case 定义与一次运行记录。
- [ ] 我已写出一份简短失败复盘。
- [ ] 我已决定下一阶段是 RAG、Agent tool-use、Text-to-SQL 还是 Code Agent。
@@ -54,6 +56,9 @@ created: 2026-08-21
## 每周复盘
> 每周复盘模板见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/01-学习周记|学习周记]](复制模板、改日期后插到文件最顶部);问题框架与学习看板 Level 1–3 的闭环检查一致。
> 每周复盘模板见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/01-Weekly-Learning-Journal|学习周记]](复制模板、改日期后插到文件最顶部);问题框架与学习看板 Level 1–3 的闭环检查一致。
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
[You have received this identical output 5 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/01-Learning-Board.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]
@@ -17,6 +17,6 @@ created: 2026-08-21
2. [[02-Why-Guide|从零开始做 LLM 评测:每一步背后的道理]]
3. [[01-Learning-Board|学习看板]](进度勾选,全程使用)
> 学习进度(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|05-Progress]];本目录只负责入口与勾选。
> 学习进度(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|05-Progress]];本目录只负责入口与勾选。
原则:这里回答 **Why** 与"我学到哪了"What 在 `00-Foundations`How 在 `02-Practical-Roadmap`
@@ -30,6 +30,14 @@ created: 2026-08-21
| 第 5 节:失败分类 | `04-failure-review.md` |
| 第 6 节:修改与回归 | `05-change-and-regression.md` |
### 当前活跃项目(内容已迁移,工作表保持空白)
| 项目 | 已迁移小节 | 项目路径 |
|---|---|---|
| `01-go-docs-qa` | §0 任务边界、§1 Rubric v0.1、§2 文档快照(case 表待填) | `03-Practice/01-go-docs-qa/` |
> 本文件继续作为空白模板复用;不要在模板里回填已迁移内容。
> 也就是说:工作表 = 第一次闭环的线性填空;项目目录 = 长期项目的分文件结构。填完工作表后把内容迁移进项目目录,就进入长期迭代(对应学习看板 Level 2 → Level 3)。
## 0. 先确定范围:你到底在评什么
@@ -197,3 +205,6 @@ created: 2026-08-21
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
[You have received this identical output 3 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/02-Practical-Roadmap/02-First-Week-Worksheet.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]
@@ -17,6 +17,13 @@ created: 2026-08-24
> 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明
## 示例问题(Level 1 出口)
| 类型 | 示例问题 | 依据 |
|---|---|---|
| 能回答 | 发布前如何用本地目录测试未发布模块? | 片段:"try it while it is in a directory local to your calling code" |
| 不能回答 | 发 alpha 前是否必须先 `go test`? | 片段未提及测试要求;应拒答或说明资料不足 |
## 三类失败
1. 无依据事实:回答包含上下文未支持的关键事实
@@ -51,8 +58,12 @@ created: 2026-08-24
## 下一步最小动作
- [x] 填写 `01-task-and-rubric.md` 的 rubric 三维度(对应 [[02-First-Week-Worksheet]] 第 1 节)
- [x] 项目骨架 `03``05` 已从 `_template/` 复制(待首次 run 时填写)
- [ ] 对着 `02-case-design.md` 顶部"输入上下文(冻结快照)"填写 10 个 case
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
[You have received this identical output 5 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/01-go-docs-qa/00-project-overview.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]
@@ -0,0 +1,60 @@
---
type: project
status: active
---
# 03 · 运行与盲评
> 为什么盲评、最小记录格式见 [[02-Why-Guide]] 第 4 步;run 的 JSONL schema 见 [[01-LLM-Evaluation-Roadmap]] 第五节。
## 候选生成条件(对应工作表第 3 节)
| 项目 | A | B |
|---|---|---|
| 模型 / 来源 | | |
| 系统提示词版本 | | |
| 温度 / 生成设置 | | |
| 运行日期 | | |
| dataset_version | | |
> 重要:先把来源隐藏、随机标 A/B;完成全部判断前不要看真实来源。
## 盲评记录(对应工作表第 4 节)
> 判"有据性"与"资料不足"时,对照 `02-case-design.md` 顶部"输入上下文(冻结快照)"。
| Case | A:有据性 | A:资料不足 | A:完成度 | B:有据性 | B:资料不足 | B:完成度 | 更优/平局 | 一句话理由 | 置信度 |
|---|---|---|---|---|---|---|---|---|---|
| 01 | | | | | | | | | | high/low |
| 02 | | | | | | | | | | high/low |
| 03 | | | | | | | | | | high/low |
| 04 | | | | | | | | | | high/low |
| 05 | | | | | | | | | | high/low |
| 06 | | | | | | | | | | high/low |
| 07 | | | | | | | | | | high/low |
| 08 | | | | | | | | | | high/low |
| 09 | | | | | | | | | | high/low |
| 10 | | | | | | | | | | high/low |
### 低置信度归因(`low` 不是坏事,是最有价值的发现)
| Case | 为什么难判 | 下一步动作 |
|---|---|---|
| | rubric 模糊 / 文档不完整 / 问题有歧义 / 自己标错 | 改规则 / 补证据 / 移出自动评分 / 请人复核 |
## Run 记录(可选,脚本自动生成)
> 每次运行保存:case_id / system_version / model / temperature / trial / timestamp / output / grading。大输入只存 case_id + 版本号,不复制全文。
```json
{
"case_id": "rag-0001",
"run": { "system_version": "", "model": "", "temperature": 0, "trial": 1, "timestamp": "" },
"output": "",
"grading": { "groundedness": "", "completeness": 0, "grader_version": "human-v0.1" }
}
```
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
@@ -0,0 +1,38 @@
---
type: project
status: active
---
# 04 · 失败复盘
> 失败分类的权威定义见 [[02-Why-Guide]] 第 7 步(简化五类)与 [[01-LLM-Evaluation-Roadmap]] 第八节(系统级扩展分类);严重度 S0-S4 见路线图第十节。
## 失败分类(对应工作表第 5 节)
| Case | 失败类型 | 证据 | 我准备先检查什么 |
|---|---|---|---|
| | 无依据事实 / 漏限制 / 不当确定 / 格式 / 规则不确定 | | prompt / 文档 / rubric / grader |
> 第一版只用 4-5 个类型即可。分类的目的不是"全面",而是找到下一次唯一值得改的地方。
## 根因三步定位(RAG 示例)
1. run 里的实际 context 是否包含 expected 中的 gold context?没有 → **检索错误**
2. 把 gold context 直接给模型重跑:答对 → 检索/拼装问题;仍错 → **模型推理 / 生成错误**
3. 并排人工复核输出 / expected / grader:人工认为可接受但 grader 判失败 → **grader 错误**(记录 grader 版本与提示词)
> 不要凭直觉归因,一次失败先走完三步,通常不超过 10 分钟。
## 严重度标注
| Case | 严重度(S0-S4 | 理由 | 发布策略 |
|---|---|---|---|
| | | | 见路线图第十节 |
## 一句话复盘(每批至少一条)
- 本周最常见的失败类型是:…… 下一步唯一值得改的地方是:……
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
@@ -0,0 +1,32 @@
---
type: project
status: active
---
# 05 · 变更与回归
> 实验日志规则(专区规则三)与回归原则见 [[02-Why-Guide]] 第 8 步:一次改一个可解释因素,重跑旧 case(不只跑失败 case)。
## 变更记录(对应工作表第 6 节)
| 你修改了什么 | 为什么改它 | 预期改善哪些 case | 必须不变差的 case | 修改后结果 |
|---|---|---|---|---|
| | | | | |
## 实验日志
> 每次改变 case / rubric / prompt / 模型 / 文档版本,记一条:改了什么、为什么改、预期影响、实际结果。
| 日期 | 改动 | 原因 | 预期影响 | 实际结果 |
|---|---|---|---|---|
| | | | | |
## 回归检查
- [ ] 重跑原失败 case,确认修复生效
- [ ] 重跑一小组原本通过的 case,确认没有"修 A 坏 B"
- [ ] 确认的失败已固化进 regression(对应 case 状态 → regression
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
@@ -0,0 +1,51 @@
---
type: progress
tags:
- llm-evaluation
- progress
status: active
created: 2026-08-21
---
# 当前位置与下一步
> **使用方式:** 每次学习结束时花 5 分钟更新本文件。它是你打开专区后第一个应该看的地方——比任何目录都更能告诉你"我在哪、下一步做什么"。
## 我现在的阶段
- [x] **阶段 1:有界理论**(读 00-Foundations 核心三篇(0103+ 01-Start-Here + 02-Why-Guide,约 3-4 小时)(2026-08-24
- [x] **阶段 2:出口检查**:学习看板 Level 1 全部勾选 + 首周工作表第 0 节填完(2026-08-26
- [ ] **阶段 3:实践**(工作表 1-6 节 → 复制 `03-Practice/_template/` 建立第一个项目)
- [ ] **阶段 4:按需回补**04-Reference 按各自"前置阶段"插入项目推进过程)
**当前状态:** 阶段 3(实践)· 进行中 · `01-go-docs-qa` 任务与 rubric 已完成,10 个 case 待填写 · 更新于 2026-08-28
## 正在做什么
- 项目:[[03-Practice/01-go-docs-qa/00-project-overview|01-go-docs-qa]]
- 已完成:任务边界、`01-task-and-rubric.md` rubric v0.1、`02-case-design.md` 文档冻结快照
- 进行中:填写 `02-case-design.md` 的 10 个 case(表头已就绪,内容为空)
## 卡点(写下来,下次从这里继续)
- 无理论卡点;实践阻塞项是 case 列表尚未填写(刻意保留,待手动完成)
## 下一步最小动作
- [ ] 在 `03-Practice/01-go-docs-qa/02-case-design.md` 填写 case 01–10(问题 + 预期行为)
- [ ] 勾选 [[01-Learning-Board]] Level 2 第一项(case 写完后)
## 相关链接
- 学习主线:[[01_Projects/Personal-Tech/LLM_Evaluation/README|专区首页]]
- 进度勾选:[[01-Learning-Board|学习看板]]
- 填写入口:[[02-First-Week-Worksheet|首周工作表]]
- 学习周记:[[01-Weekly-Learning-Journal]]
- 季度复盘:[[02-Quarterly-Method-Review]]
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
[You have received this identical output 3 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]
@@ -1,46 +0,0 @@
---
type: progress
tags:
- llm-evaluation
- progress
status: active
created: 2026-08-21
---
# 当前位置与下一步
> **使用方式:** 每次学习结束时花 5 分钟更新本文件。它是你打开专区后第一个应该看的地方——比任何目录都更能告诉你"我在哪、下一步做什么"。
## 我现在的阶段
- [ ] **阶段 1:有界理论**(读 00-Foundations 三篇 + 01-Start-Here + 02-Why-Guide,约 3-4 小时)
- [ ] **阶段 2:出口检查**:学习看板 Level 1 全部勾选 + 首周工作表第 0 节填完
- [ ] **阶段 3:实践**(工作表 1-6 节 → 复制 `03-Practice/_template/` 建立第一个项目)
- [ ] **阶段 4:按需回补**04-Reference 按各自"前置阶段"插入项目推进过程)
**当前状态:** 阶段 1(有界理论)· 未开始 · 更新于 2026-08-21
## 正在做什么
- (示例:读 [[01-What-Is-LLM-Evaluation]],已完成 → 写一条"能回答/不能回答"的问题填入工作表第 0 节)
## 卡点(写下来,下次从这里继续)
- 无 / 或:xxx 概念没看懂,卡在……
## 下一步最小动作
- [ ] 读 [[01-What-Is-LLM-Evaluation|什么是 LLM Evaluation]]
- [ ] 完成 [[00-Start-Here|开始这里]] 的十分钟动作
## 相关链接
- 学习主线:[[01_Projects/Personal-Tech/LLM_Evaluation/README|专区首页]]
- 进度勾选:[[01-Learning-Board|学习看板]]
- 填写入口:[[02-First-Week-Worksheet|首周工作表]]
- 学习周记:[[01-学习周记]]
- 季度复盘:[[02-方法季度复盘]]
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
@@ -12,6 +12,23 @@ created: 2026-08-21
> **使用方式:** 每周一次(或每次学习后),复制下方模板,把日期改为当周,插到文件**最顶部**(最新在上)。周记是你"学习过程"的存档处:学习看板只负责勾选,周记负责记录发生了什么。
## 2026-08-28 进度同步
### 本周目标
- 对齐进度文档与 `01-go-docs-qa` 实际进展;不提前完成 case / run。
### 本周理论理解
- 有界理论阶段已完成;`04-Concepts-and-Theory` 定位为按需深读,非首周必读。
### 本周实践
- 项目 `01-go-docs-qa`:任务边界 + rubric v0.1 + 文档冻结快照已完成。
- 待做:10 个 case`02-case-design.md`)。
### 下周最小动作
- 填写 case 0110。
---
## 模板(复制这一块,改日期后插到最上方)
```markdown
@@ -27,8 +27,11 @@ created: 2026-08-21
| 3 | [[02-Why-Guide\|从零开始做 LLM 评测:每一步背后的道理]] | 为什么先做 case、rubric、盲评、run、失败分类与回归? | 能解释每个动作在防什么问题。 |
| 4 | [[02-Annotation-Human-Data-and-Evaluation\|数据标注、Human Data 与 Evaluation]] | 标注、人类数据与评测的区别是什么? | 能区分 Annotation / Human Data / Evaluation 三种用途。 |
| 5 | [[03-Core-Concept-Map\|LLM Evaluation 核心概念地图]] | 术语速查地图在哪? | 阅读与实践时能快速定位术语(速查用,不要求背诵)。 |
| 6 | [[04-Concepts-and-Theory\|LLM 评测基础概念与理论]](**可选深读**) | 需要构念→测量→决策框架时查阅 | 知道存在即可;不在首周必读范围内 |
> ⛔ **停止线:理论到此为止。** 不要继续读 `04-Reference`、guidebook 或归档——它们是"按需查阅的工具书",不是"要读完的教材"。
>
> `04-Concepts-and-Theory` 是 01–03 的教学整合深读版(约 2500 行),**不属于 3–4 小时有界理论**;卡住某个概念时再读对应章节,不要通读。
### 阶段 2 · 出口检查(判断"理论够了",而不是读完多少页)
@@ -55,7 +58,7 @@ created: 2026-08-21
> **数量口径:** 首周最低完成 10 个 case(结构见《首周工作表》第 2 节);若时间充裕,按路线图 Day 1 扩展至 20 个(配比见《实战路线图》Day 1 小节)。
> **进度记录:** 学习过程(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步\|05-Progress]];学习看板只负责勾选。
> **进度记录:** 学习过程(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps\|05-Progress]];学习看板只负责勾选。
## 目录结构为何这样设计
@@ -86,7 +89,7 @@ created: 2026-08-21
## 你的当前入口
打开 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|当前位置]],确认自己处在哪个阶段;从 [[00-Start-Here|开始这里]] 完成十分钟动作;完成后填写 [[02-First-Week-Worksheet|首周工作表]]。想追踪进度时,对照 [[01-Learning-Board|学习看板]] 勾选闭环条目(勾选时补日期)。
打开 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|当前位置]],确认自己处在哪个阶段;从 [[00-Start-Here|开始这里]] 完成十分钟动作;完成后填写 [[02-First-Week-Worksheet|首周工作表]]。想追踪进度时,对照 [[01-Learning-Board|学习看板]] 勾选闭环条目(勾选时补日期)。
## 关联材料
@@ -95,4 +98,7 @@ created: 2026-08-21
- 外部权威知识参考:[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
- 外部精选资源(已归档):[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
- 归档总索引:[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/00-Material-List|材料清单与归档说明]](早期草案与外部参考的定位总览)
- 学习进度与自评:[[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|05-Progress]](当前位置 / 学习周记 / 季度复盘 / 作品集清单)
- 学习进度与自评:[[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-Current-Status-and-Next-Steps|05-Progress]](当前位置 / 学习周记 / 季度复盘 / 作品集清单)
[You have received this identical output 3 times. Re-reading '/Users/windy/Documents/vault/my-vault/01_Projects/Personal-Tech/LLM_Evaluation/README.md:raw' will not change it — use a narrower selector (path:A-B), or proceed with the edit.]