reconcile LLM_Evaluation zone: align stage numbering and scopes, standardize full-path wikilinks, slim old guidebook notes, dedupe templates

- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope
- resolve AWS workshop prerequisite contradiction in 04-Reference/01
- convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs
- compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview
- dedupe project templates and remove embedded template copy in 03-Practice/README
This commit is contained in:
windyboy
2026-08-24 11:15:37 +08:00
parent 63add96a09
commit 0dac58fb6f
29 changed files with 644 additions and 434 deletions
@@ -13,8 +13,12 @@ created: 2026-08-21
> 这个看板只追踪“是否形成评测闭环”,不追踪看了多少篇文章或装了多少工具。
> **使用说明:** 勾选时在条目后补日期,例如 `- [x] 我已读完 [[02-Why-Guide]]2026-08-21)`。学习过程的详细记录(周记、卡点、复盘)见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|05-Progress]]。
## Level 1:建立判断能力
> **本 Level 是理论阶段的出口、实践阶段的入口。** 全部勾选后,就从"读"切换到"写":填 [[02-First-Week-Worksheet|首周工作表]],然后复制 `03-Practice/_template/` 建立第一个项目。
- [ ] 我能用自己的话解释:为什么先定义成功条件,再运行模型。
- [ ] 我已读完 [[02-Why-Guide]]。
- [ ] 我已从公开资料中选定一个范围足够小的任务。
@@ -39,29 +43,17 @@ created: 2026-08-21
## Level 4:深度参考(资源地图精读)
> 精读顺序见 [[04-Reference/README|04-Reference 资源地图]]。只精读 4 个,其余按需查阅。
> 精读顺序见 [[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README|04-Reference 资源地图]]。只精读 4 个,其余按需查阅。
- [ ] 我已通读资源地图并选定自己的精读顺序。
- [ ] AWS Workshop:我已拆解至少 1 个模块的 Task / Case / Rubric / Grader / Failure[[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
- [ ] lm-evaluation-harness:我能讲清 Task 标准化、Prompt 固定、Metric 配置与去污染([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
- [ ] Inspect AI + AISI:我能映射 Evaluate / Isolate / Connect / Run / Scale 与 Task / Solver / Scorer / Sandbox / Trace 抽象([[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
- [ ] OLMES:我能解释 Evaluation Protocol 冻结为何带来可复现比较([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
- [ ] 我已用 [[04-Reference/05-Source-Reading-Checklist\|源码阅读检查清单]] 的 8 个问题对照过至少 1 个框架。
- [ ] AWS Workshop:我已拆解至少 1 个模块的 Task / Case / Rubric / Grader / Failure[[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
- [ ] lm-evaluation-harness:我能讲清 Task 标准化、Prompt 固定、Metric 配置与去污染([[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
- [ ] Inspect AI + AISI:我能映射 Evaluate / Isolate / Connect / Run / Scale 与 Task / Solver / Scorer / Sandbox / Trace 抽象([[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
- [ ] OLMES:我能解释 Evaluation Protocol 冻结为何带来可复现比较([[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
- [ ] 我已用 [[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/05-Source-Reading-Checklist\|源码阅读检查清单]] 的 8 个问题对照过至少 1 个框架。
## 每周复盘(复制到项目周记)
## 每周复盘
```markdown
## 本周目标
## 我新定义了什么成功 / 失败条件?
## 我新增或修订了哪些 case?为什么?
## 本周主要失败类型是什么?
## 我改变了什么?预期是什么?实际发生了什么?
## 下周只保留的一个最小动作
```
> 每周复盘模板见 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/01-学习周记|学习周记]](复制模板、改日期后插到文件最顶部);问题框架与学习看板 Level 1–3 的闭环检查一致。
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
@@ -335,7 +335,7 @@ Run 记录:这个版本的系统在某个时间、某个配置下实际输出
| 暂时不做 | 为什么现在不做 | 什么时候再学 |
|---|---|---|
| 训练 / 微调模型 | 你还没有稳定的质量标准,不知道该用什么数据改进 | 能稳定设计 case、rubric 与回归集之后。 |
| LLM-as-a-Judge | 自动评分会掩盖 rubric 是否清楚 | 手工盲评至少 20—50 条并复盘分歧之后。 |
| LLM-as-a-Judge | 自动评分会掩盖 rubric 是否清楚 | 手工盲评至少 20—50 条并复盘分歧之后(正式校准用 50–100 条代表样本,见路线图第七节)。 |
| CI 门禁、平台和仪表盘 | 它们放大已有流程,不会创造流程 | 手工重跑开始重复、容易漏步骤之后。 |
| 大规模红队 | 范围广、风险分类复杂 | 有一个具体系统边界,如 RAG 注入或工具越权之后。 |
| 1000 条数据 | 数量会掩盖设计问题 | 你能明确说出每个类别为何存在之后。 |
@@ -0,0 +1,22 @@
---
type: hub
tags:
- llm-evaluation
- getting-started
status: active
created: 2026-08-21
---
# Getting Started
这里负责回答"为什么做评测"并跟踪学习进度。
推荐顺序:
1. [[00-Start-Here|开始这里]](十分钟动作入口)
2. [[02-Why-Guide|从零开始做 LLM 评测:每一步背后的道理]]
3. [[01-Learning-Board|学习看板]](进度勾选,全程使用)
> 学习进度(当前位置、周记、季度复盘)统一记在 [[01_Projects/Personal-Tech/LLM_Evaluation/05-Progress/00-当前位置与下一步|05-Progress]];本目录只负责入口与勾选。
原则:这里回答 **Why** 与"我学到哪了"What 在 `00-Foundations`How 在 `02-Practical-Roadmap`