From 451cd42b7a2cced8976bddc28baf5b57b7774b4c Mon Sep 17 00:00:00 2001 From: windyboy Date: Fri, 21 Aug 2026 17:13:33 +0800 Subject: [PATCH] add Level 4 deep-reference checklist to learning board (04-Reference essentials) --- .../01-Getting-Started/01-Learning-Board.md | 11 +++++++++++ 1 file changed, 11 insertions(+) diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/01-Learning-Board.md b/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/01-Learning-Board.md index 9d9d701..693de06 100644 --- a/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/01-Learning-Board.md +++ b/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/01-Learning-Board.md @@ -37,6 +37,17 @@ created: 2026-08-21 - [ ] 我已决定下一阶段是 RAG、Agent tool-use、Text-to-SQL 还是 Code Agent。 - [ ] 我已开始阅读 [[01-LLM-Evaluation-Roadmap]] 中对应部分。 +## Level 4:深度参考(资源地图精读) + +> 精读顺序见 [[04-Reference/README|04-Reference 资源地图]]。只精读 4 个,其余按需查阅。 + +- [ ] 我已通读资源地图并选定自己的精读顺序。 +- [ ] AWS Workshop:我已拆解至少 1 个模块的 Task / Case / Rubric / Grader / Failure([[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。 +- [ ] lm-evaluation-harness:我能讲清 Task 标准化、Prompt 固定、Metric 配置与去污染([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。 +- [ ] Inspect AI + AISI:我能映射 Evaluate / Isolate / Connect / Run / Scale 与 Task / Solver / Scorer / Sandbox / Trace 抽象([[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。 +- [ ] OLMES:我能解释 Evaluation Protocol 冻结为何带来可复现比较([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。 +- [ ] 我已用 [[04-Reference/05-Source-Reading-Checklist\|源码阅读检查清单]] 的 8 个问题对照过至少 1 个框架。 + ## 每周复盘(复制到项目周记) ```markdown