add Level 4 deep-reference checklist to learning board (04-Reference essentials)
This commit is contained in:
@@ -37,6 +37,17 @@ created: 2026-08-21
|
|||||||
- [ ] 我已决定下一阶段是 RAG、Agent tool-use、Text-to-SQL 还是 Code Agent。
|
- [ ] 我已决定下一阶段是 RAG、Agent tool-use、Text-to-SQL 还是 Code Agent。
|
||||||
- [ ] 我已开始阅读 [[01-LLM-Evaluation-Roadmap]] 中对应部分。
|
- [ ] 我已开始阅读 [[01-LLM-Evaluation-Roadmap]] 中对应部分。
|
||||||
|
|
||||||
|
## Level 4:深度参考(资源地图精读)
|
||||||
|
|
||||||
|
> 精读顺序见 [[04-Reference/README|04-Reference 资源地图]]。只精读 4 个,其余按需查阅。
|
||||||
|
|
||||||
|
- [ ] 我已通读资源地图并选定自己的精读顺序。
|
||||||
|
- [ ] AWS Workshop:我已拆解至少 1 个模块的 Task / Case / Rubric / Grader / Failure([[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
|
||||||
|
- [ ] lm-evaluation-harness:我能讲清 Task 标准化、Prompt 固定、Metric 配置与去污染([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
|
||||||
|
- [ ] Inspect AI + AISI:我能映射 Evaluate / Isolate / Connect / Run / Scale 与 Task / Solver / Scorer / Sandbox / Trace 抽象([[04-Reference/01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]])。
|
||||||
|
- [ ] OLMES:我能解释 Evaluation Protocol 冻结为何带来可复现比较([[04-Reference/02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]])。
|
||||||
|
- [ ] 我已用 [[04-Reference/05-Source-Reading-Checklist\|源码阅读检查清单]] 的 8 个问题对照过至少 1 个框架。
|
||||||
|
|
||||||
## 每周复盘(复制到项目周记)
|
## 每周复盘(复制到项目周记)
|
||||||
|
|
||||||
```markdown
|
```markdown
|
||||||
|
|||||||
Reference in New Issue
Block a user