restructure 04-Reference: resource map for evaluation engineering (archive old drafts)

This commit is contained in:
windyboy
2026-08-21 17:12:45 +08:00
parent 0f25594088
commit 4523ce67b3
20 changed files with 277 additions and 3 deletions
@@ -0,0 +1,55 @@
---
type: reference
tags:
- llm-evaluation
- evaluation-infrastructure
status: active
created: 2026-08-21
---
# 01 · Evaluation Infrastructure
主题:Evaluation Harness、Sandbox、Trace、Scaling
## S 级资源(必须认真研究)
### 1. UK AISI Engineering Playbook + Inspect AI
- 仓库:https://github.com/UKGovernmentBEIS/inspect_ai
- 背景:英国人工智能安全研究所(UK AISI)官方开源
- 为什么看:国家级安全评测机构测试前沿模型时使用的完整底座
- 核心思想:把评测基础设施拆成五层
- Evaluate
- Isolate
- Connect
- Run
- Scale
- 重点抽象(映射到自己的体系):
- Task → Case
- Dataset → Dataset
- Solver → Model / Agent Adapter
- Tool / Sandbox → 隔离执行环境
- Scorer → Grader
- Log → Trace / Outcome
- 适合阶段:完成第一个小项目以后
### 2. AWS Generative AI Evaluations Workshop
- 为什么看:目前垂直场景最全、最硬核的可运行实战代码
- 覆盖场景:
- Multimodal RAG
- Tool Calling5 种渐进式评测方法)
- Automated Reasoning(利用 SMT 求解器检查合规)
- Multi-Agent Shared Context
- Red Teaming
- 学习方式(重要):
不要只照着 Notebook 跑。每个模块都问:
- Task 是什么?
- Case 怎么构造?
- Rubric 是什么?
- Grader 是什么?
- Failure 如何定义?
- 如何做成 Regression
- 适合阶段:最适合作为第一个实操资源
## 次级参考
- Hugging Face evaluation-guidebook(已在本目录下:[[04-Reference/evaluation-guidebook/00-Overview|evaluation-guidebook]]
- DeepEval(应用级单元测试框架,上手快但抽象层较浅)
@@ -0,0 +1,47 @@
---
type: reference
tags:
- llm-evaluation
- benchmark
- reproducibility
status: active
created: 2026-08-21
---
# 02 · Benchmark and Reproducibility
主题:标准化 Task、Prompt 固定、去污染、可复现比较
## S 级资源
### 1. EleutherAI lm-evaluation-harness
- 仓库:https://github.com/EleutherAI/lm-evaluation-harness
- 背景:学术界公认标准,Hugging Face Open LLM Leaderboard 长期后端之一
- 为什么看:理解传统 LLM Benchmark 工程最好的源码
- 真正值得学的:
- Task 如何标准化
- Dataset 如何映射
- Prompt 如何固定
- Metric 如何配置
- Few-shot 如何实现
- Benchmark Contamination 如何处理(N-gram 去污染)
- 重点理解:
Benchmark ≠ Product Eval
但 Benchmark 工程教会你:如何让测试定义可重复、可比较、可版本化
- 适合阶段:完成 Foundations + Why Guide 后即可阅读
### 2. Ai2 OLMES / olmo-eval
- 背景:艾伦人工智能研究所(Ai2)专为 OLMo/Tülu 打造的严格可复现评测标准
- 为什么看:解决「为什么不同团队跑同一个 benchmark,分数会不一样」
- 核心价值:强制冻结 Evaluation Protocol
- Prompt format
- Few-shot 样本
- Generation 参数
- Metric 实现
- Chat template
- 与本仓库理念一致:
Test Definition ≠ Test Execution
- 适合阶段:学完 lm-evaluation-harness 后
## 关键认知
Benchmark 工程的本质是把「测试定义」做成可版本化的资产。
@@ -0,0 +1,35 @@
---
type: reference
tags:
- llm-evaluation
- continuous-evaluation
- ci
status: active
created: 2026-08-21
---
# 03 · Continuous Evaluation
主题:把评测从「手工跑一次」升级为「每次变更都会跑」
## A 级资源
### 1. CircleCI + RAGAS Continuous Eval
- 价值不在 RAGAS 本身,而在:
Eval → CI → Threshold → Gate
- 真正要学习的是:
Metric → Baseline → Threshold → Action
例如:
- security_failure > 0 → fail
- overall_pass_rate ↓ → review
- latency regression → review
- RAGAS 只是 grader/metric 工具
- 适合阶段:项目已有 regression set 后
### 2. DeepLearning.AI + Weights & Biases
- 真正适合学习的:
Experiment Tracking / Run / Artifact / Version / Trace / Comparison
- 建议用途:当你的目录开始出现
runs/、runs-v2/、runs-final/、runs-final-new/
说明该学 experiment tracking 了
- 不建议:一开始就为了"专业"搭 W&B
@@ -0,0 +1,31 @@
---
type: reference
tags:
- llm-evaluation
- agent-evaluation
- safety
status: active
created: 2026-08-21
---
# 04 · Agent Safety and Environments
主题:Tool Use、Authorization、Sandbox、Trajectory、Interactive Environment
## 核心资源
### 1. Inspect AI Sandbox + AISI
- 重点看如何安全运行不可信 Agent / 代码
- 如何把 sandbox 当成评测基础设施的一部分
- Trace 的完整记录方式
### 2. BenchFlow
- 代表重要趋势:Static Dataset → Interactive Environment
- 对 Agent 来说,Prompt + Response 已经不够
- 真正要测:State → Action → Tool → Trajectory → Outcome
- "Environment is data" 的思路值得长期关注
- 但这是后期内容,必须先掌握 Task / Trial / Trace / Outcome / Harness
### 3. AWS Workshop 中的相关模块
- Tool Calling 的 5 种渐进式评测
- Red Teaming 示例
@@ -0,0 +1,32 @@
---
type: reference
tags:
- llm-evaluation
- methodology
- source-reading
status: active
created: 2026-08-21
---
# 05 · 源码阅读检查清单
每看到一个新框架,强制回答以下 8 个问题:
1. Test case 怎么表示? → Dataset schema
2. Task 怎么定义? → Task abstraction
3. 被测系统怎么调用? → Model / Agent adapter
4. 多次运行如何表达? → Trial / seed / sampling
5. Trace 怎么保存? → Logging / trajectory
6. Success 怎么定义? → Grader / Scorer
7. 结果怎么聚合? → Metrics / Report
8. Regression 怎么做? → Suite / CI / Version
最终你会发现:
Inspect、lm-eval、OLMES、AWS Workshop、RAGAS
表面 API 完全不同,但底层都绕不开:
```text
Task → Dataset → Runner → Output / Trace → Grader → Metrics → Report
```
这才是最值得学的东西。
@@ -0,0 +1,73 @@
---
type: moc
tags:
- llm-evaluation
- learning-zone
- moc
status: active
created: 2026-08-21
---
# 04-Reference · LLM Evaluation 资源地图
本目录不是"收藏夹",而是**评测工程能力地图**。
每个资源都对应明确的能力点,并标明「为什么看、什么时候看、重点看什么」。
## 五层能力框架
```text
1. Evaluation Methodology
2. Benchmark & Reproducibility
3. System / Agent Evaluation
4. Continuous Evaluation / CI
5. Safety / Sandbox / Environment
```
对应到本仓库:
```text
00-Foundations ← 方法论基础
01-Getting-Started ← 为什么做评测
02-Practical-Roadmap ← 工程路线
03-Practice ← 自己动手的 Lab
04-Reference ← 本目录(深度参考)
```
## 推荐学习顺序(只精读 4 个)
1. **AWS Generative AI Evaluations Workshop**
→ 先看实际 Eval 长什么样(RAG / Tool Calling / Multi-Agent / Red Teaming
2. **EleutherAI lm-evaluation-harness**
→ 理解标准化 Task、Prompt 固定、Metric 配置、去污染机制
3. **Inspect AI + AISI Engineering Playbook**
→ 现代 Evaluation Framework 的抽象(Task / Solver / Scorer / Sandbox / Trace
4. **Ai2 OLMES / olmo-eval**
→ 如何把 Evaluation Protocol 真正冻结,实现可复现比较
后续按需:
- CircleCI + RAGAS → Continuous Evaluation
- BenchFlow → Environment-based Agent Evaluation
## 文件索引
| 文件 | 对应能力 | 核心资源 |
|------|----------|----------|
| [[01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]] | Harness / Sandbox / Scaling | Inspect AI, AISI Playbook, AWS Workshop |
| [[02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]] | 标准化 / 去污染 / 可复现 | lm-evaluation-harness, OLMES |
| [[03-Continuous-Evaluation\|03-Continuous-Evaluation]] | CI Gate / Experiment Tracking | RAGAS + CircleCI, W&B |
| [[04-Agent-Safety-and-Environments\|04-Agent-Safety-and-Environments]] | Tool Use / Sandbox / Trajectory | Inspect Sandbox, BenchFlow |
| [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] | 统一阅读方法论 | 固定的 8 个问题 |
| [[04-Reference/evaluation-guidebook/00-Overview\|evaluation-guidebook]] | 方法论补充 | Hugging Face 官方 Guidebook |
## 原则
- 优先官方 docs、源码、Design Doc
- 二手博客 / 课程宣传只做导航,不作为主线
- 每读一个框架,强制用 [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] 的 8 个问题对照
@@ -43,7 +43,7 @@ created: 2026-08-21
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
| `04-Reference-Archive` | 旧大纲与参考草案(职业定位原文存于 02_Areas/Job | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
| `04-Reference` | 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);旧草案归档于 `archive/` | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
| `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments` | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
## 三条使用规则
@@ -63,5 +63,6 @@ created: 2026-08-21
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job
- 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]]
- 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]]
- 外部权威知识参考[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅
- 外部精选资源[[04-Reference-Archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码
- 评测工程资源地图[[04-Reference/README|04-Reference 资源地图]](五层能力框架与推荐精读顺序
- 外部权威知识参考[[04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅
- 外部精选资源(已归档):[[04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)