restructure 04-Reference: resource map for evaluation engineering (archive old drafts)
This commit is contained in:
@@ -0,0 +1,55 @@
|
||||
---
|
||||
type: reference
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- evaluation-infrastructure
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 01 · Evaluation Infrastructure
|
||||
|
||||
主题:Evaluation Harness、Sandbox、Trace、Scaling
|
||||
|
||||
## S 级资源(必须认真研究)
|
||||
|
||||
### 1. UK AISI Engineering Playbook + Inspect AI
|
||||
- 仓库:https://github.com/UKGovernmentBEIS/inspect_ai
|
||||
- 背景:英国人工智能安全研究所(UK AISI)官方开源
|
||||
- 为什么看:国家级安全评测机构测试前沿模型时使用的完整底座
|
||||
- 核心思想:把评测基础设施拆成五层
|
||||
- Evaluate
|
||||
- Isolate
|
||||
- Connect
|
||||
- Run
|
||||
- Scale
|
||||
- 重点抽象(映射到自己的体系):
|
||||
- Task → Case
|
||||
- Dataset → Dataset
|
||||
- Solver → Model / Agent Adapter
|
||||
- Tool / Sandbox → 隔离执行环境
|
||||
- Scorer → Grader
|
||||
- Log → Trace / Outcome
|
||||
- 适合阶段:完成第一个小项目以后
|
||||
|
||||
### 2. AWS Generative AI Evaluations Workshop
|
||||
- 为什么看:目前垂直场景最全、最硬核的可运行实战代码
|
||||
- 覆盖场景:
|
||||
- Multimodal RAG
|
||||
- Tool Calling(5 种渐进式评测方法)
|
||||
- Automated Reasoning(利用 SMT 求解器检查合规)
|
||||
- Multi-Agent Shared Context
|
||||
- Red Teaming
|
||||
- 学习方式(重要):
|
||||
不要只照着 Notebook 跑。每个模块都问:
|
||||
- Task 是什么?
|
||||
- Case 怎么构造?
|
||||
- Rubric 是什么?
|
||||
- Grader 是什么?
|
||||
- Failure 如何定义?
|
||||
- 如何做成 Regression?
|
||||
- 适合阶段:最适合作为第一个实操资源
|
||||
|
||||
## 次级参考
|
||||
- Hugging Face evaluation-guidebook(已在本目录下:[[04-Reference/evaluation-guidebook/00-Overview|evaluation-guidebook]])
|
||||
- DeepEval(应用级单元测试框架,上手快但抽象层较浅)
|
||||
+47
@@ -0,0 +1,47 @@
|
||||
---
|
||||
type: reference
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- benchmark
|
||||
- reproducibility
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 02 · Benchmark and Reproducibility
|
||||
|
||||
主题:标准化 Task、Prompt 固定、去污染、可复现比较
|
||||
|
||||
## S 级资源
|
||||
|
||||
### 1. EleutherAI lm-evaluation-harness
|
||||
- 仓库:https://github.com/EleutherAI/lm-evaluation-harness
|
||||
- 背景:学术界公认标准,Hugging Face Open LLM Leaderboard 长期后端之一
|
||||
- 为什么看:理解传统 LLM Benchmark 工程最好的源码
|
||||
- 真正值得学的:
|
||||
- Task 如何标准化
|
||||
- Dataset 如何映射
|
||||
- Prompt 如何固定
|
||||
- Metric 如何配置
|
||||
- Few-shot 如何实现
|
||||
- Benchmark Contamination 如何处理(N-gram 去污染)
|
||||
- 重点理解:
|
||||
Benchmark ≠ Product Eval
|
||||
但 Benchmark 工程教会你:如何让测试定义可重复、可比较、可版本化
|
||||
- 适合阶段:完成 Foundations + Why Guide 后即可阅读
|
||||
|
||||
### 2. Ai2 OLMES / olmo-eval
|
||||
- 背景:艾伦人工智能研究所(Ai2)专为 OLMo/Tülu 打造的严格可复现评测标准
|
||||
- 为什么看:解决「为什么不同团队跑同一个 benchmark,分数会不一样」
|
||||
- 核心价值:强制冻结 Evaluation Protocol
|
||||
- Prompt format
|
||||
- Few-shot 样本
|
||||
- Generation 参数
|
||||
- Metric 实现
|
||||
- Chat template
|
||||
- 与本仓库理念一致:
|
||||
Test Definition ≠ Test Execution
|
||||
- 适合阶段:学完 lm-evaluation-harness 后
|
||||
|
||||
## 关键认知
|
||||
Benchmark 工程的本质是把「测试定义」做成可版本化的资产。
|
||||
@@ -0,0 +1,35 @@
|
||||
---
|
||||
type: reference
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- continuous-evaluation
|
||||
- ci
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 03 · Continuous Evaluation
|
||||
|
||||
主题:把评测从「手工跑一次」升级为「每次变更都会跑」
|
||||
|
||||
## A 级资源
|
||||
|
||||
### 1. CircleCI + RAGAS Continuous Eval
|
||||
- 价值不在 RAGAS 本身,而在:
|
||||
Eval → CI → Threshold → Gate
|
||||
- 真正要学习的是:
|
||||
Metric → Baseline → Threshold → Action
|
||||
例如:
|
||||
- security_failure > 0 → fail
|
||||
- overall_pass_rate ↓ → review
|
||||
- latency regression → review
|
||||
- RAGAS 只是 grader/metric 工具
|
||||
- 适合阶段:项目已有 regression set 后
|
||||
|
||||
### 2. DeepLearning.AI + Weights & Biases
|
||||
- 真正适合学习的:
|
||||
Experiment Tracking / Run / Artifact / Version / Trace / Comparison
|
||||
- 建议用途:当你的目录开始出现
|
||||
runs/、runs-v2/、runs-final/、runs-final-new/
|
||||
说明该学 experiment tracking 了
|
||||
- 不建议:一开始就为了"专业"搭 W&B
|
||||
+31
@@ -0,0 +1,31 @@
|
||||
---
|
||||
type: reference
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- agent-evaluation
|
||||
- safety
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 04 · Agent Safety and Environments
|
||||
|
||||
主题:Tool Use、Authorization、Sandbox、Trajectory、Interactive Environment
|
||||
|
||||
## 核心资源
|
||||
|
||||
### 1. Inspect AI Sandbox + AISI
|
||||
- 重点看如何安全运行不可信 Agent / 代码
|
||||
- 如何把 sandbox 当成评测基础设施的一部分
|
||||
- Trace 的完整记录方式
|
||||
|
||||
### 2. BenchFlow
|
||||
- 代表重要趋势:Static Dataset → Interactive Environment
|
||||
- 对 Agent 来说,Prompt + Response 已经不够
|
||||
- 真正要测:State → Action → Tool → Trajectory → Outcome
|
||||
- "Environment is data" 的思路值得长期关注
|
||||
- 但这是后期内容,必须先掌握 Task / Trial / Trace / Outcome / Harness
|
||||
|
||||
### 3. AWS Workshop 中的相关模块
|
||||
- Tool Calling 的 5 种渐进式评测
|
||||
- Red Teaming 示例
|
||||
@@ -0,0 +1,32 @@
|
||||
---
|
||||
type: reference
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- methodology
|
||||
- source-reading
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 05 · 源码阅读检查清单
|
||||
|
||||
每看到一个新框架,强制回答以下 8 个问题:
|
||||
|
||||
1. Test case 怎么表示? → Dataset schema
|
||||
2. Task 怎么定义? → Task abstraction
|
||||
3. 被测系统怎么调用? → Model / Agent adapter
|
||||
4. 多次运行如何表达? → Trial / seed / sampling
|
||||
5. Trace 怎么保存? → Logging / trajectory
|
||||
6. Success 怎么定义? → Grader / Scorer
|
||||
7. 结果怎么聚合? → Metrics / Report
|
||||
8. Regression 怎么做? → Suite / CI / Version
|
||||
|
||||
最终你会发现:
|
||||
Inspect、lm-eval、OLMES、AWS Workshop、RAGAS
|
||||
表面 API 完全不同,但底层都绕不开:
|
||||
|
||||
```text
|
||||
Task → Dataset → Runner → Output / Trace → Grader → Metrics → Report
|
||||
```
|
||||
|
||||
这才是最值得学的东西。
|
||||
@@ -0,0 +1,73 @@
|
||||
---
|
||||
type: moc
|
||||
tags:
|
||||
- llm-evaluation
|
||||
- learning-zone
|
||||
- moc
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 04-Reference · LLM Evaluation 资源地图
|
||||
|
||||
本目录不是"收藏夹",而是**评测工程能力地图**。
|
||||
每个资源都对应明确的能力点,并标明「为什么看、什么时候看、重点看什么」。
|
||||
|
||||
## 五层能力框架
|
||||
|
||||
```text
|
||||
1. Evaluation Methodology
|
||||
↓
|
||||
2. Benchmark & Reproducibility
|
||||
↓
|
||||
3. System / Agent Evaluation
|
||||
↓
|
||||
4. Continuous Evaluation / CI
|
||||
↓
|
||||
5. Safety / Sandbox / Environment
|
||||
```
|
||||
|
||||
对应到本仓库:
|
||||
|
||||
```text
|
||||
00-Foundations ← 方法论基础
|
||||
01-Getting-Started ← 为什么做评测
|
||||
02-Practical-Roadmap ← 工程路线
|
||||
03-Practice ← 自己动手的 Lab
|
||||
04-Reference ← 本目录(深度参考)
|
||||
```
|
||||
|
||||
## 推荐学习顺序(只精读 4 个)
|
||||
|
||||
1. **AWS Generative AI Evaluations Workshop**
|
||||
→ 先看实际 Eval 长什么样(RAG / Tool Calling / Multi-Agent / Red Teaming)
|
||||
|
||||
2. **EleutherAI lm-evaluation-harness**
|
||||
→ 理解标准化 Task、Prompt 固定、Metric 配置、去污染机制
|
||||
|
||||
3. **Inspect AI + AISI Engineering Playbook**
|
||||
→ 现代 Evaluation Framework 的抽象(Task / Solver / Scorer / Sandbox / Trace)
|
||||
|
||||
4. **Ai2 OLMES / olmo-eval**
|
||||
→ 如何把 Evaluation Protocol 真正冻结,实现可复现比较
|
||||
|
||||
后续按需:
|
||||
- CircleCI + RAGAS → Continuous Evaluation
|
||||
- BenchFlow → Environment-based Agent Evaluation
|
||||
|
||||
## 文件索引
|
||||
|
||||
| 文件 | 对应能力 | 核心资源 |
|
||||
|------|----------|----------|
|
||||
| [[01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]] | Harness / Sandbox / Scaling | Inspect AI, AISI Playbook, AWS Workshop |
|
||||
| [[02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]] | 标准化 / 去污染 / 可复现 | lm-evaluation-harness, OLMES |
|
||||
| [[03-Continuous-Evaluation\|03-Continuous-Evaluation]] | CI Gate / Experiment Tracking | RAGAS + CircleCI, W&B |
|
||||
| [[04-Agent-Safety-and-Environments\|04-Agent-Safety-and-Environments]] | Tool Use / Sandbox / Trajectory | Inspect Sandbox, BenchFlow |
|
||||
| [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] | 统一阅读方法论 | 固定的 8 个问题 |
|
||||
| [[04-Reference/evaluation-guidebook/00-Overview\|evaluation-guidebook]] | 方法论补充 | Hugging Face 官方 Guidebook |
|
||||
|
||||
## 原则
|
||||
|
||||
- 优先官方 docs、源码、Design Doc
|
||||
- 二手博客 / 课程宣传只做导航,不作为主线
|
||||
- 每读一个框架,强制用 [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] 的 8 个问题对照
|
||||
@@ -43,7 +43,7 @@ created: 2026-08-21
|
||||
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
|
||||
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
|
||||
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
|
||||
| `04-Reference-Archive` | 旧大纲与参考草案(职业定位原文存于 02_Areas/Job) | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
|
||||
| `04-Reference` | 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);旧草案归档于 `archive/` | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
|
||||
| `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments`) | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
|
||||
|
||||
## 三条使用规则
|
||||
@@ -63,5 +63,6 @@ created: 2026-08-21
|
||||
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job)
|
||||
- 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]]
|
||||
- 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]]
|
||||
- 外部权威知识参考:[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
|
||||
- 外部精选资源:[[04-Reference-Archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
|
||||
- 评测工程资源地图:[[04-Reference/README|04-Reference 资源地图]](五层能力框架与推荐精读顺序)
|
||||
- 外部权威知识参考:[[04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
|
||||
- 外部精选资源(已归档):[[04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
|
||||
|
||||
Reference in New Issue
Block a user