restructure 04-Reference: resource map for evaluation engineering (archive old drafts)
This commit is contained in:
@@ -0,0 +1,55 @@
|
|||||||
|
---
|
||||||
|
type: reference
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- evaluation-infrastructure
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 01 · Evaluation Infrastructure
|
||||||
|
|
||||||
|
主题:Evaluation Harness、Sandbox、Trace、Scaling
|
||||||
|
|
||||||
|
## S 级资源(必须认真研究)
|
||||||
|
|
||||||
|
### 1. UK AISI Engineering Playbook + Inspect AI
|
||||||
|
- 仓库:https://github.com/UKGovernmentBEIS/inspect_ai
|
||||||
|
- 背景:英国人工智能安全研究所(UK AISI)官方开源
|
||||||
|
- 为什么看:国家级安全评测机构测试前沿模型时使用的完整底座
|
||||||
|
- 核心思想:把评测基础设施拆成五层
|
||||||
|
- Evaluate
|
||||||
|
- Isolate
|
||||||
|
- Connect
|
||||||
|
- Run
|
||||||
|
- Scale
|
||||||
|
- 重点抽象(映射到自己的体系):
|
||||||
|
- Task → Case
|
||||||
|
- Dataset → Dataset
|
||||||
|
- Solver → Model / Agent Adapter
|
||||||
|
- Tool / Sandbox → 隔离执行环境
|
||||||
|
- Scorer → Grader
|
||||||
|
- Log → Trace / Outcome
|
||||||
|
- 适合阶段:完成第一个小项目以后
|
||||||
|
|
||||||
|
### 2. AWS Generative AI Evaluations Workshop
|
||||||
|
- 为什么看:目前垂直场景最全、最硬核的可运行实战代码
|
||||||
|
- 覆盖场景:
|
||||||
|
- Multimodal RAG
|
||||||
|
- Tool Calling(5 种渐进式评测方法)
|
||||||
|
- Automated Reasoning(利用 SMT 求解器检查合规)
|
||||||
|
- Multi-Agent Shared Context
|
||||||
|
- Red Teaming
|
||||||
|
- 学习方式(重要):
|
||||||
|
不要只照着 Notebook 跑。每个模块都问:
|
||||||
|
- Task 是什么?
|
||||||
|
- Case 怎么构造?
|
||||||
|
- Rubric 是什么?
|
||||||
|
- Grader 是什么?
|
||||||
|
- Failure 如何定义?
|
||||||
|
- 如何做成 Regression?
|
||||||
|
- 适合阶段:最适合作为第一个实操资源
|
||||||
|
|
||||||
|
## 次级参考
|
||||||
|
- Hugging Face evaluation-guidebook(已在本目录下:[[04-Reference/evaluation-guidebook/00-Overview|evaluation-guidebook]])
|
||||||
|
- DeepEval(应用级单元测试框架,上手快但抽象层较浅)
|
||||||
+47
@@ -0,0 +1,47 @@
|
|||||||
|
---
|
||||||
|
type: reference
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- benchmark
|
||||||
|
- reproducibility
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 02 · Benchmark and Reproducibility
|
||||||
|
|
||||||
|
主题:标准化 Task、Prompt 固定、去污染、可复现比较
|
||||||
|
|
||||||
|
## S 级资源
|
||||||
|
|
||||||
|
### 1. EleutherAI lm-evaluation-harness
|
||||||
|
- 仓库:https://github.com/EleutherAI/lm-evaluation-harness
|
||||||
|
- 背景:学术界公认标准,Hugging Face Open LLM Leaderboard 长期后端之一
|
||||||
|
- 为什么看:理解传统 LLM Benchmark 工程最好的源码
|
||||||
|
- 真正值得学的:
|
||||||
|
- Task 如何标准化
|
||||||
|
- Dataset 如何映射
|
||||||
|
- Prompt 如何固定
|
||||||
|
- Metric 如何配置
|
||||||
|
- Few-shot 如何实现
|
||||||
|
- Benchmark Contamination 如何处理(N-gram 去污染)
|
||||||
|
- 重点理解:
|
||||||
|
Benchmark ≠ Product Eval
|
||||||
|
但 Benchmark 工程教会你:如何让测试定义可重复、可比较、可版本化
|
||||||
|
- 适合阶段:完成 Foundations + Why Guide 后即可阅读
|
||||||
|
|
||||||
|
### 2. Ai2 OLMES / olmo-eval
|
||||||
|
- 背景:艾伦人工智能研究所(Ai2)专为 OLMo/Tülu 打造的严格可复现评测标准
|
||||||
|
- 为什么看:解决「为什么不同团队跑同一个 benchmark,分数会不一样」
|
||||||
|
- 核心价值:强制冻结 Evaluation Protocol
|
||||||
|
- Prompt format
|
||||||
|
- Few-shot 样本
|
||||||
|
- Generation 参数
|
||||||
|
- Metric 实现
|
||||||
|
- Chat template
|
||||||
|
- 与本仓库理念一致:
|
||||||
|
Test Definition ≠ Test Execution
|
||||||
|
- 适合阶段:学完 lm-evaluation-harness 后
|
||||||
|
|
||||||
|
## 关键认知
|
||||||
|
Benchmark 工程的本质是把「测试定义」做成可版本化的资产。
|
||||||
@@ -0,0 +1,35 @@
|
|||||||
|
---
|
||||||
|
type: reference
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- continuous-evaluation
|
||||||
|
- ci
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 03 · Continuous Evaluation
|
||||||
|
|
||||||
|
主题:把评测从「手工跑一次」升级为「每次变更都会跑」
|
||||||
|
|
||||||
|
## A 级资源
|
||||||
|
|
||||||
|
### 1. CircleCI + RAGAS Continuous Eval
|
||||||
|
- 价值不在 RAGAS 本身,而在:
|
||||||
|
Eval → CI → Threshold → Gate
|
||||||
|
- 真正要学习的是:
|
||||||
|
Metric → Baseline → Threshold → Action
|
||||||
|
例如:
|
||||||
|
- security_failure > 0 → fail
|
||||||
|
- overall_pass_rate ↓ → review
|
||||||
|
- latency regression → review
|
||||||
|
- RAGAS 只是 grader/metric 工具
|
||||||
|
- 适合阶段:项目已有 regression set 后
|
||||||
|
|
||||||
|
### 2. DeepLearning.AI + Weights & Biases
|
||||||
|
- 真正适合学习的:
|
||||||
|
Experiment Tracking / Run / Artifact / Version / Trace / Comparison
|
||||||
|
- 建议用途:当你的目录开始出现
|
||||||
|
runs/、runs-v2/、runs-final/、runs-final-new/
|
||||||
|
说明该学 experiment tracking 了
|
||||||
|
- 不建议:一开始就为了"专业"搭 W&B
|
||||||
+31
@@ -0,0 +1,31 @@
|
|||||||
|
---
|
||||||
|
type: reference
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- agent-evaluation
|
||||||
|
- safety
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 04 · Agent Safety and Environments
|
||||||
|
|
||||||
|
主题:Tool Use、Authorization、Sandbox、Trajectory、Interactive Environment
|
||||||
|
|
||||||
|
## 核心资源
|
||||||
|
|
||||||
|
### 1. Inspect AI Sandbox + AISI
|
||||||
|
- 重点看如何安全运行不可信 Agent / 代码
|
||||||
|
- 如何把 sandbox 当成评测基础设施的一部分
|
||||||
|
- Trace 的完整记录方式
|
||||||
|
|
||||||
|
### 2. BenchFlow
|
||||||
|
- 代表重要趋势:Static Dataset → Interactive Environment
|
||||||
|
- 对 Agent 来说,Prompt + Response 已经不够
|
||||||
|
- 真正要测:State → Action → Tool → Trajectory → Outcome
|
||||||
|
- "Environment is data" 的思路值得长期关注
|
||||||
|
- 但这是后期内容,必须先掌握 Task / Trial / Trace / Outcome / Harness
|
||||||
|
|
||||||
|
### 3. AWS Workshop 中的相关模块
|
||||||
|
- Tool Calling 的 5 种渐进式评测
|
||||||
|
- Red Teaming 示例
|
||||||
@@ -0,0 +1,32 @@
|
|||||||
|
---
|
||||||
|
type: reference
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- methodology
|
||||||
|
- source-reading
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 05 · 源码阅读检查清单
|
||||||
|
|
||||||
|
每看到一个新框架,强制回答以下 8 个问题:
|
||||||
|
|
||||||
|
1. Test case 怎么表示? → Dataset schema
|
||||||
|
2. Task 怎么定义? → Task abstraction
|
||||||
|
3. 被测系统怎么调用? → Model / Agent adapter
|
||||||
|
4. 多次运行如何表达? → Trial / seed / sampling
|
||||||
|
5. Trace 怎么保存? → Logging / trajectory
|
||||||
|
6. Success 怎么定义? → Grader / Scorer
|
||||||
|
7. 结果怎么聚合? → Metrics / Report
|
||||||
|
8. Regression 怎么做? → Suite / CI / Version
|
||||||
|
|
||||||
|
最终你会发现:
|
||||||
|
Inspect、lm-eval、OLMES、AWS Workshop、RAGAS
|
||||||
|
表面 API 完全不同,但底层都绕不开:
|
||||||
|
|
||||||
|
```text
|
||||||
|
Task → Dataset → Runner → Output / Trace → Grader → Metrics → Report
|
||||||
|
```
|
||||||
|
|
||||||
|
这才是最值得学的东西。
|
||||||
@@ -0,0 +1,73 @@
|
|||||||
|
---
|
||||||
|
type: moc
|
||||||
|
tags:
|
||||||
|
- llm-evaluation
|
||||||
|
- learning-zone
|
||||||
|
- moc
|
||||||
|
status: active
|
||||||
|
created: 2026-08-21
|
||||||
|
---
|
||||||
|
|
||||||
|
# 04-Reference · LLM Evaluation 资源地图
|
||||||
|
|
||||||
|
本目录不是"收藏夹",而是**评测工程能力地图**。
|
||||||
|
每个资源都对应明确的能力点,并标明「为什么看、什么时候看、重点看什么」。
|
||||||
|
|
||||||
|
## 五层能力框架
|
||||||
|
|
||||||
|
```text
|
||||||
|
1. Evaluation Methodology
|
||||||
|
↓
|
||||||
|
2. Benchmark & Reproducibility
|
||||||
|
↓
|
||||||
|
3. System / Agent Evaluation
|
||||||
|
↓
|
||||||
|
4. Continuous Evaluation / CI
|
||||||
|
↓
|
||||||
|
5. Safety / Sandbox / Environment
|
||||||
|
```
|
||||||
|
|
||||||
|
对应到本仓库:
|
||||||
|
|
||||||
|
```text
|
||||||
|
00-Foundations ← 方法论基础
|
||||||
|
01-Getting-Started ← 为什么做评测
|
||||||
|
02-Practical-Roadmap ← 工程路线
|
||||||
|
03-Practice ← 自己动手的 Lab
|
||||||
|
04-Reference ← 本目录(深度参考)
|
||||||
|
```
|
||||||
|
|
||||||
|
## 推荐学习顺序(只精读 4 个)
|
||||||
|
|
||||||
|
1. **AWS Generative AI Evaluations Workshop**
|
||||||
|
→ 先看实际 Eval 长什么样(RAG / Tool Calling / Multi-Agent / Red Teaming)
|
||||||
|
|
||||||
|
2. **EleutherAI lm-evaluation-harness**
|
||||||
|
→ 理解标准化 Task、Prompt 固定、Metric 配置、去污染机制
|
||||||
|
|
||||||
|
3. **Inspect AI + AISI Engineering Playbook**
|
||||||
|
→ 现代 Evaluation Framework 的抽象(Task / Solver / Scorer / Sandbox / Trace)
|
||||||
|
|
||||||
|
4. **Ai2 OLMES / olmo-eval**
|
||||||
|
→ 如何把 Evaluation Protocol 真正冻结,实现可复现比较
|
||||||
|
|
||||||
|
后续按需:
|
||||||
|
- CircleCI + RAGAS → Continuous Evaluation
|
||||||
|
- BenchFlow → Environment-based Agent Evaluation
|
||||||
|
|
||||||
|
## 文件索引
|
||||||
|
|
||||||
|
| 文件 | 对应能力 | 核心资源 |
|
||||||
|
|------|----------|----------|
|
||||||
|
| [[01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]] | Harness / Sandbox / Scaling | Inspect AI, AISI Playbook, AWS Workshop |
|
||||||
|
| [[02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]] | 标准化 / 去污染 / 可复现 | lm-evaluation-harness, OLMES |
|
||||||
|
| [[03-Continuous-Evaluation\|03-Continuous-Evaluation]] | CI Gate / Experiment Tracking | RAGAS + CircleCI, W&B |
|
||||||
|
| [[04-Agent-Safety-and-Environments\|04-Agent-Safety-and-Environments]] | Tool Use / Sandbox / Trajectory | Inspect Sandbox, BenchFlow |
|
||||||
|
| [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] | 统一阅读方法论 | 固定的 8 个问题 |
|
||||||
|
| [[04-Reference/evaluation-guidebook/00-Overview\|evaluation-guidebook]] | 方法论补充 | Hugging Face 官方 Guidebook |
|
||||||
|
|
||||||
|
## 原则
|
||||||
|
|
||||||
|
- 优先官方 docs、源码、Design Doc
|
||||||
|
- 二手博客 / 课程宣传只做导航,不作为主线
|
||||||
|
- 每读一个框架,强制用 [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] 的 8 个问题对照
|
||||||
@@ -43,7 +43,7 @@ created: 2026-08-21
|
|||||||
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
|
| `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
|
||||||
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
|
| `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
|
||||||
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
|
| `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
|
||||||
| `04-Reference-Archive` | 旧大纲与参考草案(职业定位原文存于 02_Areas/Job) | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
|
| `04-Reference` | 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);旧草案归档于 `archive/` | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
|
||||||
| `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments`) | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
|
| `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments`) | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
|
||||||
|
|
||||||
## 三条使用规则
|
## 三条使用规则
|
||||||
@@ -63,5 +63,6 @@ created: 2026-08-21
|
|||||||
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job)
|
- 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job)
|
||||||
- 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]]
|
- 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]]
|
||||||
- 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]]
|
- 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]]
|
||||||
- 外部权威知识参考:[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
|
- 评测工程资源地图:[[04-Reference/README|04-Reference 资源地图]](五层能力框架与推荐精读顺序)
|
||||||
- 外部精选资源:[[04-Reference-Archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
|
- 外部权威知识参考:[[04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
|
||||||
|
- 外部精选资源(已归档):[[04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)
|
||||||
|
|||||||
Reference in New Issue
Block a user