diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/01-Evaluation-Infrastructure.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/01-Evaluation-Infrastructure.md new file mode 100644 index 0000000..97b1dfc --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/01-Evaluation-Infrastructure.md @@ -0,0 +1,55 @@ +--- +type: reference +tags: + - llm-evaluation + - evaluation-infrastructure +status: active +created: 2026-08-21 +--- + +# 01 · Evaluation Infrastructure + +主题:Evaluation Harness、Sandbox、Trace、Scaling + +## S 级资源(必须认真研究) + +### 1. UK AISI Engineering Playbook + Inspect AI +- 仓库:https://github.com/UKGovernmentBEIS/inspect_ai +- 背景:英国人工智能安全研究所(UK AISI)官方开源 +- 为什么看:国家级安全评测机构测试前沿模型时使用的完整底座 +- 核心思想:把评测基础设施拆成五层 + - Evaluate + - Isolate + - Connect + - Run + - Scale +- 重点抽象(映射到自己的体系): + - Task → Case + - Dataset → Dataset + - Solver → Model / Agent Adapter + - Tool / Sandbox → 隔离执行环境 + - Scorer → Grader + - Log → Trace / Outcome +- 适合阶段:完成第一个小项目以后 + +### 2. AWS Generative AI Evaluations Workshop +- 为什么看:目前垂直场景最全、最硬核的可运行实战代码 +- 覆盖场景: + - Multimodal RAG + - Tool Calling(5 种渐进式评测方法) + - Automated Reasoning(利用 SMT 求解器检查合规) + - Multi-Agent Shared Context + - Red Teaming +- 学习方式(重要): + 不要只照着 Notebook 跑。每个模块都问: + - Task 是什么? + - Case 怎么构造? + - Rubric 是什么? + - Grader 是什么? + - Failure 如何定义? + - 如何做成 Regression? +- 适合阶段:最适合作为第一个实操资源 + +## 次级参考 +- Hugging Face evaluation-guidebook(已在本目录下:[[04-Reference/evaluation-guidebook/00-Overview|evaluation-guidebook]]) +- DeepEval(应用级单元测试框架,上手快但抽象层较浅) diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/02-Benchmark-and-Reproducibility.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/02-Benchmark-and-Reproducibility.md new file mode 100644 index 0000000..b918c9c --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/02-Benchmark-and-Reproducibility.md @@ -0,0 +1,47 @@ +--- +type: reference +tags: + - llm-evaluation + - benchmark + - reproducibility +status: active +created: 2026-08-21 +--- + +# 02 · Benchmark and Reproducibility + +主题:标准化 Task、Prompt 固定、去污染、可复现比较 + +## S 级资源 + +### 1. EleutherAI lm-evaluation-harness +- 仓库:https://github.com/EleutherAI/lm-evaluation-harness +- 背景:学术界公认标准,Hugging Face Open LLM Leaderboard 长期后端之一 +- 为什么看:理解传统 LLM Benchmark 工程最好的源码 +- 真正值得学的: + - Task 如何标准化 + - Dataset 如何映射 + - Prompt 如何固定 + - Metric 如何配置 + - Few-shot 如何实现 + - Benchmark Contamination 如何处理(N-gram 去污染) +- 重点理解: + Benchmark ≠ Product Eval + 但 Benchmark 工程教会你:如何让测试定义可重复、可比较、可版本化 +- 适合阶段:完成 Foundations + Why Guide 后即可阅读 + +### 2. Ai2 OLMES / olmo-eval +- 背景:艾伦人工智能研究所(Ai2)专为 OLMo/Tülu 打造的严格可复现评测标准 +- 为什么看:解决「为什么不同团队跑同一个 benchmark,分数会不一样」 +- 核心价值:强制冻结 Evaluation Protocol + - Prompt format + - Few-shot 样本 + - Generation 参数 + - Metric 实现 + - Chat template +- 与本仓库理念一致: + Test Definition ≠ Test Execution +- 适合阶段:学完 lm-evaluation-harness 后 + +## 关键认知 +Benchmark 工程的本质是把「测试定义」做成可版本化的资产。 diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/03-Continuous-Evaluation.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/03-Continuous-Evaluation.md new file mode 100644 index 0000000..c613eaa --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/03-Continuous-Evaluation.md @@ -0,0 +1,35 @@ +--- +type: reference +tags: + - llm-evaluation + - continuous-evaluation + - ci +status: active +created: 2026-08-21 +--- + +# 03 · Continuous Evaluation + +主题:把评测从「手工跑一次」升级为「每次变更都会跑」 + +## A 级资源 + +### 1. CircleCI + RAGAS Continuous Eval +- 价值不在 RAGAS 本身,而在: + Eval → CI → Threshold → Gate +- 真正要学习的是: + Metric → Baseline → Threshold → Action + 例如: + - security_failure > 0 → fail + - overall_pass_rate ↓ → review + - latency regression → review +- RAGAS 只是 grader/metric 工具 +- 适合阶段:项目已有 regression set 后 + +### 2. DeepLearning.AI + Weights & Biases +- 真正适合学习的: + Experiment Tracking / Run / Artifact / Version / Trace / Comparison +- 建议用途:当你的目录开始出现 + runs/、runs-v2/、runs-final/、runs-final-new/ + 说明该学 experiment tracking 了 +- 不建议:一开始就为了"专业"搭 W&B diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/04-Agent-Safety-and-Environments.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/04-Agent-Safety-and-Environments.md new file mode 100644 index 0000000..5c072e9 --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/04-Agent-Safety-and-Environments.md @@ -0,0 +1,31 @@ +--- +type: reference +tags: + - llm-evaluation + - agent-evaluation + - safety +status: active +created: 2026-08-21 +--- + +# 04 · Agent Safety and Environments + +主题:Tool Use、Authorization、Sandbox、Trajectory、Interactive Environment + +## 核心资源 + +### 1. Inspect AI Sandbox + AISI +- 重点看如何安全运行不可信 Agent / 代码 +- 如何把 sandbox 当成评测基础设施的一部分 +- Trace 的完整记录方式 + +### 2. BenchFlow +- 代表重要趋势:Static Dataset → Interactive Environment +- 对 Agent 来说,Prompt + Response 已经不够 +- 真正要测:State → Action → Tool → Trajectory → Outcome +- "Environment is data" 的思路值得长期关注 +- 但这是后期内容,必须先掌握 Task / Trial / Trace / Outcome / Harness + +### 3. AWS Workshop 中的相关模块 +- Tool Calling 的 5 种渐进式评测 +- Red Teaming 示例 diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/05-Source-Reading-Checklist.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/05-Source-Reading-Checklist.md new file mode 100644 index 0000000..cff7720 --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/05-Source-Reading-Checklist.md @@ -0,0 +1,32 @@ +--- +type: reference +tags: + - llm-evaluation + - methodology + - source-reading +status: active +created: 2026-08-21 +--- + +# 05 · 源码阅读检查清单 + +每看到一个新框架,强制回答以下 8 个问题: + +1. Test case 怎么表示? → Dataset schema +2. Task 怎么定义? → Task abstraction +3. 被测系统怎么调用? → Model / Agent adapter +4. 多次运行如何表达? → Trial / seed / sampling +5. Trace 怎么保存? → Logging / trajectory +6. Success 怎么定义? → Grader / Scorer +7. 结果怎么聚合? → Metrics / Report +8. Regression 怎么做? → Suite / CI / Version + +最终你会发现: +Inspect、lm-eval、OLMES、AWS Workshop、RAGAS +表面 API 完全不同,但底层都绕不开: + +```text +Task → Dataset → Runner → Output / Trace → Grader → Metrics → Report +``` + +这才是最值得学的东西。 diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README.md new file mode 100644 index 0000000..9900714 --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README.md @@ -0,0 +1,73 @@ +--- +type: moc +tags: + - llm-evaluation + - learning-zone + - moc +status: active +created: 2026-08-21 +--- + +# 04-Reference · LLM Evaluation 资源地图 + +本目录不是"收藏夹",而是**评测工程能力地图**。 +每个资源都对应明确的能力点,并标明「为什么看、什么时候看、重点看什么」。 + +## 五层能力框架 + +```text +1. Evaluation Methodology + ↓ +2. Benchmark & Reproducibility + ↓ +3. System / Agent Evaluation + ↓ +4. Continuous Evaluation / CI + ↓ +5. Safety / Sandbox / Environment +``` + +对应到本仓库: + +```text +00-Foundations ← 方法论基础 +01-Getting-Started ← 为什么做评测 +02-Practical-Roadmap ← 工程路线 +03-Practice ← 自己动手的 Lab +04-Reference ← 本目录(深度参考) +``` + +## 推荐学习顺序(只精读 4 个) + +1. **AWS Generative AI Evaluations Workshop** + → 先看实际 Eval 长什么样(RAG / Tool Calling / Multi-Agent / Red Teaming) + +2. **EleutherAI lm-evaluation-harness** + → 理解标准化 Task、Prompt 固定、Metric 配置、去污染机制 + +3. **Inspect AI + AISI Engineering Playbook** + → 现代 Evaluation Framework 的抽象(Task / Solver / Scorer / Sandbox / Trace) + +4. **Ai2 OLMES / olmo-eval** + → 如何把 Evaluation Protocol 真正冻结,实现可复现比较 + +后续按需: +- CircleCI + RAGAS → Continuous Evaluation +- BenchFlow → Environment-based Agent Evaluation + +## 文件索引 + +| 文件 | 对应能力 | 核心资源 | +|------|----------|----------| +| [[01-Evaluation-Infrastructure\|01-Evaluation-Infrastructure]] | Harness / Sandbox / Scaling | Inspect AI, AISI Playbook, AWS Workshop | +| [[02-Benchmark-and-Reproducibility\|02-Benchmark-and-Reproducibility]] | 标准化 / 去污染 / 可复现 | lm-evaluation-harness, OLMES | +| [[03-Continuous-Evaluation\|03-Continuous-Evaluation]] | CI Gate / Experiment Tracking | RAGAS + CircleCI, W&B | +| [[04-Agent-Safety-and-Environments\|04-Agent-Safety-and-Environments]] | Tool Use / Sandbox / Trajectory | Inspect Sandbox, BenchFlow | +| [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] | 统一阅读方法论 | 固定的 8 个问题 | +| [[04-Reference/evaluation-guidebook/00-Overview\|evaluation-guidebook]] | 方法论补充 | Hugging Face 官方 Guidebook | + +## 原则 + +- 优先官方 docs、源码、Design Doc +- 二手博客 / 课程宣传只做导航,不作为主线 +- 每读一个框架,强制用 [[05-Source-Reading-Checklist\|05-Source-Reading-Checklist]] 的 8 个问题对照 diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/00-Material-List.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/00-Material-List.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/02-Intro-Cognitive-Framework-Draft.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/02-Intro-Cognitive-Framework-Draft.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/02-Intro-Cognitive-Framework-Draft.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/02-Intro-Cognitive-Framework-Draft.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/03-Roadmap-Refactor-Outline-Draft.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/03-Roadmap-Refactor-Outline-Draft.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/03-Roadmap-Refactor-Outline-Draft.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/03-Roadmap-Refactor-Outline-Draft.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/00-Overview.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/00-Overview.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/00-Overview.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/00-Overview.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/01-Automatic-Benchmarks.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/01-Automatic-Benchmarks.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/01-Automatic-Benchmarks.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/01-Automatic-Benchmarks.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/02-Human-Evaluation.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/02-Human-Evaluation.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/02-Human-Evaluation.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/02-Human-Evaluation.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/03-LLM-as-a-Judge.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/03-LLM-as-a-Judge.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/03-LLM-as-a-Judge.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/03-LLM-as-a-Judge.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/04-Troubleshooting.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/04-Troubleshooting.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/04-Troubleshooting.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/04-Troubleshooting.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/05-General-Knowledge.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/05-General-Knowledge.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/05-General-Knowledge.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/05-General-Knowledge.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/06-Yearly-Dives.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/06-Yearly-Dives.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/06-Yearly-Dives.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/06-Yearly-Dives.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/07-Resources.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/07-Resources.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/07-Resources.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/07-Resources.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/08-2025-Edition.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/08-2025-Edition.md similarity index 100% rename from 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/evaluation-guidebook/08-2025-Edition.md rename to 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/evaluation-guidebook/08-2025-Edition.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/README.md b/01_Projects/Personal-Tech/LLM_Evaluation/README.md index fab0d5b..3172413 100644 --- a/01_Projects/Personal-Tech/LLM_Evaluation/README.md +++ b/01_Projects/Personal-Tech/LLM_Evaluation/README.md @@ -43,7 +43,7 @@ created: 2026-08-21 | `01-Getting-Started` | 学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 | | `02-Practical-Roadmap` | 可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 | | `03-Practice` | 每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 | -| `04-Reference-Archive` | 旧大纲与参考草案(职业定位原文存于 02_Areas/Job) | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 | +| `04-Reference` | 评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);旧草案归档于 `archive/` | 正在执行的任务 | 保留来路和背景,但不干扰当前学习。 | | `99-Attachments` | 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 `05_Attachments`) | 主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 | ## 三条使用规则 @@ -63,5 +63,6 @@ created: 2026-08-21 - 职业与岗位背景:[[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](原文存于 02_Areas/Job) - 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]] - 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]] -- 外部权威知识参考:[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅) -- 外部精选资源:[[04-Reference-Archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码) +- 评测工程资源地图:[[04-Reference/README|04-Reference 资源地图]](五层能力框架与推荐精读顺序) +- 外部权威知识参考:[[04-Reference/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅) +- 外部精选资源(已归档):[[04-Reference/archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)