From 0f255940880d7d6c5bed198717ec7523c980f404 Mon Sep 17 00:00:00 2001 From: windyboy Date: Fri, 21 Aug 2026 16:55:55 +0800 Subject: [PATCH] add curated external resources reference note to LLM_Evaluation zone --- .../04-Reference-Archive/00-Material-List.md | 1 + .../01-Curated-External-Resources.md | 91 +++++++++++++++++++ .../Personal-Tech/LLM_Evaluation/README.md | 1 + 3 files changed, 93 insertions(+) create mode 100644 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md index 052b8ca..c263f12 100644 --- a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md @@ -19,6 +19,7 @@ created: 2026-08-21 | [[02-Intro-Cognitive-Framework-Draft]] | Why Guide 的概念设计底稿 | 想研究内容设计或自行扩展课程时 | 已被正式 Why Guide 吸收,不建议日常阅读。 | | [[03-Roadmap-Refactor-Outline-Draft]] | Practical Roadmap 的结构设计底稿 | 想理解路线如何从审阅意见演化时 | 正式路线图已更完整,草案只保留历史价值。 | | [[evaluation-guidebook/00-Overview\|HuggingFace Evaluation Guidebook 中文提炼(子目录)]] | 外部权威评测知识参考(自动基准 / 人工评测 / LLM-as-judge / 排错等) | 设计或执行评测时按主题查阅 | 是外部资料的提炼笔记,作为查阅型参考而非个人学习主线的必经之路。 | +| [[01-Curated-External-Resources\|精选外部评测资源]] | 外部精选资源清单(顶级大厂与开源组织的生产级方案、评测基建、硬核课程源码) | 想找生产级方案与源码时按类型查阅 | 是外部链接的筛选清单,作为资源索引而非学习主线的必经之路。 | ## 外部知识参考(evaluation-guidebook 子目录) diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md new file mode 100644 index 0000000..67896ab --- /dev/null +++ b/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md @@ -0,0 +1,91 @@ +--- +aliases: + - 精选外部资源 + - 硬核评测资源 +type: reference +tags: + - llm-evaluation + - resources + - archive +status: active +created: 2026-08-21 +--- + +# 精选外部评测资源(真材实料级) + +> 目的:不是收藏大量 AI 资料,而是锁定顶级大厂、顶尖开源组织在生产环境中沉淀出的核心方案、底层评测基建与硬核课程源码。按需查阅,不按顺序通读。 + +## 1. 国家级与顶级学术机构的"硬核基建" + +这些是真正用于测试前沿模型(Frontier Models)的底层系统,揭示了顶级团队如何解决代码沙箱、评测污染和环境依赖问题。 + +### AISI Engineering Playbook & Inspect AI Framework + +- Playbook: +- 框架: +- 来源:英国人工智能安全研究所(UK AISI)官方开源 +- 含金量:国家级安全评测机构测试顶尖大模型使用的完整底座。Playbook 阐述高难度评测的 5 层架构(Evaluate, Isolate, Connect, Run, Scale),重点解决如何安全运行大模型生成的不受信代码(沙箱环境)以及大规模评测的工程化调度。 + +### lm-evaluation-harness + +- +- 来源:EleutherAI 维护的学术界公认标准评测工具 +- 含金量:几乎所有开源模型在 Hugging Face 排行榜上的分数都是用它在跑。内置严苛的数据去污染(Decontamination)机制(防止模型训练时偷看评测集答案),是深入理解 MMLU、GSM8K 等学术 Benchmark 评测逻辑的必读源码。 + +### OLMES + +- +- 来源:艾伦人工智能研究所(Ai2),专为 OLMo/Tülu 模型打造的严格可复现评测标准 +- 含金量:市面上很多评测换个 Prompt 分数就大变。该仓库提供一套极其标准化的 Prompt 模板、格式化和指标度量方案,实现"苹果与苹果对比(Apples-to-Apples)"。 + +## 2. 云厂商生产环境的官方一线实战(含源码) + +### AWS Generative AI Evaluations Workshop + +- +- 来源:AWS 官方团队沉淀的大模型垂直场景评测工作坊 +- 含金量:目前 GitHub 上针对垂直场景最全、最硬核的实战代码库之一,直接给出以下场景的真实评测代码: + - 多模态 RAG 评测(混合文本、视觉与音频检索) + - 工具调用(Tool Calling)的 5 种渐进式评测方法(无需真实执行工具) + - 自动化推理逻辑验证(利用 SMT 求解器检查输出是否违反合规规则) + - 多智能体记忆协同(Shared Context)评测 + +### Automated RAG with Ragas & CircleCI + +- 博客: +- 源码: +- 含金量:给出实际配置文件和 Python 脚本,展示如何利用 databricks-dolly-15k 抽样数据集,在代码提交(CI/CD)时自动触发大模型评测,计算 Faithfulness(忠实度)与 Context Recall(上下文召回率),不达标直接拒绝上线。 + +## 3. 名校/大牛的工业级可运行课程 Notebook + +### Evaluating and Debugging Generative AI(DeepLearning.AI) + +- +- 来源:吴恩达的 DeepLearning.AI 与 Weights & Biases 联合出品 +- 含金量:通过 Jupyter Notebook 讲解如何把评测变成实验追踪(Experiment Tracking),追踪 Prompt 与 Response 的演变,捕获大模型在复杂多轮交互中的微小表现差异,并用 W&B 平台可视化评测结果。 + +### Evidently AI — LLM Evaluations 免费课程 + +- 相关讨论: +- 来源:著名开源评测与可观测性框架 Evidently 团队推出的实战微课程 +- 含金量:包含 10 多个端到端代码教程,亮点在于对抗性测试(Adversarial Testing / 红队测试)与自定义 LLM 裁判(Custom LLM Judges)设计的 Notebook 示例,非常贴近生产环境防护要求。 + +## 4. 解决"环境即数据"的下一代框架 + +### BenchFlow + +- +- 含金量:前沿的"环境实验室"评测工程框架。主张大模型与 Agent 的能力很多时候不取决于静态数据集,而取决于它在环境中的交互能力("Environments are the new data")。提供构建强化学习环境、评测和 Post-training 的运行时(Runtime)基础设施,附带 SkillsBench 与 ClawsBench 实际评测环境。 +- 配套清单: + +## 上手建议 + +1. 先 clone AWS 的 Evaluations Workshop 仓库,里面分门别类的工业级评估代码能让你少走几个月的弯路。 +2. 如果你的精力在 Agent 安全与深度评测,clone Inspect AI 去研究他们的沙箱隔离评测思路。 + +## 与本专区的关系 + +- 与 [[evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]] 互补:guidebook 回答"具体怎么做、有哪些坑"(概念与方法),本页回答"去哪找真材实料的生产级方案与源码"(资源与基建)。 +- 按需查阅:设计某个评测类型(如多模态 RAG、工具调用、Agent 安全)时回到对应小节。 + +返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。 \ No newline at end of file diff --git a/01_Projects/Personal-Tech/LLM_Evaluation/README.md b/01_Projects/Personal-Tech/LLM_Evaluation/README.md index 14b08eb..fab0d5b 100644 --- a/01_Projects/Personal-Tech/LLM_Evaluation/README.md +++ b/01_Projects/Personal-Tech/LLM_Evaluation/README.md @@ -64,3 +64,4 @@ created: 2026-08-21 - 入门认知草案:[[02-Intro-Cognitive-Framework-Draft|入门认知框架(草案)]] - 路线图重构草案:[[03-Roadmap-Refactor-Outline-Draft|实战路线图重构大纲(草案)]] - 外部权威知识参考:[[04-Reference-Archive/evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]](自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅) +- 外部精选资源:[[04-Reference-Archive/01-Curated-External-Resources|精选外部评测资源]](顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)