- Why Guide: remove duplicated 20-case/rubric/test-definition tables, link to authoritative Roadmap/Worksheet instead; 10-min action points to entries - Concept Map / What-Is: cross-link narrative vs quick-reference roles - Worksheet: annotate sections with authoritative sources - 04-Reference 01-04 <-> archive/01: bidirectional resource links - archive/00-Material-List: shrink guidebook listing, now reachable from READMEs - guidebook: compress 06-Yearly-Dives 2025 section (-> 08-2025-Edition §3), add old/new version nav banners to 01-05, reverse links in 08 - README/Start-Here: link Learning Board (was orphaned)
5.5 KiB
5.5 KiB
aliases, type, tags, status, created
| aliases | type | tags | status | created | |||||
|---|---|---|---|---|---|---|---|---|---|
|
reference |
|
active | 2026-08-21 |
精选外部评测资源(真材实料级)
目的:不是收藏大量 AI 资料,而是锁定顶级大厂、顶尖开源组织在生产环境中沉淀出的核心方案、底层评测基建与硬核课程源码。按需查阅,不按顺序通读。
能力地图(每个资源对应哪层能力、何时看、重点看什么)见 04-Reference/README;本页只负责完整链接、来源背景与上手建议。
1. 国家级与顶级学术机构的"硬核基建"
这些是真正用于测试前沿模型(Frontier Models)的底层系统,揭示了顶级团队如何解决代码沙箱、评测污染和环境依赖问题。
AISI Engineering Playbook & Inspect AI Framework
- Playbook:https://engineering-playbook.aisi.org.uk/
- 框架:https://github.com/UKGovernmentBEIS/inspect_ai
- 来源:英国人工智能安全研究所(UK AISI)官方开源
- 含金量:国家级安全评测机构测试顶尖大模型使用的完整底座。Playbook 阐述高难度评测的 5 层架构(Evaluate, Isolate, Connect, Run, Scale),重点解决如何安全运行大模型生成的不受信代码(沙箱环境)以及大规模评测的工程化调度。
lm-evaluation-harness
- https://github.com/EleutherAI/lm-evaluation-harness
- 来源:EleutherAI 维护的学术界公认标准评测工具
- 含金量:几乎所有开源模型在 Hugging Face 排行榜上的分数都是用它在跑。内置严苛的数据去污染(Decontamination)机制(防止模型训练时偷看评测集答案),是深入理解 MMLU、GSM8K 等学术 Benchmark 评测逻辑的必读源码。
OLMES
- https://github.com/allenai/olmes
- 来源:艾伦人工智能研究所(Ai2),专为 OLMo/Tülu 模型打造的严格可复现评测标准
- 含金量:市面上很多评测换个 Prompt 分数就大变。该仓库提供一套极其标准化的 Prompt 模板、格式化和指标度量方案,实现"苹果与苹果对比(Apples-to-Apples)"。
2. 云厂商生产环境的官方一线实战(含源码)
AWS Generative AI Evaluations Workshop
- https://github.com/aws-samples/sample-gen-ai-evaluations-workshop
- 来源:AWS 官方团队沉淀的大模型垂直场景评测工作坊
- 含金量:目前 GitHub 上针对垂直场景最全、最硬核的实战代码库之一,直接给出以下场景的真实评测代码:
- 多模态 RAG 评测(混合文本、视觉与音频检索)
- 工具调用(Tool Calling)的 5 种渐进式评测方法(无需真实执行工具)
- 自动化推理逻辑验证(利用 SMT 求解器检查输出是否违反合规规则)
- 多智能体记忆协同(Shared Context)评测
Automated RAG with Ragas & CircleCI
- 博客:https://circleci.com/blog/automated-rag-pipeline-evaluation-and-benchmarking-with-ragas/
- 源码:https://github.com/vibrantlabsai/ragas
- 含金量:给出实际配置文件和 Python 脚本,展示如何利用 databricks-dolly-15k 抽样数据集,在代码提交(CI/CD)时自动触发大模型评测,计算 Faithfulness(忠实度)与 Context Recall(上下文召回率),不达标直接拒绝上线。
3. 名校/大牛的工业级可运行课程 Notebook
Evaluating and Debugging Generative AI(DeepLearning.AI)
- https://www.deeplearning.ai/courses/evaluating-debugging-generative-ai
- 来源:吴恩达的 DeepLearning.AI 与 Weights & Biases 联合出品
- 含金量:通过 Jupyter Notebook 讲解如何把评测变成实验追踪(Experiment Tracking),追踪 Prompt 与 Response 的演变,捕获大模型在复杂多轮交互中的微小表现差异,并用 W&B 平台可视化评测结果。
Evidently AI — LLM Evaluations 免费课程
- 相关讨论:https://www.reddit.com/r/LangChain/comments/1k9z2kk/free_course_on_llm_evaluation/
- 来源:著名开源评测与可观测性框架 Evidently 团队推出的实战微课程
- 含金量:包含 10 多个端到端代码教程,亮点在于对抗性测试(Adversarial Testing / 红队测试)与自定义 LLM 裁判(Custom LLM Judges)设计的 Notebook 示例,非常贴近生产环境防护要求。
4. 解决"环境即数据"的下一代框架
BenchFlow
- https://github.com/benchflow-ai/benchflow
- 含金量:前沿的"环境实验室"评测工程框架。主张大模型与 Agent 的能力很多时候不取决于静态数据集,而取决于它在环境中的交互能力("Environments are the new data")。提供构建强化学习环境、评测和 Post-training 的运行时(Runtime)基础设施,附带 SkillsBench 与 ClawsBench 实际评测环境。
- 配套清单:https://github.com/benchflow-ai/awesome-evals
上手建议
- 先 clone AWS 的 Evaluations Workshop 仓库,里面分门别类的工业级评估代码能让你少走几个月的弯路。
- 如果你的精力在 Agent 安全与深度评测,clone Inspect AI 去研究他们的沙箱隔离评测思路。
与本专区的关系
- 与 evaluation-guidebook/00-Overview 互补:guidebook 回答"具体怎么做、有哪些坑"(概念与方法),本页回答"去哪找真材实料的生产级方案与源码"(资源与基建)。
- 按需查阅:设计某个评测类型(如多模态 RAG、工具调用、Agent 安全)时回到对应小节。