Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md
T

91 lines
5.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
aliases:
- 精选外部资源
- 硬核评测资源
type: reference
tags:
- llm-evaluation
- resources
- archive
status: active
created: 2026-08-21
---
# 精选外部评测资源(真材实料级)
> 目的:不是收藏大量 AI 资料,而是锁定顶级大厂、顶尖开源组织在生产环境中沉淀出的核心方案、底层评测基建与硬核课程源码。按需查阅,不按顺序通读。
## 1. 国家级与顶级学术机构的"硬核基建"
这些是真正用于测试前沿模型(Frontier Models)的底层系统,揭示了顶级团队如何解决代码沙箱、评测污染和环境依赖问题。
### AISI Engineering Playbook & Inspect AI Framework
- Playbook<https://engineering-playbook.aisi.org.uk/>
- 框架:<https://github.com/UKGovernmentBEIS/inspect_ai>
- 来源:英国人工智能安全研究所(UK AISI)官方开源
- 含金量:国家级安全评测机构测试顶尖大模型使用的完整底座。Playbook 阐述高难度评测的 5 层架构(Evaluate, Isolate, Connect, Run, Scale),重点解决如何安全运行大模型生成的不受信代码(沙箱环境)以及大规模评测的工程化调度。
### lm-evaluation-harness
- <https://github.com/EleutherAI/lm-evaluation-harness>
- 来源:EleutherAI 维护的学术界公认标准评测工具
- 含金量:几乎所有开源模型在 Hugging Face 排行榜上的分数都是用它在跑。内置严苛的数据去污染(Decontamination)机制(防止模型训练时偷看评测集答案),是深入理解 MMLU、GSM8K 等学术 Benchmark 评测逻辑的必读源码。
### OLMES
- <https://github.com/allenai/olmes>
- 来源:艾伦人工智能研究所(Ai2),专为 OLMo/Tülu 模型打造的严格可复现评测标准
- 含金量:市面上很多评测换个 Prompt 分数就大变。该仓库提供一套极其标准化的 Prompt 模板、格式化和指标度量方案,实现"苹果与苹果对比(Apples-to-Apples"。
## 2. 云厂商生产环境的官方一线实战(含源码)
### AWS Generative AI Evaluations Workshop
- <https://github.com/aws-samples/sample-gen-ai-evaluations-workshop>
- 来源:AWS 官方团队沉淀的大模型垂直场景评测工作坊
- 含金量:目前 GitHub 上针对垂直场景最全、最硬核的实战代码库之一,直接给出以下场景的真实评测代码:
- 多模态 RAG 评测(混合文本、视觉与音频检索)
- 工具调用(Tool Calling)的 5 种渐进式评测方法(无需真实执行工具)
- 自动化推理逻辑验证(利用 SMT 求解器检查输出是否违反合规规则)
- 多智能体记忆协同(Shared Context)评测
### Automated RAG with Ragas & CircleCI
- 博客:<https://circleci.com/blog/automated-rag-pipeline-evaluation-and-benchmarking-with-ragas/>
- 源码:<https://github.com/vibrantlabsai/ragas>
- 含金量:给出实际配置文件和 Python 脚本,展示如何利用 databricks-dolly-15k 抽样数据集,在代码提交(CI/CD)时自动触发大模型评测,计算 Faithfulness(忠实度)与 Context Recall(上下文召回率),不达标直接拒绝上线。
## 3. 名校/大牛的工业级可运行课程 Notebook
### Evaluating and Debugging Generative AIDeepLearning.AI
- <https://www.deeplearning.ai/courses/evaluating-debugging-generative-ai>
- 来源:吴恩达的 DeepLearning.AI 与 Weights & Biases 联合出品
- 含金量:通过 Jupyter Notebook 讲解如何把评测变成实验追踪(Experiment Tracking),追踪 Prompt 与 Response 的演变,捕获大模型在复杂多轮交互中的微小表现差异,并用 W&B 平台可视化评测结果。
### Evidently AI — LLM Evaluations 免费课程
- 相关讨论:<https://www.reddit.com/r/LangChain/comments/1k9z2kk/free_course_on_llm_evaluation/>
- 来源:著名开源评测与可观测性框架 Evidently 团队推出的实战微课程
- 含金量:包含 10 多个端到端代码教程,亮点在于对抗性测试(Adversarial Testing / 红队测试)与自定义 LLM 裁判(Custom LLM Judges)设计的 Notebook 示例,非常贴近生产环境防护要求。
## 4. 解决"环境即数据"的下一代框架
### BenchFlow
- <https://github.com/benchflow-ai/benchflow>
- 含金量:前沿的"环境实验室"评测工程框架。主张大模型与 Agent 的能力很多时候不取决于静态数据集,而取决于它在环境中的交互能力("Environments are the new data")。提供构建强化学习环境、评测和 Post-training 的运行时(Runtime)基础设施,附带 SkillsBench 与 ClawsBench 实际评测环境。
- 配套清单:<https://github.com/benchflow-ai/awesome-evals>
## 上手建议
1. 先 clone AWS 的 Evaluations Workshop 仓库,里面分门别类的工业级评估代码能让你少走几个月的弯路。
2. 如果你的精力在 Agent 安全与深度评测,clone Inspect AI 去研究他们的沙箱隔离评测思路。
## 与本专区的关系
- 与 [[evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]] 互补:guidebook 回答"具体怎么做、有哪些坑"(概念与方法),本页回答"去哪找真材实料的生产级方案与源码"(资源与基建)。
- 按需查阅:设计某个评测类型(如多模态 RAG、工具调用、Agent 安全)时回到对应小节。
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。