Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/01-Curated-External-Resources.md
T

91 lines
5.4 KiB
Markdown
Raw Normal View History

---
aliases:
- 精选外部资源
- 硬核评测资源
type: reference
tags:
- llm-evaluation
- resources
- archive
status: active
created: 2026-08-21
---
# 精选外部评测资源(真材实料级)
> 目的:不是收藏大量 AI 资料,而是锁定顶级大厂、顶尖开源组织在生产环境中沉淀出的核心方案、底层评测基建与硬核课程源码。按需查阅,不按顺序通读。
## 1. 国家级与顶级学术机构的"硬核基建"
这些是真正用于测试前沿模型(Frontier Models)的底层系统,揭示了顶级团队如何解决代码沙箱、评测污染和环境依赖问题。
### AISI Engineering Playbook & Inspect AI Framework
- Playbook<https://engineering-playbook.aisi.org.uk/>
- 框架:<https://github.com/UKGovernmentBEIS/inspect_ai>
- 来源:英国人工智能安全研究所(UK AISI)官方开源
- 含金量:国家级安全评测机构测试顶尖大模型使用的完整底座。Playbook 阐述高难度评测的 5 层架构(Evaluate, Isolate, Connect, Run, Scale),重点解决如何安全运行大模型生成的不受信代码(沙箱环境)以及大规模评测的工程化调度。
### lm-evaluation-harness
- <https://github.com/EleutherAI/lm-evaluation-harness>
- 来源:EleutherAI 维护的学术界公认标准评测工具
- 含金量:几乎所有开源模型在 Hugging Face 排行榜上的分数都是用它在跑。内置严苛的数据去污染(Decontamination)机制(防止模型训练时偷看评测集答案),是深入理解 MMLU、GSM8K 等学术 Benchmark 评测逻辑的必读源码。
### OLMES
- <https://github.com/allenai/olmes>
- 来源:艾伦人工智能研究所(Ai2),专为 OLMo/Tülu 模型打造的严格可复现评测标准
- 含金量:市面上很多评测换个 Prompt 分数就大变。该仓库提供一套极其标准化的 Prompt 模板、格式化和指标度量方案,实现"苹果与苹果对比(Apples-to-Apples"。
## 2. 云厂商生产环境的官方一线实战(含源码)
### AWS Generative AI Evaluations Workshop
- <https://github.com/aws-samples/sample-gen-ai-evaluations-workshop>
- 来源:AWS 官方团队沉淀的大模型垂直场景评测工作坊
- 含金量:目前 GitHub 上针对垂直场景最全、最硬核的实战代码库之一,直接给出以下场景的真实评测代码:
- 多模态 RAG 评测(混合文本、视觉与音频检索)
- 工具调用(Tool Calling)的 5 种渐进式评测方法(无需真实执行工具)
- 自动化推理逻辑验证(利用 SMT 求解器检查输出是否违反合规规则)
- 多智能体记忆协同(Shared Context)评测
### Automated RAG with Ragas & CircleCI
- 博客:<https://circleci.com/blog/automated-rag-pipeline-evaluation-and-benchmarking-with-ragas/>
- 源码:<https://github.com/vibrantlabsai/ragas>
- 含金量:给出实际配置文件和 Python 脚本,展示如何利用 databricks-dolly-15k 抽样数据集,在代码提交(CI/CD)时自动触发大模型评测,计算 Faithfulness(忠实度)与 Context Recall(上下文召回率),不达标直接拒绝上线。
## 3. 名校/大牛的工业级可运行课程 Notebook
### Evaluating and Debugging Generative AIDeepLearning.AI
- <https://www.deeplearning.ai/courses/evaluating-debugging-generative-ai>
- 来源:吴恩达的 DeepLearning.AI 与 Weights & Biases 联合出品
- 含金量:通过 Jupyter Notebook 讲解如何把评测变成实验追踪(Experiment Tracking),追踪 Prompt 与 Response 的演变,捕获大模型在复杂多轮交互中的微小表现差异,并用 W&B 平台可视化评测结果。
### Evidently AI — LLM Evaluations 免费课程
- 相关讨论:<https://www.reddit.com/r/LangChain/comments/1k9z2kk/free_course_on_llm_evaluation/>
- 来源:著名开源评测与可观测性框架 Evidently 团队推出的实战微课程
- 含金量:包含 10 多个端到端代码教程,亮点在于对抗性测试(Adversarial Testing / 红队测试)与自定义 LLM 裁判(Custom LLM Judges)设计的 Notebook 示例,非常贴近生产环境防护要求。
## 4. 解决"环境即数据"的下一代框架
### BenchFlow
- <https://github.com/benchflow-ai/benchflow>
- 含金量:前沿的"环境实验室"评测工程框架。主张大模型与 Agent 的能力很多时候不取决于静态数据集,而取决于它在环境中的交互能力("Environments are the new data")。提供构建强化学习环境、评测和 Post-training 的运行时(Runtime)基础设施,附带 SkillsBench 与 ClawsBench 实际评测环境。
- 配套清单:<https://github.com/benchflow-ai/awesome-evals>
## 上手建议
1. 先 clone AWS 的 Evaluations Workshop 仓库,里面分门别类的工业级评估代码能让你少走几个月的弯路。
2. 如果你的精力在 Agent 安全与深度评测,clone Inspect AI 去研究他们的沙箱隔离评测思路。
## 与本专区的关系
- 与 [[evaluation-guidebook/00-Overview|HuggingFace Evaluation Guidebook 中文提炼]] 互补:guidebook 回答"具体怎么做、有哪些坑"(概念与方法),本页回答"去哪找真材实料的生产级方案与源码"(资源与基建)。
- 按需查阅:设计某个评测类型(如多模态 RAG、工具调用、Agent 安全)时回到对应小节。
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。