Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/archive/01-Curated-External-Resources.md
T
windyboy 0dac58fb6f reconcile LLM_Evaluation zone: align stage numbering and scopes, standardize full-path wikilinks, slim old guidebook notes, dedupe templates
- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope
- resolve AWS workshop prerequisite contradiction in 04-Reference/01
- convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs
- compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview
- dedupe project templates and remove embedded template copy in 03-Practice/README
2026-08-24 11:15:37 +08:00

5.7 KiB
Raw Blame History

aliases, type, tags, status, created
aliases type tags status created
精选外部资源
硬核评测资源
reference
llm-evaluation
resources
archive
archive 2026-08-21

精选外部评测资源(真材实料级)

目的:不是收藏大量 AI 资料,而是锁定顶级大厂、顶尖开源组织在生产环境中沉淀出的核心方案、底层评测基建与硬核课程源码。按需查阅,不按顺序通读。

能力地图(每个资源对应哪层能力、何时看、重点看什么)见 01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README;本页只负责完整链接、来源背景与上手建议。

1. 国家级与顶级学术机构的"硬核基建"

这些是真正用于测试前沿模型(Frontier Models)的底层系统,揭示了顶级团队如何解决代码沙箱、评测污染和环境依赖问题。

AISI Engineering Playbook & Inspect AI Framework

  • Playbookhttps://engineering-playbook.aisi.org.uk/
  • 框架:https://github.com/UKGovernmentBEIS/inspect_ai
  • 来源:英国人工智能安全研究所(UK AISI)官方开源
  • 含金量:国家级安全评测机构测试顶尖大模型使用的完整底座。Playbook 阐述高难度评测的 5 层架构(Evaluate, Isolate, Connect, Run, Scale),重点解决如何安全运行大模型生成的不受信代码(沙箱环境)以及大规模评测的工程化调度。

lm-evaluation-harness

  • https://github.com/EleutherAI/lm-evaluation-harness
  • 来源:EleutherAI 维护的学术界公认标准评测工具
  • 含金量:几乎所有开源模型在 Hugging Face 排行榜上的分数都是用它在跑。内置严苛的数据去污染(Decontamination)机制(防止模型训练时偷看评测集答案),是深入理解 MMLU、GSM8K 等学术 Benchmark 评测逻辑的必读源码。

OLMES

  • https://github.com/allenai/olmes
  • 来源:艾伦人工智能研究所(Ai2),专为 OLMo/Tülu 模型打造的严格可复现评测标准
  • 含金量:市面上很多评测换个 Prompt 分数就大变。该仓库提供一套极其标准化的 Prompt 模板、格式化和指标度量方案,实现"苹果与苹果对比(Apples-to-Apples"。

2. 云厂商生产环境的官方一线实战(含源码)

AWS Generative AI Evaluations Workshop

  • https://github.com/aws-samples/sample-gen-ai-evaluations-workshop
  • 来源:AWS 官方团队沉淀的大模型垂直场景评测工作坊
  • 含金量:目前 GitHub 上针对垂直场景最全、最硬核的实战代码库之一,直接给出以下场景的真实评测代码:
    • 多模态 RAG 评测(混合文本、视觉与音频检索)
    • 工具调用(Tool Calling)的 5 种渐进式评测方法(无需真实执行工具)
    • 自动化推理逻辑验证(利用 SMT 求解器检查输出是否违反合规规则)
    • 多智能体记忆协同(Shared Context)评测

Automated RAG with Ragas & CircleCI

3. 名校/大牛的工业级可运行课程 Notebook

Evaluating and Debugging Generative AIDeepLearning.AI

  • https://www.deeplearning.ai/courses/evaluating-debugging-generative-ai
  • 来源:吴恩达的 DeepLearning.AI 与 Weights & Biases 联合出品
  • 含金量:通过 Jupyter Notebook 讲解如何把评测变成实验追踪(Experiment Tracking),追踪 Prompt 与 Response 的演变,捕获大模型在复杂多轮交互中的微小表现差异,并用 W&B 平台可视化评测结果。

Evidently AI — LLM Evaluations 免费课程

  • 相关讨论:https://www.reddit.com/r/LangChain/comments/1k9z2kk/free_course_on_llm_evaluation/
  • 来源:著名开源评测与可观测性框架 Evidently 团队推出的实战微课程
  • 含金量:包含 10 多个端到端代码教程,亮点在于对抗性测试(Adversarial Testing / 红队测试)与自定义 LLM 裁判(Custom LLM Judges)设计的 Notebook 示例,非常贴近生产环境防护要求。

4. 解决"环境即数据"的下一代框架

BenchFlow

  • https://github.com/benchflow-ai/benchflow
  • 含金量:前沿的"环境实验室"评测工程框架。主张大模型与 Agent 的能力很多时候不取决于静态数据集,而取决于它在环境中的交互能力("Environments are the new data")。提供构建强化学习环境、评测和 Post-training 的运行时(Runtime)基础设施,附带 SkillsBench 与 ClawsBench 实际评测环境。
  • 配套清单:https://github.com/benchflow-ai/awesome-evals

上手建议

  1. 先 clone AWS 的 Evaluations Workshop 仓库,里面分门别类的工业级评估代码能让你少走几个月的弯路。
  2. 如果你的精力在 Agent 安全与深度评测,clone Inspect AI 去研究他们的沙箱隔离评测思路。

与本专区的关系

返回 01_Projects/Personal-Tech/LLM_Evaluation/README