Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/README.md
T

4.2 KiB
Raw Blame History

type, tags, status, created
type tags status created
moc
llm-evaluation
learning-zone
moc
active 2026-08-21

LLM 评测学习专区

这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。

先怎么使用

请不要按文件夹顺序随机阅读。第一次学习建议走下面这条主线:

建立概念(What)
  → 理解为什么(Why)
  → 填写一份最小工作表
  → 做完第一个 10-case 小项目
  → 再进入完整工程路线(How)
顺序 阅读材料 解决的问题 完成标志
1 [[01-Getting-Started/00-Start-Here 开始这里]] 我究竟在学什么,如何不被概念和工具淹没?
2 [[00-Foundations/01-What-Is-LLM-Evaluation 什么是 LLM Evaluation]] 评测的对象、边界与常用术语是什么?
3 [[01-Getting-Started/02-Why-Guide 从零开始做 LLM 评测:每一步背后的道理]] 为什么先做 case、rubric、盲评、run、失败分类与回归?
4 [[02-Practical-Roadmap/02-First-Week-Worksheet 首周工作表]] 今天应该写什么,卡住时怎样缩小范围?
5 [[03-Practice/README 项目实践入口]] 如何把工作表变成自己的项目仓库?
6 [[02-Practical-Roadmap/01-LLM-Evaluation-Roadmap LLM 评测工程实战路线图]] 怎样逐步走向 Judge、Agent、安全、数据资产与 CI?

数量口径: 首周最低完成 10 个 case;若时间充裕,按路线图 Day 1 扩展至 20 个(结构见《首周工作表》第 2 节)。

目录结构为何这样设计

目录 放什么 不放什么 设计原因
00-Foundations 基础概念、术语边界与速查地图(What) 操作手册与个人项目数据 先建立共同语言,后续文档不再重复解释术语。
01-Getting-Started 学习入口、进度看板与 Why Guide(Why 复杂工具的操作手册 让你每次打开专区都能立刻知道下一步与为什么。
02-Practical-Roadmap 可执行路线、清单、模板、阶段性任务(How) 一次性运行结果 将原则转成动作,且便于反复使用。
03-Practice 每个亲自完成的 Eval 项目、实验记录、复盘 通用学习材料 学习材料与个人证据分离,项目才不会被笔记淹没。
04-Reference-Archive 旧大纲与参考草案(职业定位原文存于 02_Areas/Job 正在执行的任务 保留来路和背景,但不干扰当前学习。
99-Attachments 外部 PDF、截图、数据文件等二进制附件(也可统一放全库 05_Attachments 主笔记 保持 Markdown 笔记可搜索、可链接、可版本控制。

三条使用规则

规则一:先写再读。 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。

规则二:项目笔记不放在通用材料旁。 每个项目单独放入 03-Practice/项目名/,防止模板、原理和实际 run 混在一起。

规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。

你的当前入口

打开 01-Getting-Started/00-Start-Here,完成其中的十分钟动作;完成后再填写 02-Practical-Roadmap/02-First-Week-Worksheet

关联材料