Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/00-Start-Here.md
T
windyboy 63add96a09 dedupe LLM_Evaluation zone: single-source tables, fix nav orphans, compress guidebook 2025
- Why Guide: remove duplicated 20-case/rubric/test-definition tables, link to
  authoritative Roadmap/Worksheet instead; 10-min action points to entries
- Concept Map / What-Is: cross-link narrative vs quick-reference roles
- Worksheet: annotate sections with authoritative sources
- 04-Reference 01-04 <-> archive/01: bidirectional resource links
- archive/00-Material-List: shrink guidebook listing, now reachable from READMEs
- guidebook: compress 06-Yearly-Dives 2025 section (-> 08-2025-Edition §3),
  add old/new version nav banners to 01-05, reverse links in 08
- README/Start-Here: link Learning Board (was orphaned)
2026-08-21 17:25:12 +08:00

2.2 KiB
Raw Blame History

aliases, type, tags, status, created
aliases type tags status created
开始这里
guide
llm-evaluation
getting-started
active 2026-08-21

开始这里:你不是在学“给模型打分”

你要学的是一项测试与质量工程能力:定义成功、构造会失败的情况、按规则判定、解释失败原因,并用旧案例验证修复没有带来退步。

如果你有软件开发经验,请把它暂时理解为:

模糊需求
  → 验收条件
  → 测试用例
  → 断言 / rubric
  → 一次运行记录
  → 缺陷分类
  → 修复与回归

第一次只做十分钟

不要先注册平台、安装框架或申请 API Key。任选一个动作即可:

  • 从公开技术文档复制一段 200—500 字的内容。
  • 为这段文档写一个“能回答的问题”和一个“不能回答的问题”。
  • 写一条规则:答案包含上下文未支持的关键事实,则 groundedness = fail

完成任意一项后,打开 02-First-Week-Worksheet,把它填入第 0 节。

你现在处于哪种状态?

你的状态 先读什么 现在不要做什么
不懂为什么要多写 case、rubric 和 run 02-Why-Guide 不要先上评测框架。
知道原理,但不知道今天怎么开始 02-First-Week-Worksheet 不要把项目放大到 100 个 case。
已有 10 个 case,想系统推进 01-LLM-Evaluation-Roadmap 不要急着微调模型。
已有具体项目,想记录实验 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README 不要把 run、case 和个人笔记混在一起。
想知道自己学到哪了 01-Learning-Board 不要用“看过多少篇文章”代替闭环进度。
想理解这条职业方向的全貌 02_Areas/Job/llm_data_annotation_programmer_roadmap(存于 02_Areas/Job 不要把岗位名当成能力边界。

本专区的学习原则

先建立判断,再追求自动化。

如果你还不能解释一个输出为什么通过或失败,自动评分器、CI 和仪表盘只会把不清楚的判断更快地放大。

返回 01_Projects/Personal-Tech/LLM_Evaluation/README