Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/01-Getting-Started/00-Start-Here.md
T

56 lines
2.2 KiB
Markdown
Raw Normal View History

---
aliases:
- 开始这里
type: guide
tags:
- llm-evaluation
- getting-started
status: active
created: 2026-08-21
---
# 开始这里:你不是在学“给模型打分”
你要学的是一项测试与质量工程能力:**定义成功、构造会失败的情况、按规则判定、解释失败原因,并用旧案例验证修复没有带来退步。**
如果你有软件开发经验,请把它暂时理解为:
```text
模糊需求
→ 验收条件
→ 测试用例
→ 断言 / rubric
→ 一次运行记录
→ 缺陷分类
→ 修复与回归
```
## 第一次只做十分钟
不要先注册平台、安装框架或申请 API Key。任选一个动作即可:
- [ ] 从公开技术文档复制一段 200—500 字的内容。
- [ ] 为这段文档写一个“能回答的问题”和一个“不能回答的问题”。
- [ ] 写一条规则:`答案包含上下文未支持的关键事实,则 groundedness = fail`
完成任意一项后,打开 [[02-First-Week-Worksheet]],把它填入第 0 节。
## 你现在处于哪种状态?
| 你的状态 | 先读什么 | 现在不要做什么 |
|---|---|---|
| 不懂为什么要多写 case、rubric 和 run | [[02-Why-Guide]] | 不要先上评测框架。 |
| 知道原理,但不知道今天怎么开始 | [[02-First-Week-Worksheet]] | 不要把项目放大到 100 个 case。 |
| 已有 10 个 case,想系统推进 | [[01-LLM-Evaluation-Roadmap]] | 不要急着微调模型。 |
| 已有具体项目,想记录实验 | [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README]] | 不要把 run、case 和个人笔记混在一起。 |
| 想知道自己学到哪了 | [[01-Learning-Board\|学习看板]] | 不要用“看过多少篇文章”代替闭环进度。 |
| 想理解这条职业方向的全貌 | [[02_Areas/Job/llm_data_annotation_programmer_roadmap\|大模型数据标注与程序员入门]](存于 02_Areas/Job) | 不要把岗位名当成能力边界。 |
## 本专区的学习原则
> **先建立判断,再追求自动化。**
>
> 如果你还不能解释一个输出为什么通过或失败,自动评分器、CI 和仪表盘只会把不清楚的判断更快地放大。
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。