add LLM_Evaluation learning zone; fix README links, frontmatter, rubric terminology, dedupe career note
This commit is contained in:
@@ -0,0 +1,52 @@
|
||||
---
|
||||
type: guide
|
||||
tags:
|
||||
- LLM评测
|
||||
- 入门
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 开始这里:你不是在学“给模型打分”
|
||||
|
||||
你要学的是一项测试与质量工程能力:**定义成功、构造会失败的情况、按规则判定、解释失败原因,并用旧案例验证修复没有带来退步。**
|
||||
|
||||
如果你有软件开发经验,请把它暂时理解为:
|
||||
|
||||
```text
|
||||
模糊需求
|
||||
→ 验收条件
|
||||
→ 测试用例
|
||||
→ 断言 / rubric
|
||||
→ 一次运行记录
|
||||
→ 缺陷分类
|
||||
→ 修复与回归
|
||||
```
|
||||
|
||||
## 第一次只做十分钟
|
||||
|
||||
不要先注册平台、安装框架或申请 API Key。任选一个动作即可:
|
||||
|
||||
- [ ] 从公开技术文档复制一段 200—500 字的内容。
|
||||
- [ ] 为这段文档写一个“能回答的问题”和一个“不能回答的问题”。
|
||||
- [ ] 写一条规则:`答案包含上下文未支持的关键事实,则 groundedness = fail`。
|
||||
|
||||
完成任意一项后,打开 [[02-执行路线与工作表/01-首周工作表]],把它填入第 0 节。
|
||||
|
||||
## 你现在处于哪种状态?
|
||||
|
||||
| 你的状态 | 先读什么 | 现在不要做什么 |
|
||||
|---|---|---|
|
||||
| 不懂为什么要多写 case、rubric 和 run | [[01-为什么这样学/01-从零开始做 LLM 评测 - 每一步背后的道理]] | 不要先上评测框架。 |
|
||||
| 知道原理,但不知道今天怎么开始 | [[02-执行路线与工作表/01-首周工作表]] | 不要把项目放大到 100 个 case。 |
|
||||
| 已有 10 个 case,想系统推进 | [[02-执行路线与工作表/02-LLM 评测工程实战路线图]] | 不要急着微调模型。 |
|
||||
| 已有具体项目,想记录实验 | [[03-项目实践/00-项目实践入口]] | 不要把 run、case 和个人笔记混在一起。 |
|
||||
| 想理解这条职业方向的全貌 | [[02_Areas/Job/llm_data_annotation_programmer_roadmap|大模型数据标注与程序员入门]](存于 02_Areas/Job) | 不要把岗位名当成能力边界。 |
|
||||
|
||||
## 本专区的学习原则
|
||||
|
||||
> **先建立判断,再追求自动化。**
|
||||
>
|
||||
> 如果你还不能解释一个输出为什么通过或失败,自动评分器、CI 和仪表盘只会把不清楚的判断更快地放大。
|
||||
|
||||
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
|
||||
@@ -0,0 +1,54 @@
|
||||
---
|
||||
type: checklist
|
||||
tags:
|
||||
- LLM评测
|
||||
- 学习看板
|
||||
status: active
|
||||
created: 2026-08-21
|
||||
---
|
||||
|
||||
# 学习看板
|
||||
|
||||
> 这个看板只追踪“是否形成评测闭环”,不追踪看了多少篇文章或装了多少工具。
|
||||
|
||||
## Level 1:建立判断能力
|
||||
|
||||
- [ ] 我能用自己的话解释:为什么先定义成功条件,再运行模型。
|
||||
- [ ] 我已读完 [[01-为什么这样学/01-从零开始做 LLM 评测 - 每一步背后的道理]]。
|
||||
- [ ] 我已从公开资料中选定一个范围足够小的任务。
|
||||
- [ ] 我已写出一个能回答的问题和一个不能回答的问题。
|
||||
- [ ] 我已写出 rubric v0.1,包含有据性、资料不足处理与核心任务完成度三个维度。
|
||||
|
||||
## Level 2:完成第一个最小闭环
|
||||
|
||||
- [ ] 我已在 [[02-执行路线与工作表/01-首周工作表]] 中写出 10 个 case。
|
||||
- [ ] 我已得到至少一组候选输出。
|
||||
- [ ] 我已对至少 5 个 case 写下通过/失败理由。
|
||||
- [ ] 我已识别并命名 3—5 类失败。
|
||||
- [ ] 我已修改一个可解释因素,并重跑旧 case。
|
||||
|
||||
## Level 3:项目化与证据链
|
||||
|
||||
- [ ] 我已在 `03-项目实践/` 下创建自己的项目目录。
|
||||
- [ ] 我已保存稳定的 case 定义与一次运行记录。
|
||||
- [ ] 我已写出一份简短失败复盘。
|
||||
- [ ] 我已决定下一阶段是 RAG、Agent tool-use、Text-to-SQL 还是 Code Agent。
|
||||
- [ ] 我已开始阅读 [[02-执行路线与工作表/02-LLM 评测工程实战路线图]] 中对应部分。
|
||||
|
||||
## 每周复盘(复制到项目周记)
|
||||
|
||||
```markdown
|
||||
## 本周目标
|
||||
|
||||
## 我新定义了什么成功 / 失败条件?
|
||||
|
||||
## 我新增或修订了哪些 case?为什么?
|
||||
|
||||
## 本周主要失败类型是什么?
|
||||
|
||||
## 我改变了什么?预期是什么?实际发生了什么?
|
||||
|
||||
## 下周只保留的一个最小动作
|
||||
```
|
||||
|
||||
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
|
||||
Reference in New Issue
Block a user