2026-08-24 11:15:37 +08:00
|
|
|
---
|
|
|
|
|
type: log
|
|
|
|
|
tags:
|
|
|
|
|
- llm-evaluation
|
|
|
|
|
- progress
|
|
|
|
|
- review
|
|
|
|
|
status: active
|
|
|
|
|
created: 2026-08-21
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
# 方法季度复盘(含作品集清单)
|
|
|
|
|
|
2026-08-26 17:13:57 +08:00
|
|
|
> **使用方式:** 每季度一次(约第 12 周)。复盘对象是**这套学习方法本身**,不是单个项目(单个项目的复盘在 `03-Practice/项目名/04-failure-review.md`)。
|
2026-08-24 11:15:37 +08:00
|
|
|
|
|
|
|
|
## 方法论自评
|
|
|
|
|
|
|
|
|
|
1. "先建立判断,再追求自动化"是否真的让我少走了弯路?请给一个具体例子。
|
|
|
|
|
2. 我是否在"读完理论"上花了比计划更多的时间?当时应该在哪一步停下?
|
|
|
|
|
3. 手工盲评是否帮我发现了规则问题?哪些坑是读文章学不到的?
|
|
|
|
|
4. 哪个环节最浪费时间?下一个季度砍掉什么?
|
|
|
|
|
5. 我的失败分类是否真的指导了修复,还是只是写了报告?
|
|
|
|
|
|
|
|
|
|
## 作品集检查清单
|
|
|
|
|
|
|
|
|
|
> 来源:[[01-LLM-Evaluation-Roadmap]] 第十二节。做满 3 个月后,把最能证明工程闭环的项目整理成作品集。
|
|
|
|
|
|
|
|
|
|
- [ ] GitHub 仓库 README:问题 / 数据说明 / 评测方法 / 结果,四节
|
|
|
|
|
- [ ] 数据卡:来源、构造、偏差、许可、PII、版本
|
|
|
|
|
- [ ] 评测报告:类别通过率、失败分类、修复前后对比
|
|
|
|
|
- [ ] 3 分钟录屏:改一个 prompt → 跑 runner → 展示回归变化
|
|
|
|
|
- [ ] 一条技术复盘(具体发现,而非"我学了大模型")
|
|
|
|
|
|
|
|
|
|
### 公开前合规检查
|
|
|
|
|
|
|
|
|
|
- [ ] 无真实用户输入 / 无密钥或 token / 无内部路径或私有代码 / 无个人信息
|
|
|
|
|
- [ ] 外部资料有许可与出处;合成数据明确标注为合成
|
|
|
|
|
|
|
|
|
|
## 内容保鲜(可选,每季度)
|
|
|
|
|
|
|
|
|
|
- [ ] 检查专区外部链接是否有失效或已关停(如 OpenAI Evals 平台已宣布 2026-11 关停)
|
|
|
|
|
- [ ] 更新 [[01_Projects/Personal-Tech/LLM_Evaluation/04-Reference/README|04-Reference 资源地图]] 的前置阶段标注
|
|
|
|
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
|