Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README.md
T
windyboy 0dac58fb6f reconcile LLM_Evaluation zone: align stage numbering and scopes, standardize full-path wikilinks, slim old guidebook notes, dedupe templates
- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope
- resolve AWS workshop prerequisite contradiction in 04-Reference/01
- convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs
- compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview
- dedupe project templates and remove embedded template copy in 03-Practice/README
2026-08-24 11:15:37 +08:00

98 lines
3.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
type: hub
tags:
- llm-evaluation
- project-practice
status: active
created: 2026-08-21
---
# 项目实践入口
这里用于放实际 Eval 项目,而不是继续积累理论笔记。学习材料告诉你“为什么”和“怎么做”([[02-Why-Guide|Why Guide]]、[[01-LLM-Evaluation-Roadmap|实战路线图]]);项目目录保存你亲自得到的证据。
## 项目列表
| 项目 | 状态 | 代码仓库 | 最近更新 | 一句话 |
|---|---|---|---|---|
| (暂无——从 [[02-First-Week-Worksheet|首周工作表]] 开始,复制 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/`]] 建立第一个项目) | | | | |
## 建议的第一批项目
按以下顺序推进。先完成一个小型、可重跑的闭环,再增加框架和自动化:
1. `rag-eval-lab/` — 公开技术文档约束问答
2. `agent-tool-eval/` — 模拟工具调用、权限与状态
3. `code-agent-eval/` — 编译、测试、静态分析与回归
> 每个项目复制 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/` 骨架]](6 个文件)即可开始;骨架内的引导说明引用了工作表与路线图,不重复内容。
每个项目创建独立子目录,例如:
```text
03-Practice/
└── 2026-我的第一个公开文档问答评测/
├── 00-项目概览.md
├── 01-任务与Rubric.md
├── 02-Case设计.md
├── 03-运行与盲评.md
├── 04-失败复盘.md
└── 05-变更与回归.md
```
每个项目至少保留:
```text
task.md
datasets/
rubrics/
runs/
scripts/
reports/
```
### Obsidian 模板 ↔ 代码仓库目录 对照
同一份项目内容在 Obsidian(判断与决策)与代码仓库(可运行事实)中各存一份,对应关系如下:
| 工作表 / 模板(Obsidian 项目目录) | 代码仓库目录(路线图 §4 的 `llm-eval-lab/` 结构) |
|---|---|
| `00-项目概览.md` + `01-任务与Rubric.md` | `task.md` + `rubrics/` |
| `02-Case设计.md` | `datasets/`(冻结的 eval 定义,JSONL |
| `03-运行与盲评.md` | `runs/`(原始输出 + 盲评记录) |
| `04-失败复盘.md` | `reports/`(确认的失败入 `datasets/regression/` |
| `05-变更与回归.md` | `scripts/`validate / eval+ CI 配置 |
## 为什么笔记和数据要分开
这个 Obsidian 专区保存**思考与决策**;代码仓库保存 JSONL、脚本和原始运行输出。两边互相链接即可:
| 放在 Obsidian 项目目录 | 放在代码仓库 |
|---|---|
| 为什么选这个题、成功条件、设计取舍 | `datasets/``runs/``scripts/`、原始输出 |
| rubric 的修改理由 | 可执行 schema 与校验脚本 |
| 失败模式、实验结论、下一个假设 | 机器生成报告、日志与图表 |
| 项目复盘、作品展示文字 | README、依赖、CI 配置 |
> **原则:** Obsidian 是你的“工程判断日志”,代码仓库是你的“可运行事实”。不要让任何一边替代另一边。
## 每个项目都要回答的五个问题
1. 用户想完成什么任务?
2. 什么情况算成功,什么情况算失败?
3. 你故意设计了哪些边界或负例?
4. 最常见的失败在哪里,为什么?
5. 修改后,你如何证明没有破坏原有能力?
## 项目模板
新项目的 `00-项目概览.md` 直接复制 `_template/00-项目概览.md`(骨架见 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/`]]);本页不再内嵌模板副本,避免与模板文件漂移。
## 开始前
先完成 [[02-First-Week-Worksheet|首周工作表]],再建立你的第一个项目目录。
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。