- fix stage-numbering conflict (README vs 05-Progress) and unify stage-1 reading scope - resolve AWS workshop prerequisite contradiction in 04-Reference/01 - convert medium-path wikilinks to vault-root paths (~30 links), fix .pyy typos, annotate ragas fork, unify archive status, add 01-/02- README hubs - compress old-version guidebook notes (01, 05) into pointers; add 2026 reading guidance to 00-Overview - dedupe project templates and remove embedded template copy in 03-Practice/README
98 lines
3.7 KiB
Markdown
98 lines
3.7 KiB
Markdown
---
|
||
type: hub
|
||
tags:
|
||
- llm-evaluation
|
||
- project-practice
|
||
status: active
|
||
created: 2026-08-21
|
||
---
|
||
|
||
# 项目实践入口
|
||
|
||
这里用于放实际 Eval 项目,而不是继续积累理论笔记。学习材料告诉你“为什么”和“怎么做”([[02-Why-Guide|Why Guide]]、[[01-LLM-Evaluation-Roadmap|实战路线图]]);项目目录保存你亲自得到的证据。
|
||
|
||
## 项目列表
|
||
|
||
| 项目 | 状态 | 代码仓库 | 最近更新 | 一句话 |
|
||
|---|---|---|---|---|
|
||
| (暂无——从 [[02-First-Week-Worksheet|首周工作表]] 开始,复制 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/`]] 建立第一个项目) | | | | |
|
||
|
||
## 建议的第一批项目
|
||
|
||
按以下顺序推进。先完成一个小型、可重跑的闭环,再增加框架和自动化:
|
||
|
||
1. `rag-eval-lab/` — 公开技术文档约束问答
|
||
2. `agent-tool-eval/` — 模拟工具调用、权限与状态
|
||
3. `code-agent-eval/` — 编译、测试、静态分析与回归
|
||
|
||
> 每个项目复制 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/` 骨架]](6 个文件)即可开始;骨架内的引导说明引用了工作表与路线图,不重复内容。
|
||
|
||
每个项目创建独立子目录,例如:
|
||
|
||
```text
|
||
03-Practice/
|
||
└── 2026-我的第一个公开文档问答评测/
|
||
├── 00-项目概览.md
|
||
├── 01-任务与Rubric.md
|
||
├── 02-Case设计.md
|
||
├── 03-运行与盲评.md
|
||
├── 04-失败复盘.md
|
||
└── 05-变更与回归.md
|
||
```
|
||
|
||
每个项目至少保留:
|
||
|
||
```text
|
||
task.md
|
||
datasets/
|
||
rubrics/
|
||
runs/
|
||
scripts/
|
||
reports/
|
||
```
|
||
|
||
### Obsidian 模板 ↔ 代码仓库目录 对照
|
||
|
||
同一份项目内容在 Obsidian(判断与决策)与代码仓库(可运行事实)中各存一份,对应关系如下:
|
||
|
||
| 工作表 / 模板(Obsidian 项目目录) | 代码仓库目录(路线图 §4 的 `llm-eval-lab/` 结构) |
|
||
|---|---|
|
||
| `00-项目概览.md` + `01-任务与Rubric.md` | `task.md` + `rubrics/` |
|
||
| `02-Case设计.md` | `datasets/`(冻结的 eval 定义,JSONL) |
|
||
| `03-运行与盲评.md` | `runs/`(原始输出 + 盲评记录) |
|
||
| `04-失败复盘.md` | `reports/`(确认的失败入 `datasets/regression/`) |
|
||
| `05-变更与回归.md` | `scripts/`(validate / eval)+ CI 配置 |
|
||
|
||
## 为什么笔记和数据要分开
|
||
|
||
这个 Obsidian 专区保存**思考与决策**;代码仓库保存 JSONL、脚本和原始运行输出。两边互相链接即可:
|
||
|
||
| 放在 Obsidian 项目目录 | 放在代码仓库 |
|
||
|---|---|
|
||
| 为什么选这个题、成功条件、设计取舍 | `datasets/`、`runs/`、`scripts/`、原始输出 |
|
||
| rubric 的修改理由 | 可执行 schema 与校验脚本 |
|
||
| 失败模式、实验结论、下一个假设 | 机器生成报告、日志与图表 |
|
||
| 项目复盘、作品展示文字 | README、依赖、CI 配置 |
|
||
|
||
> **原则:** Obsidian 是你的“工程判断日志”,代码仓库是你的“可运行事实”。不要让任何一边替代另一边。
|
||
|
||
## 每个项目都要回答的五个问题
|
||
|
||
1. 用户想完成什么任务?
|
||
2. 什么情况算成功,什么情况算失败?
|
||
3. 你故意设计了哪些边界或负例?
|
||
4. 最常见的失败在哪里,为什么?
|
||
5. 修改后,你如何证明没有破坏原有能力?
|
||
|
||
## 项目模板
|
||
|
||
新项目的 `00-项目概览.md` 直接复制 `_template/00-项目概览.md`(骨架见 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/_template/00-项目概览|`_template/`]]);本页不再内嵌模板副本,避免与模板文件漂移。
|
||
|
||
## 开始前
|
||
|
||
先完成 [[02-First-Week-Worksheet|首周工作表]],再建立你的第一个项目目录。
|
||
|
||
---
|
||
|
||
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。
|