add go-docs-qa practice project: project overview and task-and-rubric
This commit is contained in:
+2490
-167
File diff suppressed because it is too large
Load Diff
@@ -16,7 +16,7 @@ created: 2026-08-21
|
||||
1. [[01-What-Is-LLM-Evaluation|什么是 LLM Evaluation]]
|
||||
2. [[02-Annotation-Human-Data-and-Evaluation|数据标注、Human Data 与 Evaluation]]
|
||||
3. [[03-Core-Concept-Map|LLM Evaluation 核心概念地图]]
|
||||
4. [[04-Concepts-and-Theory|LLM 评测基础概念与理论:系统讲解]](前三篇的教学整合,补全"为什么"与信度/效度视角)
|
||||
4. [[04-Concepts-and-Theory|LLM 评测基础概念与理论:系统讲解]](前三篇的教学整合:构念→测量→决策主线、信度/效度、pass@k 与 pass^k、capability/regression eval、统计不确定性与失败分析等)
|
||||
|
||||
完成这一层后,继续阅读:
|
||||
|
||||
|
||||
+56
@@ -0,0 +1,56 @@
|
||||
---
|
||||
type: project
|
||||
status: active
|
||||
project_type: rag-eval
|
||||
created: 2026-08-24
|
||||
---
|
||||
|
||||
# Go 官方文档约束下的技术问答
|
||||
|
||||
## 问题与范围
|
||||
|
||||
- 任务名称:公开文档约束下的技术问答(Go 模块发布流程)
|
||||
- 用户输入:一个问题 + 一段 Go 官方文档片段(release-workflow 页)
|
||||
- 系统输出:简短回答 + 文档引用位置
|
||||
|
||||
## 一句话成功条件
|
||||
|
||||
> 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明
|
||||
|
||||
## 三类失败
|
||||
|
||||
1. 无依据事实:回答包含上下文未支持的关键事实
|
||||
2. 过度肯定:把文档没保证的说成保证
|
||||
3. 引用错误:声称引用了文档但实际无此表述
|
||||
|
||||
## 非目标
|
||||
|
||||
- 不评价文档外的 Go 常识正确性(如 semver、/v2 后缀)
|
||||
|
||||
## 数据来源 / 许可
|
||||
|
||||
- 来源:Go 官方文档 Module release and versioning workflow / URL:https://go.dev/doc/modules/release-workflow / 日期:2026-08-24
|
||||
- 许可:Go 文档(BSD 风格)/ PII 政策:N/A(公开技术文档,无个人数据)
|
||||
|
||||
## 主要风险
|
||||
|
||||
- 无依据补全(幻觉)、凭常识硬答、引用错位
|
||||
|
||||
## 当前版本
|
||||
|
||||
- dataset_version:v0.1 / rubric_version:v0.1 / 最近 run:无
|
||||
|
||||
## 关键链接
|
||||
|
||||
- 工作表:[[02-First-Week-Worksheet|首周工作表]]
|
||||
- 代码仓库:TBD(尚未创建,创建后填入 GitHub URL)
|
||||
- 数据集:`datasets/eval-v0.1.jsonl`
|
||||
- 最近报告:`reports/report-v0.1.md`
|
||||
|
||||
## 下一步最小动作
|
||||
|
||||
- [ ] 填写 `01-task-and-rubric.md` 的 rubric 三维度(对应 [[02-First-Week-Worksheet]] 第 1 节)
|
||||
|
||||
---
|
||||
|
||||
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
|
||||
+49
@@ -0,0 +1,49 @@
|
||||
---
|
||||
type: project
|
||||
status: active
|
||||
---
|
||||
|
||||
# 01 · 任务与 Rubric
|
||||
|
||||
> 权威版本:rubric 三维度的完整定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;为什么这样设计见 [[02-Why-Guide]] 第 3 步。本文件只记录本项目的填写结果。
|
||||
|
||||
## 任务边界(对应工作表第 0 节)
|
||||
|
||||
| 项目 | 你的填写 |
|
||||
| --------- | ---------------------------------------------------------------------------------------------------------- |
|
||||
| 任务名称 | 公开文档约束下的技术问答(Go 模块发布流程) |
|
||||
| 用户输入 | 一个问题 + 上面这段 Common workflow steps 文档片段 |
|
||||
| 系统输出 | 简短回答 + 文档引用位置 |
|
||||
| 一句话成功条件 | 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明 |
|
||||
| 三类失败 | 无依据事实;过度肯定;引用错误 |
|
||||
| 非目标 | 不评价文档外的 Go 常识(semver、/v2 后缀、go get 细节等) |
|
||||
| 数据来源 / 许可 | 来源 Go 官方文档 release-workflow 页;URL https://go.dev/doc/modules/release-workflow;日期 2026-08-24;BSD 风格;PII:N/A |
|
||||
|
||||
## Rubric v0.1(对应工作表第 1 节)
|
||||
|
||||
| 维度 | 通过条件 | 失败条件 | 正例 | 反例 |
|
||||
| ----------------- | ------------------------------------------------------- | --------------------- | ----------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------- |
|
||||
| 有据性(pass/fail) | 每条可核验事实都能在给定片段里找到依据 | 出现至少一个片段不支持的事实 | 模型说"未发布的模块无法用 go get 走常规流程"——片段里 "it's unavailable for the typical dependency management workflow using commands such as go get" 支持 | 模型说"发 alpha 前必须先用 go test 跑一遍"——片段没有说"必须 go test",属于无依据补全 |
|
||||
| 资料不足处理(pass/fail) | 片段没讲的事,模型明确说"文档未说明",不瞎猜 | 把未知当确定 | 被问"beta 阶段具体要测什么",模型答"此片段未说明具体测试项" | 被问"发布正式 v1 的流程"(片段只讲到 v0 预发布),模型却编造 v1 发布步骤——片段根本没提 v1 |
|
||||
| 核心任务完成度(0/1/2) | 覆盖用户问题必须回答的全部要点(顺序 + 关键限制),给 2 分;覆盖大部分但漏 1 个非关键点,给 1 分。 | 答非所问、漏掉关键限制或约束,给 0 分。 | 先组织好模块源码;发布前模块无法用 go get 走常规流程,可先在本地目录测试;代码就绪后开始发布 v0 预发布版(alpha/beta)。 | 准备好代码后,用 go get 发布模块即可。 |
|
||||
|
||||
> 0/1/2 评分定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;第一版不要增加维度。
|
||||
|
||||
### 一票否决项
|
||||
|
||||
- 出现任何无证据事实 → 整体 fail,无论其他维度(这是最需要保护的行为边界)。
|
||||
|
||||
### 无法判断时的升级路径
|
||||
|
||||
- 两个片段对同一说法冲突 → 标记 low confidence,人工仲裁,不自动评分。你的项目目前单片段,可写:片段未覆盖该问题 → 若模型正确拒答则不扣分,若无法判定则人工复核。
|
||||
|
||||
### Rubric 修改记录
|
||||
|
||||
| 版本 | 日期 | 改了什么 | 为什么改 | 预期影响 | 实际结果 |
|
||||
| ---- | ---------- | ---- | ---- | ------ | ---- |
|
||||
| v0.1 | 2026-08-24 | 初版 | 首版 | rubric | |
|
||||
| | | | | | |
|
||||
|
||||
---
|
||||
|
||||
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
|
||||
@@ -1 +0,0 @@
|
||||
# 本目录用于存放外部 PDF、截图、数据文件等二进制附件;也可统一使用全库 05_Attachments。
|
||||
Reference in New Issue
Block a user