Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/01-go-docs-qa/01-task-and-rubric.md
T

50 lines
4.7 KiB
Markdown
Raw Normal View History

---
type: project
status: active
---
# 01 · 任务与 Rubric
> 权威版本:rubric 三维度的完整定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;为什么这样设计见 [[02-Why-Guide]] 第 3 步。本文件只记录本项目的填写结果。
## 任务边界(对应工作表第 0 节)
| 项目 | 你的填写 |
| --------- | ---------------------------------------------------------------------------------------------------------- |
| 任务名称 | 公开文档约束下的技术问答(Go 模块发布流程) |
| 用户输入 | 一个问题 + 上面这段 Common workflow steps 文档片段 |
| 系统输出 | 简短回答 + 文档引用位置 |
| 一句话成功条件 | 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明 |
| 三类失败 | 无依据事实;过度肯定;引用错误 |
| 非目标 | 不评价文档外的 Go 常识(semver、/v2 后缀、go get 细节等) |
| 数据来源 / 许可 | 来源 Go 官方文档 release-workflow 页;URL https://go.dev/doc/modules/release-workflow;日期 2026-08-24BSD 风格;PIIN/A |
## Rubric v0.1(对应工作表第 1 节)
| 维度 | 通过条件 | 失败条件 | 正例 | 反例 |
| ----------------- | ------------------------------------------------------- | --------------------- | ----------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------- |
| 有据性(pass/fail) | 每条可核验事实都能在给定片段里找到依据 | 出现至少一个片段不支持的事实 | 模型说"未发布的模块无法用 go get 走常规流程"——片段里 "it's unavailable for the typical dependency management workflow using commands such as go get" 支持 | 模型说"发 alpha 前必须先用 go test 跑一遍"——片段没有说"必须 go test",属于无依据补全 |
| 资料不足处理(pass/fail) | 片段没讲的事,模型明确说"文档未说明",不瞎猜 | 把未知当确定 | 被问"beta 阶段具体要测什么",模型答"此片段未说明具体测试项" | 被问"发布正式 v1 的流程"(片段只讲到 v0 预发布),模型却编造 v1 发布步骤——片段根本没提 v1 |
| 核心任务完成度(0/1/2) | 覆盖用户问题必须回答的全部要点(顺序 + 关键限制),给 2 分;覆盖大部分但漏 1 个非关键点,给 1 分。 | 答非所问、漏掉关键限制或约束,给 0 分。 | 先组织好模块源码;发布前模块无法用 go get 走常规流程,可先在本地目录测试;代码就绪后开始发布 v0 预发布版(alpha/beta)。 | 准备好代码后,用 go get 发布模块即可。 |
> 0/1/2 评分定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;第一版不要增加维度。
### 一票否决项
- 出现任何无证据事实 → 整体 fail,无论其他维度(这是最需要保护的行为边界)。
### 无法判断时的升级路径
- 两个片段对同一说法冲突 → 标记 low confidence,人工仲裁,不自动评分。你的项目目前单片段,可写:片段未覆盖该问题 → 若模型正确拒答则不扣分,若无法判定则人工复核。
### Rubric 修改记录
| 版本 | 日期 | 改了什么 | 为什么改 | 预期影响 | 实际结果 |
| ---- | ---------- | ---- | ---- | ------ | ---- |
| v0.1 | 2026-08-24 | 初版 | 首版 | rubric | |
| | | | | | |
---
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。