Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/01-go-docs-qa/01-task-and-rubric.md
T

4.7 KiB
Raw Blame History

type, status
type status
project active

01 · 任务与 Rubric

权威版本:rubric 三维度的完整定义见 01-LLM-Evaluation-Roadmap 第六节;为什么这样设计见 02-Why-Guide 第 3 步。本文件只记录本项目的填写结果。

任务边界(对应工作表第 0 节)

项目 你的填写
任务名称 公开文档约束下的技术问答(Go 模块发布流程)
用户输入 一个问题 + 上面这段 Common workflow steps 文档片段
系统输出 简短回答 + 文档引用位置
一句话成功条件 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明
三类失败 无依据事实;过度肯定;引用错误
非目标 不评价文档外的 Go 常识(semver、/v2 后缀、go get 细节等)
数据来源 / 许可 来源 Go 官方文档 release-workflow 页;URL https://go.dev/doc/modules/release-workflow;日期 2026-08-24BSD 风格;PIIN/A

Rubric v0.1(对应工作表第 1 节)

维度 通过条件 失败条件 正例 反例
有据性(pass/fail 每条可核验事实都能在给定片段里找到依据 出现至少一个片段不支持的事实 模型说"未发布的模块无法用 go get 走常规流程"——片段里 "it's unavailable for the typical dependency management workflow using commands such as go get" 支持 模型说"发 alpha 前必须先用 go test 跑一遍"——片段没有说"必须 go test",属于无依据补全
资料不足处理(pass/fail 片段没讲的事,模型明确说"文档未说明",不瞎猜 把未知当确定 被问"beta 阶段具体要测什么",模型答"此片段未说明具体测试项" 被问"发布正式 v1 的流程"(片段只讲到 v0 预发布),模型却编造 v1 发布步骤——片段根本没提 v1
核心任务完成度(0/1/2 覆盖用户问题必须回答的全部要点(顺序 + 关键限制),给 2 分;覆盖大部分但漏 1 个非关键点,给 1 分。 答非所问、漏掉关键限制或约束,给 0 分。 先组织好模块源码;发布前模块无法用 go get 走常规流程,可先在本地目录测试;代码就绪后开始发布 v0 预发布版(alpha/beta)。 准备好代码后,用 go get 发布模块即可。

0/1/2 评分定义见 01-LLM-Evaluation-Roadmap 第六节;第一版不要增加维度。

一票否决项

  • 出现任何无证据事实 → 整体 fail,无论其他维度(这是最需要保护的行为边界)。

无法判断时的升级路径

  • 两个片段对同一说法冲突 → 标记 low confidence,人工仲裁,不自动评分。你的项目目前单片段,可写:片段未覆盖该问题 → 若模型正确拒答则不扣分,若无法判定则人工复核。

Rubric 修改记录

版本 日期 改了什么 为什么改 预期影响 实际结果
v0.1 2026-08-24 初版 首版 rubric

返回 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README