Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/01-go-docs-qa/01-task-and-rubric.md
T
windyboy b182762e14 refactor(vault): Phase 3 — metadata convergence
- Backfill `created` frontmatter on 266 active notes (git date or mtime)
- Normalize `status` to 4 values: draft/active/done/archived (11 notes)
  - Active/进行中/needs-review → active
  - archive → archived
  - 待执行/conditional → draft
  - 完成/accepted → done
- Declare clipper boundary: 04_Archive/Inbox-Clippings/** exempt from migration
- Update depth rule: max 3 → max 4 levels (new notes only)
- Add metadata-converge.mjs script for reproducibility
2026-09-26 11:37:19 +08:00

4.9 KiB
Raw Blame History

created, type, status
created type status
2026-08-24 project active

01 · 任务与 Rubric

权威版本:rubric 三维度的完整定义见 01-LLM-Evaluation-Roadmap 第六节;为什么这样设计见 02-Why-Guide 第 3 步。本文件只记录本项目的填写结果。

任务边界(对应工作表第 0 节)

项目 你的填写
任务名称 公开文档约束下的技术问答(Go 模块发布流程)
用户输入 一个问题 + 上面这段 Common workflow steps 文档片段
系统输出 简短回答 + 文档引用位置
一句话成功条件 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明
三类失败 无依据事实;过度肯定;引用错误
非目标 不评价文档外的 Go 常识(semver、/v2 后缀、go get 细节等)
数据来源 / 许可 来源 Go 官方文档 release-workflow 页;URL https://go.dev/doc/modules/release-workflow;日期 2026-08-24;BSD 风格;PII:N/A

输入上下文原文(文档片段等)冻结于 02-case-design.md 顶部快照;本表只记录出处与许可,不复制原文。

Rubric v0.1(对应工作表第 1 节)

维度 通过条件 失败条件 正例 反例
有据性(pass/fail) 每条可核验事实都能在给定片段里找到依据 出现至少一个片段不支持的事实 模型说"未发布的模块无法用 go get 走常规流程"——片段里 "it's unavailable for the typical dependency management workflow using commands such as go get" 支持 模型说"发 alpha 前必须先用 go test 跑一遍"——片段没有说"必须 go test",属于无依据补全
资料不足处理(pass/fail) 片段没讲的事,模型明确说"文档未说明",不瞎猜 把未知当确定 被问"beta 阶段具体要测什么",模型答"此片段未说明具体测试项" 被问"发布正式 v1 的流程"(片段只讲到 v0 预发布),模型却编造 v1 发布步骤——片段根本没提 v1
核心任务完成度(0/1/2) 覆盖用户问题必须回答的全部要点(顺序 + 关键限制),给 2 分;覆盖大部分但漏 1 个非关键点,给 1 分。 答非所问、漏掉关键限制或约束,给 0 分。 先组织好模块源码;发布前模块无法用 go get 走常规流程,可先在本地目录测试;代码就绪后开始发布 v0 预发布版(alpha/beta)。 准备好代码后,用 go get 发布模块即可。

0/1/2 评分定义见 01-LLM-Evaluation-Roadmap 第六节;第一版不要增加维度。

一票否决项

  • 出现任何无证据事实 → 整体 fail,无论其他维度(这是最需要保护的行为边界)。

无法判断时的升级路径

  • 两个片段对同一说法冲突 → 标记 low confidence,人工仲裁,不自动评分。你的项目目前单片段,可写:片段未覆盖该问题 → 若模型正确拒答则不扣分,若无法判定则人工复核。

Rubric 修改记录

版本 日期 改了什么 为什么改 预期影响 实际结果
v0.1 2026-08-24 初版 首版 rubric

返回 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README。