50 lines
4.7 KiB
Markdown
50 lines
4.7 KiB
Markdown
---
|
||||
|
|
type: project
|
|||
|
|
status: active
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# 01 · 任务与 Rubric
|
|||
|
|
|
|||
|
|
> 权威版本:rubric 三维度的完整定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;为什么这样设计见 [[02-Why-Guide]] 第 3 步。本文件只记录本项目的填写结果。
|
|||
|
|
|
|||
|
|
## 任务边界(对应工作表第 0 节)
|
|||
|
|
|
|||
|
|
| 项目 | 你的填写 |
|
|||
|
|
| --------- | ---------------------------------------------------------------------------------------------------------- |
|
|||
|
|
| 任务名称 | 公开文档约束下的技术问答(Go 模块发布流程) |
|
|||
|
|
| 用户输入 | 一个问题 + 上面这段 Common workflow steps 文档片段 |
|
|||
|
|
| 系统输出 | 简短回答 + 文档引用位置 |
|
|||
|
|
| 一句话成功条件 | 回答中的关键事实均可由给定文档片段支持;资料不足时明确说明 |
|
|||
|
|
| 三类失败 | 无依据事实;过度肯定;引用错误 |
|
|||
|
|
| 非目标 | 不评价文档外的 Go 常识(semver、/v2 后缀、go get 细节等) |
|
|||
|
|
| 数据来源 / 许可 | 来源 Go 官方文档 release-workflow 页;URL https://go.dev/doc/modules/release-workflow;日期 2026-08-24;BSD 风格;PII:N/A |
|
|||
|
|
|
|||
|
|
## Rubric v0.1(对应工作表第 1 节)
|
|||
|
|
|
|||
|
|
| 维度 | 通过条件 | 失败条件 | 正例 | 反例 |
|
|||
|
|
| ----------------- | ------------------------------------------------------- | --------------------- | ----------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------- |
|
|||
|
|
| 有据性(pass/fail) | 每条可核验事实都能在给定片段里找到依据 | 出现至少一个片段不支持的事实 | 模型说"未发布的模块无法用 go get 走常规流程"——片段里 "it's unavailable for the typical dependency management workflow using commands such as go get" 支持 | 模型说"发 alpha 前必须先用 go test 跑一遍"——片段没有说"必须 go test",属于无依据补全 |
|
|||
|
|
| 资料不足处理(pass/fail) | 片段没讲的事,模型明确说"文档未说明",不瞎猜 | 把未知当确定 | 被问"beta 阶段具体要测什么",模型答"此片段未说明具体测试项" | 被问"发布正式 v1 的流程"(片段只讲到 v0 预发布),模型却编造 v1 发布步骤——片段根本没提 v1 |
|
|||
|
|
| 核心任务完成度(0/1/2) | 覆盖用户问题必须回答的全部要点(顺序 + 关键限制),给 2 分;覆盖大部分但漏 1 个非关键点,给 1 分。 | 答非所问、漏掉关键限制或约束,给 0 分。 | 先组织好模块源码;发布前模块无法用 go get 走常规流程,可先在本地目录测试;代码就绪后开始发布 v0 预发布版(alpha/beta)。 | 准备好代码后,用 go get 发布模块即可。 |
|
|||
|
|
|
|||
|
|
> 0/1/2 评分定义见 [[01-LLM-Evaluation-Roadmap]] 第六节;第一版不要增加维度。
|
|||
|
|
|
|||
|
|
### 一票否决项
|
|||
|
|
|
|||
|
|
- 出现任何无证据事实 → 整体 fail,无论其他维度(这是最需要保护的行为边界)。
|
|||
|
|
|
|||
|
|
### 无法判断时的升级路径
|
|||
|
|
|
|||
|
|
- 两个片段对同一说法冲突 → 标记 low confidence,人工仲裁,不自动评分。你的项目目前单片段,可写:片段未覆盖该问题 → 若模型正确拒答则不扣分,若无法判定则人工复核。
|
|||
|
|
|
|||
|
|
### Rubric 修改记录
|
|||
|
|
|
|||
|
|
| 版本 | 日期 | 改了什么 | 为什么改 | 预期影响 | 实际结果 |
|
|||
|
|
| ---- | ---------- | ---- | ---- | ------ | ---- |
|
|||
|
|
| v0.1 | 2026-08-24 | 初版 | 首版 | rubric | |
|
|||
|
|
| | | | | | |
|
|||
|
|
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
返回 [[01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README|项目实践入口]]。
|