Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/01-go-docs-qa/03-run-and-blind-review.md
T

2.1 KiB

type, status
type status
project active

03 · 运行与盲评

为什么盲评、最小记录格式见 02-Why-Guide 第 4 步;run 的 JSONL schema 见 01-LLM-Evaluation-Roadmap 第五节。

候选生成条件(对应工作表第 3 节)

项目 A B
模型 / 来源
系统提示词版本
温度 / 生成设置
运行日期
dataset_version

重要:先把来源隐藏、随机标 A/B;完成全部判断前不要看真实来源。

盲评记录(对应工作表第 4 节)

判"有据性"与"资料不足"时,对照 02-case-design.md 顶部"输入上下文(冻结快照)"。

Case A:有据性 A:资料不足 A:完成度 B:有据性 B:资料不足 B:完成度 更优/平局 一句话理由 置信度
01
02
03
04
05
06
07
08
09
10

低置信度归因(low 不是坏事,是最有价值的发现)

Case 为什么难判 下一步动作
rubric 模糊 / 文档不完整 / 问题有歧义 / 自己标错 改规则 / 补证据 / 移出自动评分 / 请人复核

Run 记录(可选,脚本自动生成)

每次运行保存:case_id / system_version / model / temperature / trial / timestamp / output / grading。大输入只存 case_id + 版本号,不复制全文。

{
  "case_id": "rag-0001",
  "run": { "system_version": "", "model": "", "temperature": 0, "trial": 1, "timestamp": "" },
  "output": "",
  "grading": { "groundedness": "", "completeness": 0, "grader_version": "human-v0.1" }
}

返回 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README