Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-参考与归档/02-入门认知框架(草案).md
T

1.9 KiB

type, tags, status, created
type tags status created
draft
LLM评测
草案
归档
archive 2026-08-21

零基础入门:必须先弄懂的核心问题

目标重定义

初学者的第一目标不是“让模型变聪明”,而是能够回答:

  1. 我希望系统完成什么任务?
  2. 什么输出算成功,什么算失败?
  3. 当它失败时,失败属于哪一类?
  4. 修改系统后,我如何证明它真的变好了且没有伤害原有能力?

起步动作与隐藏原因

起步动作 表面上在做什么 实际上在解决什么认知问题
选一个小任务 缩小项目范围 避免把“模型能力”误当成不可验证的抽象概念。
写 10—20 个 case 准备样本 外化你对真实使用场景和边界的理解。
写 rubric 写评分标准 将个人直觉转化为他人可复现的操作定义。
手工盲评 比较答案 发现你的规则是否足够清晰,以及自己是否有模型偏好。
保存 run 存结果 分开“应测什么”与“本次实际发生什么”,使比较可追溯。
写最小脚本 汇总统计 从个别感受转向可重复观察。
分类失败 记错题 让修复有方向,避免所有问题都归咎于模型。
做回归 重跑旧案例 防止修一个问题又悄悄损坏另一个问题。

初学者最常见的误解

  • 误解:先挑最强模型或最热框架才算开始。
  • 误解:数据越多,评测越可靠。
  • 误解:有参考答案就不需要 rubric。
  • 误解:平均分提高就代表系统变好。
  • 误解:模型输出错了,一定是模型的问题。
  • 误解:把所有专业工程概念一次学会,才能动手。

解释风格

每个概念均应按“它是什么 → 为什么初学者先做它 → 不做会发生什么 → 最小行动 → 完成后学到什么”展开;用 RAG 文档问答作为默认示例,并在结尾映射到 Agent 工具调用。