47 lines
1.9 KiB
Markdown
47 lines
1.9 KiB
Markdown
---
|
|||
|
|
type: draft
|
||
|
|
tags:
|
||
|
|
- LLM评测
|
||
|
|
- 草案
|
||
|
|
- 归档
|
||
|
|
status: archive
|
||
|
|
created: 2026-08-21
|
||
|
|
---
|
||
|
|
|
||
|
|
# 零基础入门:必须先弄懂的核心问题
|
||
|
|
|
||
|
|
## 目标重定义
|
||
|
|
|
||
|
|
初学者的第一目标不是“让模型变聪明”,而是能够回答:
|
||
|
|
|
||
|
|
1. 我希望系统完成什么任务?
|
||
|
|
2. 什么输出算成功,什么算失败?
|
||
|
|
3. 当它失败时,失败属于哪一类?
|
||
|
|
4. 修改系统后,我如何证明它真的变好了且没有伤害原有能力?
|
||
|
|
|
||
|
|
## 起步动作与隐藏原因
|
||
|
|
|
||
|
|
| 起步动作 | 表面上在做什么 | 实际上在解决什么认知问题 |
|
||
|
|
|---|---|---|
|
||
|
|
| 选一个小任务 | 缩小项目范围 | 避免把“模型能力”误当成不可验证的抽象概念。 |
|
||
|
|
| 写 10—20 个 case | 准备样本 | 外化你对真实使用场景和边界的理解。 |
|
||
|
|
| 写 rubric | 写评分标准 | 将个人直觉转化为他人可复现的操作定义。 |
|
||
|
|
| 手工盲评 | 比较答案 | 发现你的规则是否足够清晰,以及自己是否有模型偏好。 |
|
||
|
|
| 保存 run | 存结果 | 分开“应测什么”与“本次实际发生什么”,使比较可追溯。 |
|
||
|
|
| 写最小脚本 | 汇总统计 | 从个别感受转向可重复观察。 |
|
||
|
|
| 分类失败 | 记错题 | 让修复有方向,避免所有问题都归咎于模型。 |
|
||
|
|
| 做回归 | 重跑旧案例 | 防止修一个问题又悄悄损坏另一个问题。 |
|
||
|
|
|
||
|
|
## 初学者最常见的误解
|
||
|
|
|
||
|
|
- 误解:先挑最强模型或最热框架才算开始。
|
||
|
|
- 误解:数据越多,评测越可靠。
|
||
|
|
- 误解:有参考答案就不需要 rubric。
|
||
|
|
- 误解:平均分提高就代表系统变好。
|
||
|
|
- 误解:模型输出错了,一定是模型的问题。
|
||
|
|
- 误解:把所有专业工程概念一次学会,才能动手。
|
||
|
|
|
||
|
|
## 解释风格
|
||
|
|
|
||
|
|
每个概念均应按“它是什么 → 为什么初学者先做它 → 不做会发生什么 → 最小行动 → 完成后学到什么”展开;用 RAG 文档问答作为默认示例,并在结尾映射到 Agent 工具调用。
|