--- aliases: - 入门认知框架 type: draft tags: - LLM评测 - 草案 - 归档 status: archive created: 2026-08-21 --- # 零基础入门:必须先弄懂的核心问题 ## 目标重定义 初学者的第一目标不是“让模型变聪明”,而是能够回答: 1. 我希望系统完成什么任务? 2. 什么输出算成功,什么算失败? 3. 当它失败时,失败属于哪一类? 4. 修改系统后,我如何证明它真的变好了且没有伤害原有能力? ## 起步动作与隐藏原因 | 起步动作 | 表面上在做什么 | 实际上在解决什么认知问题 | |---|---|---| | 选一个小任务 | 缩小项目范围 | 避免把“模型能力”误当成不可验证的抽象概念。 | | 写 10—20 个 case | 准备样本 | 外化你对真实使用场景和边界的理解。 | | 写 rubric | 写评分标准 | 将个人直觉转化为他人可复现的操作定义。 | | 手工盲评 | 比较答案 | 发现你的规则是否足够清晰,以及自己是否有模型偏好。 | | 保存 run | 存结果 | 分开“应测什么”与“本次实际发生什么”,使比较可追溯。 | | 写最小脚本 | 汇总统计 | 从个别感受转向可重复观察。 | | 分类失败 | 记错题 | 让修复有方向,避免所有问题都归咎于模型。 | | 做回归 | 重跑旧案例 | 防止修一个问题又悄悄损坏另一个问题。 | ## 初学者最常见的误解 - 误解:先挑最强模型或最热框架才算开始。 - 误解:数据越多,评测越可靠。 - 误解:有参考答案就不需要 rubric。 - 误解:平均分提高就代表系统变好。 - 误解:模型输出错了,一定是模型的问题。 - 误解:把所有专业工程概念一次学会,才能动手。 ## 解释风格 每个概念均应按“它是什么 → 为什么初学者先做它 → 不做会发生什么 → 最小行动 → 完成后学到什么”展开;用 RAG 文档问答作为默认示例,并在结尾映射到 Agent 工具调用。