4.7 KiB
4.7 KiB
type, tags, status, created
| type | tags | status | created | |||
|---|---|---|---|---|---|---|
| moc |
|
active | 2026-08-21 |
LLM 评测学习专区
这个专区的目的不是收藏大量 AI 资料,而是循序建立一项工程能力:把模糊的产品期待变成可复现的判定系统,并能够诊断失败、验证改进与防止回归。
先怎么使用
请不要按文件夹顺序随机阅读。第一次学习建议走下面这条主线:
建立概念(What)
→ 理解为什么(Why)
→ 填写一份最小工作表
→ 做完第一个 10-case 小项目
→ 再进入完整工程路线(How)
| 顺序 | 阅读材料 | 解决的问题 | 完成标志 |
|---|---|---|---|
| 1 | 00-Start-Here | 我究竟在学什么,如何不被概念和工具淹没? | 完成十分钟动作,能复述学习主线。 |
| 2 | 01-What-Is-LLM-Evaluation | 评测的对象、边界与常用术语是什么? | 能区分模型评测与系统评测、Benchmark 与 Product Eval。 |
| 3 | 02-Why-Guide | 为什么先做 case、rubric、盲评、run、失败分类与回归? | 能解释每个动作在防什么问题。 |
| 4 | 02-First-Week-Worksheet | 今天应该写什么,卡住时怎样缩小范围? | 完成任务边界、10 个 case 与 rubric v0.1。 |
| 5 | 01_Projects/Personal-Tech/LLM_Evaluation/03-Practice/README | 如何把工作表变成自己的项目仓库? | 开始一个最小项目并保存第一个 run。 |
| 6 | 01-LLM-Evaluation-Roadmap | 怎样逐步走向 Judge、Agent、安全、数据资产与 CI? | 为自己选择一个 12 周内的下一阶段。 |
数量口径: 首周最低完成 10 个 case;若时间充裕,按路线图 Day 1 扩展至 20 个(结构见《首周工作表》第 2 节)。
目录结构为何这样设计
| 目录 | 放什么 | 不放什么 | 设计原因 |
|---|---|---|---|
00-Foundations |
基础概念、术语边界与速查地图(What) | 操作手册与个人项目数据 | 先建立共同语言,后续文档不再重复解释术语。 |
01-Getting-Started |
学习入口、进度看板与 Why Guide(Why) | 复杂工具的操作手册 | 让你每次打开专区都能立刻知道下一步与为什么。 |
02-Practical-Roadmap |
可执行路线、清单、模板、阶段性任务(How) | 一次性运行结果 | 将原则转成动作,且便于反复使用。 |
03-Practice |
每个亲自完成的 Eval 项目、实验记录、复盘 | 通用学习材料 | 学习材料与个人证据分离,项目才不会被笔记淹没。 |
04-Reference |
评测工程能力地图(基建 / 可复现 / 持续评测 / Agent 安全环境);旧草案归档于 archive/ |
正在执行的任务 | 保留来路和背景,但不干扰当前学习。 |
99-Attachments |
外部 PDF、截图、数据文件等二进制附件(也可统一放全库 05_Attachments) |
主笔记 | 保持 Markdown 笔记可搜索、可链接、可版本控制。 |
三条使用规则
规则一:先写再读。 每读完一个核心概念,都回到工作表写一项内容;只读不写容易产生“我已经会了”的错觉。
规则二:项目笔记不放在通用材料旁。 每个项目单独放入
03-Practice/项目名/,防止模板、原理和实际 run 混在一起。
规则三:只要改变了 case、rubric、prompt、模型或文档版本,就记一条实验日志。 日志不必长,但要说明改了什么、为什么改、预期影响和实际结果。
你的当前入口
打开 00-Start-Here,完成其中的十分钟动作;完成后再填写 02-First-Week-Worksheet。
关联材料
- 职业与岗位背景:02_Areas/Job/llm_data_annotation_programmer_roadmap(原文存于 02_Areas/Job)
- 入门认知草案:02-Intro-Cognitive-Framework-Draft
- 路线图重构草案:03-Roadmap-Refactor-Outline-Draft
- 评测工程资源地图:04-Reference/README(五层能力框架与推荐精读顺序)
- 外部权威知识参考:04-Reference/evaluation-guidebook/00-Overview(自动基准 / 人工评测 / LLM-as-judge / 排错,按主题查阅)
- 外部精选资源(已归档):04-Reference/archive/01-Curated-External-Resources(顶级大厂与开源组织的生产级方案、评测基建与硬核课程源码)