--- aliases: - 材料清单 type: reference tags: - llm-evaluation - archive status: active created: 2026-08-21 --- # 材料清单与归档说明 本目录保留早期输出与设计草案,目的是保存职业背景、演化路径和可追溯性;日常学习请从 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]] 开始,不要从草案直接进入。 | 文件 | 当前角色 | 何时阅读 | 为什么归档而非放在主路线 | |---|---|---|---| | [[02_Areas/Job/llm_data_annotation_programmer_roadmap\|大模型数据标注与程序员入门]](原文存于 02_Areas/Job,本专区不再复制副本) | 职业全景与程序员能力迁移背景 | 想理解岗位、方向与能力地图时 | 覆盖面广,但不是第一个项目的直接操作材料。 | | [[02-Intro-Cognitive-Framework-Draft]] | Why Guide 的概念设计底稿 | 想研究内容设计或自行扩展课程时 | 已被正式 Why Guide 吸收,不建议日常阅读。 | | [[03-Roadmap-Refactor-Outline-Draft]] | Practical Roadmap 的结构设计底稿 | 想理解路线如何从审阅意见演化时 | 正式路线图已更完整,草案只保留历史价值。 | | [[evaluation-guidebook/00-Overview\|HuggingFace Evaluation Guidebook 中文提炼(子目录)]] | 外部权威评测知识参考(自动基准 / 人工评测 / LLM-as-judge / 排错等) | 设计或执行评测时按主题查阅 | 是外部资料的提炼笔记,作为查阅型参考而非个人学习主线的必经之路。 | ## 外部知识参考(evaluation-guidebook 子目录) 对 [HuggingFace Evaluation Guidebook](https://github.com/huggingface/evaluation-guidebook) 的中文提炼笔记: - [[evaluation-guidebook/00-Overview|总览:这是什么、怎么读]] - [[evaluation-guidebook/01-Automatic-Benchmarks|自动基准评测]] - [[evaluation-guidebook/02-Human-Evaluation|人工评测]] - [[evaluation-guidebook/03-LLM-as-a-Judge|LLM-as-a-Judge(模型作评委)]] - [[evaluation-guidebook/04-Troubleshooting|排错(推理 / LaTeX / 可复现性)]] - [[evaluation-guidebook/05-General-Knowledge|通用知识(推理与评测 / Tokenization)]] - [[evaluation-guidebook/06-Yearly-Dives|年度深度文章(2023–2025)]] - [[evaluation-guidebook/07-Resources|资源链接清单]] ## 正式学习材料不在本目录 - 建立心智模型:[[02-Why-Guide]] - 填写第一个项目:[[02-First-Week-Worksheet]] - 执行完整路线:[[01-LLM-Evaluation-Roadmap]] 返回 [[01_Projects/Personal-Tech/LLM_Evaluation/README|学习专区首页]]。