Files
my-vault/01_Projects/Personal-Tech/LLM_Evaluation/04-Reference-Archive/00-Material-List.md
T
windyboy f375cd6134 add evaluation-guidebook notes: HF guidebook knowledge (2024 GitHub + 2025 Space) into LLM_Evaluation
- Add 9 Chinese distilled notes under 04-Reference-Archive/evaluation-guidebook/
  covering automated benchmarks, human evaluation, LLM-as-a-judge,
  troubleshooting, general knowledge, yearly dives, resources, and the
  2025 HF Space edition (FineWeb eval-selection methodology, MCF/CF/FG,
  sampling metrics, Math-Verify, statistical validity & cost)
- Update zone README and Material-List with entry links
2026-08-21 16:19:12 +08:00

2.5 KiB

aliases, type, tags, status, created
aliases type tags status created
材料清单
reference
llm-evaluation
archive
active 2026-08-21

材料清单与归档说明

本目录保留早期输出与设计草案,目的是保存职业背景、演化路径和可追溯性;日常学习请从 01_Projects/Personal-Tech/LLM_Evaluation/README 开始,不要从草案直接进入。

文件 当前角色 何时阅读 为什么归档而非放在主路线
02_Areas/Job/llm_data_annotation_programmer_roadmap(原文存于 02_Areas/Job,本专区不再复制副本) 职业全景与程序员能力迁移背景 想理解岗位、方向与能力地图时 覆盖面广,但不是第一个项目的直接操作材料。
02-Intro-Cognitive-Framework-Draft Why Guide 的概念设计底稿 想研究内容设计或自行扩展课程时 已被正式 Why Guide 吸收,不建议日常阅读。
03-Roadmap-Refactor-Outline-Draft Practical Roadmap 的结构设计底稿 想理解路线如何从审阅意见演化时 正式路线图已更完整,草案只保留历史价值。
evaluation-guidebook/00-Overview 外部权威评测知识参考(自动基准 / 人工评测 / LLM-as-judge / 排错等) 设计或执行评测时按主题查阅 是外部资料的提炼笔记,作为查阅型参考而非个人学习主线的必经之路。

外部知识参考(evaluation-guidebook 子目录)

HuggingFace Evaluation Guidebook 的中文提炼笔记:

正式学习材料不在本目录

返回 01_Projects/Personal-Tech/LLM_Evaluation/README