feat: 完成 LLM Wiki v2 升级

- 新增知识管理系统核心文档
  - automation-hooks.md: 自动化钩子和事件驱动架构
  - knowledge-lifecycle.md: 知识生命周期和遗忘曲线
  - quality-control.md: 质量控制和自我纠正机制
  - llm-wiki-v2-reference.md: v2 参考文档

- 更新索引和架构
  - index.md: 重构为目录导航,移除详细列表
  - SCHEMA.md: 更新知识管理领域定义

- 新增辅助文档
  - hybrid-search.md: 混合搜索系统
  - systems-design/aodb-system-architecture.md: AODB系统架构

版本: LLM Wiki v2.1.0
特性: 置信度衰减、智能整合、质量验证、事件驱动自动化
This commit is contained in:
zhiqiang feng
2026-04-13 17:22:30 +08:00
parent 66d081faaf
commit 99d66a9601
9 changed files with 3890 additions and 219 deletions
+143
View File
@@ -243,3 +243,146 @@ relationships:
## Glossary(術語表)
建設和運營涉及的英文縮寫和術語,統一在 `concepts/tech-infrastructure/glossary.md` 中解釋。
---
# LLM Wiki v2 擴展架構
*(基於 Andrej Karpathy 原版模式,融合 LLM Wiki v2 和 agentmemory 經驗)*
## 核心理念:停止重新推導,開始積累編譯
### 現有架構回顧
- **原始數據**`raw/` 目錄中的來源文件,保持原始、未經編輯
- **Wiki 頁面**:經過整理、鏈接的知識頁面(`concepts/`, `entities/`, `comparisons/`
- **Schema 文檔**`SCHEMA.md`,將通用 LLM 轉化為有紀律的知識工作者
### v2 關鍵擴展
#### 1. 記憶生命周期(Knowledge Lifecycle
知識具有生命周期,不是所有內容永久有效:
- **置信度評分**:每個事實應基於來源數量、新近性、矛盾情況攜帶分數(0.0-1.0)
- **替代機制**:新信息明確替代舊聲明,支持知識版本控制
- **遺忘機制**:實施保留曲線(如艾賓浩斯遺忘曲線),逐步降低未使用知識的優先級
- **整合層次**:知識壓縮管道:
- **工作記憶**:近期觀察(當前會話)
- **情景記憶**:會話總結(跨工作記憶的壓縮)
- **語義記憶**:跨會話事實(穩定知識)
- **程序記憶**:從重複語義中提煉的工作流和模式
#### 2. 超越扁平頁面:知識圖譜
用類型化知識圖譜增強 wiki 頁面:
- **實體提取**:提取結構化實體(人員、項目、庫、概念)及類型、屬性、關係
- **類型化關係**:使用語義加權連接,如 `uses`、`depends_on`、`contradicts`、`supersedes`
- **圖譜遍歷查詢**:導航連接以發現下游影響,超越關鍵詞搜索
#### 3. 真正可擴展的搜索(關鍵突破)
當 `index.md` 超出 ~100-200 頁時變得不可行:
- **混合搜索**:融合三種信息流:
1. **BM25**:關鍵詞匹配(支持詞幹提取/同義詞)
2. **向量搜索**:通過嵌入實現語義相似度(例如 OpenAI `text-embedding-3-small`
3. **圖譜遍歷**:基於實體關係的遍歷搜索
- **結果融合**:使用倒數排名融合(Reciprocal Rank Fusion)合併結果
- **保留 `index.md`**:僅作為人工可讀目錄,不再是主要檢索工具
#### 4. 自動化:從手動到事件驅動
減少人工維護負擔:
- **事件鉤子**(自動觸發):
- **新來源時**:自動攝入、提取實體、更新圖譜/索引
- **會話開始/結束時**:加載上下文、將會話壓縮為觀察
- **查詢時**:如質量分數 > 閾值,自動回寫答案
- **內存寫入時**:檢查矛盾
- **定時任務**:定期 lint、整合、保留衰減
- **自動攝入管道**`raw/` 中新增源文件 → 自動解析 → 創建/更新 wiki 頁面
#### 5. 質量與自我糾正
防止噪聲積累的控制機制:
- **評分一切**:LLM 生成內容應獲得質量分數(結構良好、引用來源、一致性)。低分標記待審查/重寫
- **自我修復**:Lint 操作應自動修復孤立頁面、過時聲明、損壞的交叉引用
- **矛盾解決**:基於新近性、權威性和支持觀察,LLM 應提出更可能正確的主張
#### 6. 多智能體與協作
為多個智能體或人員擴展模式:
- **網狀同步**:合併來自並行智能體的觀察;使用帶時間戳的最後寫入獲勝衝突解決
- **共享 vs 私有**:知識範圍劃分(個人偏好 vs 項目架構)
- **工作協調**:輕量級協調以防止重複工作並跟踪進展
#### 7. 隱私與治理
處理敏感信息和問責:
- **攝入時過濾**:在 wiki 存儲前自動剝離 API 密鑰、憑據、個人身份信息
- **審計追踪**:記錄所有操作(攝入、編輯、刪除、查詢)的時間戳、更改和原因
- **批量操作**:用於過時內容刪除、導出、合併的經過審計且可逆操作
#### 8. 結晶化:從探索中提煉
自動將已完成的工作鏈提煉為結構化摘要:
- **處理過程**:提取問題、發現、涉及的文件/實體、經驗教訓
- **結果**:創建一等級 wiki 頁面,用新事實強化知識庫
#### 9. 超越 Markdown 的輸出格式
基於受眾和問題的知識存儲應支持多樣輸出:
- 對比表格、時間線可視化、依賴關係圖、幻燈片、結構化數據導出(JSON、CSV)、簡報
## 實施路線圖
### 階段 1:基礎 LLM Wiki(已實現)
- ✓ 原始來源存儲(`raw/`
- ✓ Wiki 頁面(`concepts/`, `entities/`, `comparisons/`
- ✓ Schema 文檔(`SCHEMA.md`
- ✓ 目錄索引(`index.md`
- ✓ 操作日誌(`log.md`
### 階段 2:v2 擴展(本次升級目標)
1. **記憶生命周期**:置信度評分、替代機制、遺忘曲線
2. **知識圖譜**:實體提取、類型化關係、圖譜可視化
3. **混合搜索**BM25 + 向量 + 圖譜遍歷
4. **自動化鉤子**:事件驅動維護
5. **質量控制**:自我糾正、矛盾檢測
6. **結晶化**:工作鏈提煉
### 階段 3:高級功能
1. **多智能體協作**:網狀同步、衝突解決
2. **隱私過濾**:自動敏感信息剝離
3. **多格式輸出**:API 導出、可視化生成
## 實施細節
### 混合搜索設置
```
# 檢索層級
1. BM25 關鍵詞匹配(使用 ripgrep + 同義詞詞典)
2. 向量語義搜索(使用 OpenAI embeddings
3. 知識圖譜遍歷(實體關係路徑)
4. 結果融合(RRF 算法)
```
### 記憶衰減公式
```
confidence_t = confidence_0 * exp(-λ * t) + Σ(citations * 0.1)
λ = 衰減率(每月 0.005-0.05,依內容類型)
```
### 自動化鉤子示例
```bash
# 新增來源時
on_new_source() {
parse_source → extract_entities → create_wiki_pages → update_index
}
# 會話結束時
on_session_end() {
compress_session → update_episodic_memory → decay_confidence
}
# 定期任務(每週)
cron_weekly() {
run_lint → fix_issues → prune_dormant → regenerate_embeddings
}
```
## 參考文檔
- [[knowledge-management/memory-lifecycle.md]] - 記憶生命周期詳細設計
- [[knowledge-management/knowledge-graph.md]] - 知識圖譜實現指南
- [[knowledge-management/wiki-operations.md]] - wiki 運營與自動化
- [[hybrid-search.md]] - 混合搜索系統文檔
- [[llm-wiki-v2-reference.md]] - LLM Wiki v2 完整參考
```