From a9b4031343f57587c31817126801c36a05c4f2eb Mon Sep 17 00:00:00 2001 From: zhiqiang feng Date: Wed, 19 Aug 2026 15:39:53 +0800 Subject: [PATCH] add a note --- 03_Resources/Development/AI-ML/Inkling.md | 97 +++++++++++++++++++++++ 1 file changed, 97 insertions(+) create mode 100644 03_Resources/Development/AI-ML/Inkling.md diff --git a/03_Resources/Development/AI-ML/Inkling.md b/03_Resources/Development/AI-ML/Inkling.md new file mode 100644 index 0000000..e2ddf3f --- /dev/null +++ b/03_Resources/Development/AI-ML/Inkling.md @@ -0,0 +1,97 @@ +--- +title: Inkling — Thinking Machines Lab 的开源可定制 AI 模型 +tags: + - AI + - LLM + - MoE + - 开源模型 + - ThinkingMachines +created: 2026-08-19 +source: ByteByteGo Newsletter (2026-08-18) +source_url: https://blog.bytebytego.com/p/the-new-american-ai-model-designed +--- + +# Inkling — Thinking Machines Lab 的开源可定制 AI 模型 + +> 来源:ByteByteGo 邮件通讯《The New American AI Model Designed to be Customized》(2026-08-18),内容基于公开资料整理。 + +## 背景 + +- **公司**:Thinking Machines Lab,由 **Mira Murati**(OpenAI 前 CTO)创立,使命是"构建扩展人类意志与判断力的 AI" +- **发布**:Inkling 于 **2026-07-15** 发布,是公司**第一个从零训练(trained from scratch)的模型** +- **授权**:权重以 **Apache 2.0** 协议发布在 Hugging Face,任何人可下载并重训 +- **前置产品**:Tinker(微调开源模型的服务);Inkling 之前公司已用同架构做过实时交互系统(Interaction Models 论文) +- **公司四个方向**:训练强模型 / 用工具让用户以自己的知识定制模型 / 扩展人机通信通道 / 公开模型构建研究 + +## 核心规格 + +| 项目 | 数值 | +|---|---| +| 总参数 | **975B**(约 9750 亿) | +| 激活参数(每 token) | **~41B**(约 4%) | +| 层数 | 66 层 | +| 每层专家数 | 256 个,每 token 选 6 个运行 + 2 个共享专家(共 8 个运行) | +| 上下文窗口 | **1,000,000 token** | +| KV heads | 8 个 | +| 全精度 checkpoint | ≥2 TB 显存(8× NVIDIA B300 或 16× H200) | +| 量化 checkpoint | ~600 GB(4× B300) | + +## 五大核心设计 + +### 1. 稀疏 MoE(存储与算力分离) +- 总参数决定存储成本,激活参数决定每 token 计算成本 +- 路由参考 **DeepSeek** 方案:sigmoid 打分 + **独立 bias 负载均衡** + - bias 只影响专家**选择**,不参与输出**加权**,由简单计数规则在反向传播外更新 + - 避免"路由崩溃"(少数专家垄断 → 越用越强 → 更强 → 更被选中) + - 不引入与主目标竞争梯度的辅助损失 +- 2 个共享专家每 token 都运行,处理通用信息;6 个路由专家 + 2 个共享专家的分数统一归一化后加权 + +### 2. 注意力:滑动窗口 + 全注意力 5:1 +- 66 层 = **55 层滑动窗口 + 11 层全注意力**(vLLM 集成说明给出的具体数字) +- 全注意力层用于远距离信息传递(约每 6 层 1 个),其余 5 层处理邻近上下文,成本线性增长 +- 长上下文模型的常见局限:能把握整体内容但容易漏掉埋在中间的细节 + +### 3. 位置编码:弃 RoPE,用相对位置方案 +- 采用 **Shaw et al. 相对位置编码**:学习 token 之间"距离"对应的值,直接加到注意力分数上 +- 超过截断距离(如 128)共用同一学习值 → 长距离外推无需外推技巧 +- 团队自测:比 RoPE 表现更好、长序列外推更稳 +- 代价:vLLM 等推理框架需针对新格式写新代码(现有生态围绕 RoPE 构建) + +### 4. 多模态:无独立预训练编码器 +- **音频**:mel 频谱图 → **dMel** 方法量化(纯数学取整,无需训练) +- **图像**:切 40×40 像素 patch → 四阶段 **hMLP stem** → 轻量转换层 → 与文本 token 拼接 +- 多模态组件与主模型**从零一起训练**(通用领域数据) +- 注:官方"encoder-free"指无大型预训练编码器,并非零处理;模型卡同时称图像经"hierarchical patch encoder"编码,两者描述一致 + +### 5. Thinking effort(思考努力度,训练进模型的可调参数) +- 数值 0~1,预设:0(无)/ 0.1(最低)/ 0.2(低)/ 0.7(中)/ **0.9(默认)** / 0.99(最高) +- 机制:以系统消息形式在对话前注入;通过**强化学习**训练 +- RL 时变化 effort 消息 + 调整每 token 计费成本(高 effort 允许长推理、低 effort 重罚长输出) +- 与 max token 上限相互独立;effort=0 只是倾向最少推理,非硬性规则 +- 效果:Terminal Bench 2.1 上达到 NVIDIA Nemotron 3 Ultra 同等分数,但只生成约 **1/3** token + +## 权衡与局限 + +- **硬件下限高**:稀疏路由让每 token 便宜,但整模型必须全部加载到内存 +- **权重开源 ≠ 完全可复现**:训练数据、配方、训练代码均不公开,模型卡只给泛化数据来源描述 +- **安全行为可被重训者调整**:官方建议消费者场景在模型外叠加审核/护栏工具 +- 官方自认整体能力不如现有最强开源/闭源模型,卖点是**从第一天可微调 + 量化版本降低部署门槛** + +## 参考资料 + +1. [Inkling: Our Open-Weights Model — Thinking Machines Lab](https://thinkingmachines.ai) +2. [Inkling Model Card — Thinking Machines Lab](https://huggingface.co/thinkingmachines) +3. [The Future Worth Building Is Human — Thinking Machines Lab](https://thinkingmachines.ai) +4. Tinker — Thinking Machines Lab(微调服务) +5. [Interaction Models: A Scalable Approach to Human-AI Collaboration](https://thinkingmachines.ai) +6. Thinking effort — Tinker Documentation +7. [thinkingmachines/Inkling — vLLM Recipes](https://github.com/vllm-project) +8. [DeepSeek-V3 Technical Report](https://arxiv.org/abs/2412.19437) +9. [Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts](https://arxiv.org/abs/2408.15664) +10. [Self-Attention with Relative Position Representations](https://arxiv.org/abs/1803.02155) +11. [dMel: Speech Tokenization made Simple](https://arxiv.org) +12. Three things everyone should know about Vision Transformers + +## 相关笔记 + +- [[OpenRouter-config]]