Files
my-vault/03_Resources/Development/AI-ML/Inkling.md
T
2026-08-19 15:39:53 +08:00

98 lines
5.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
title: Inkling — Thinking Machines Lab 的开源可定制 AI 模型
tags:
- AI
- LLM
- MoE
- 开源模型
- ThinkingMachines
created: 2026-08-19
source: ByteByteGo Newsletter (2026-08-18)
source_url: https://blog.bytebytego.com/p/the-new-american-ai-model-designed
---
# Inkling — Thinking Machines Lab 的开源可定制 AI 模型
> 来源:ByteByteGo 邮件通讯《The New American AI Model Designed to be Customized》(2026-08-18),内容基于公开资料整理。
## 背景
- **公司**Thinking Machines Lab,由 **Mira Murati**(OpenAI 前 CTO)创立,使命是"构建扩展人类意志与判断力的 AI"
- **发布**Inkling 于 **2026-07-15** 发布,是公司**第一个从零训练(trained from scratch)的模型**
- **授权**:权重以 **Apache 2.0** 协议发布在 Hugging Face,任何人可下载并重训
- **前置产品**:Tinker(微调开源模型的服务);Inkling 之前公司已用同架构做过实时交互系统(Interaction Models 论文)
- **公司四个方向**:训练强模型 / 用工具让用户以自己的知识定制模型 / 扩展人机通信通道 / 公开模型构建研究
## 核心规格
| 项目 | 数值 |
|---|---|
| 总参数 | **975B**(约 9750 亿) |
| 激活参数(每 token | **~41B**(约 4% |
| 层数 | 66 层 |
| 每层专家数 | 256 个,每 token 选 6 个运行 + 2 个共享专家(共 8 个运行) |
| 上下文窗口 | **1,000,000 token** |
| KV heads | 8 个 |
| 全精度 checkpoint | ≥2 TB 显存(8× NVIDIA B300 或 16× H200 |
| 量化 checkpoint | ~600 GB4× B300 |
## 五大核心设计
### 1. 稀疏 MoE(存储与算力分离)
- 总参数决定存储成本,激活参数决定每 token 计算成本
- 路由参考 **DeepSeek** 方案:sigmoid 打分 + **独立 bias 负载均衡**
- bias 只影响专家**选择**,不参与输出**加权**,由简单计数规则在反向传播外更新
- 避免"路由崩溃"(少数专家垄断 → 越用越强 → 更强 → 更被选中)
- 不引入与主目标竞争梯度的辅助损失
- 2 个共享专家每 token 都运行,处理通用信息;6 个路由专家 + 2 个共享专家的分数统一归一化后加权
### 2. 注意力:滑动窗口 + 全注意力 5:1
- 66 层 = **55 层滑动窗口 + 11 层全注意力**vLLM 集成说明给出的具体数字)
- 全注意力层用于远距离信息传递(约每 6 层 1 个),其余 5 层处理邻近上下文,成本线性增长
- 长上下文模型的常见局限:能把握整体内容但容易漏掉埋在中间的细节
### 3. 位置编码:弃 RoPE,用相对位置方案
- 采用 **Shaw et al. 相对位置编码**:学习 token 之间"距离"对应的值,直接加到注意力分数上
- 超过截断距离(如 128)共用同一学习值 → 长距离外推无需外推技巧
- 团队自测:比 RoPE 表现更好、长序列外推更稳
- 代价:vLLM 等推理框架需针对新格式写新代码(现有生态围绕 RoPE 构建)
### 4. 多模态:无独立预训练编码器
- **音频**mel 频谱图 → **dMel** 方法量化(纯数学取整,无需训练)
- **图像**:切 40×40 像素 patch → 四阶段 **hMLP stem** → 轻量转换层 → 与文本 token 拼接
- 多模态组件与主模型**从零一起训练**(通用领域数据)
- 注:官方"encoder-free"指无大型预训练编码器,并非零处理;模型卡同时称图像经"hierarchical patch encoder"编码,两者描述一致
### 5. Thinking effort(思考努力度,训练进模型的可调参数)
- 数值 0~1,预设:0(无)/ 0.1(最低)/ 0.2(低)/ 0.7(中)/ **0.9(默认)** / 0.99(最高)
- 机制:以系统消息形式在对话前注入;通过**强化学习**训练
- RL 时变化 effort 消息 + 调整每 token 计费成本(高 effort 允许长推理、低 effort 重罚长输出)
- 与 max token 上限相互独立;effort=0 只是倾向最少推理,非硬性规则
- 效果:Terminal Bench 2.1 上达到 NVIDIA Nemotron 3 Ultra 同等分数,但只生成约 **1/3** token
## 权衡与局限
- **硬件下限高**:稀疏路由让每 token 便宜,但整模型必须全部加载到内存
- **权重开源 ≠ 完全可复现**:训练数据、配方、训练代码均不公开,模型卡只给泛化数据来源描述
- **安全行为可被重训者调整**:官方建议消费者场景在模型外叠加审核/护栏工具
- 官方自认整体能力不如现有最强开源/闭源模型,卖点是**从第一天可微调 + 量化版本降低部署门槛**
## 参考资料
1. [Inkling: Our Open-Weights Model — Thinking Machines Lab](https://thinkingmachines.ai)
2. [Inkling Model Card — Thinking Machines Lab](https://huggingface.co/thinkingmachines)
3. [The Future Worth Building Is Human — Thinking Machines Lab](https://thinkingmachines.ai)
4. Tinker — Thinking Machines Lab(微调服务)
5. [Interaction Models: A Scalable Approach to Human-AI Collaboration](https://thinkingmachines.ai)
6. Thinking effort — Tinker Documentation
7. [thinkingmachines/Inkling — vLLM Recipes](https://github.com/vllm-project)
8. [DeepSeek-V3 Technical Report](https://arxiv.org/abs/2412.19437)
9. [Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts](https://arxiv.org/abs/2408.15664)
10. [Self-Attention with Relative Position Representations](https://arxiv.org/abs/1803.02155)
11. [dMel: Speech Tokenization made Simple](https://arxiv.org)
12. Three things everyone should know about Vision Transformers
## 相关笔记
- [[OpenRouter-config]]