Files
2026-08-19 15:39:53 +08:00

5.5 KiB
Raw Permalink Blame History

title, tags, created, source, source_url
title tags created source source_url
Inkling — Thinking Machines Lab 的开源可定制 AI 模型
AI
LLM
MoE
开源模型
ThinkingMachines
2026-08-19 ByteByteGo Newsletter (2026-08-18) https://blog.bytebytego.com/p/the-new-american-ai-model-designed

Inkling — Thinking Machines Lab 的开源可定制 AI 模型

来源:ByteByteGo 邮件通讯《The New American AI Model Designed to be Customized》(2026-08-18),内容基于公开资料整理。

背景

  • 公司Thinking Machines Lab,由 Mira Murati(OpenAI 前 CTO)创立,使命是"构建扩展人类意志与判断力的 AI"
  • 发布Inkling 于 2026-07-15 发布,是公司第一个从零训练(trained from scratch)的模型
  • 授权:权重以 Apache 2.0 协议发布在 Hugging Face,任何人可下载并重训
  • 前置产品:Tinker(微调开源模型的服务);Inkling 之前公司已用同架构做过实时交互系统(Interaction Models 论文)
  • 公司四个方向:训练强模型 / 用工具让用户以自己的知识定制模型 / 扩展人机通信通道 / 公开模型构建研究

核心规格

项目 数值
总参数 975B(约 9750 亿)
激活参数(每 token ~41B(约 4%
层数 66 层
每层专家数 256 个,每 token 选 6 个运行 + 2 个共享专家(共 8 个运行)
上下文窗口 1,000,000 token
KV heads 8 个
全精度 checkpoint ≥2 TB 显存(8× NVIDIA B300 或 16× H200
量化 checkpoint ~600 GB4× B300

五大核心设计

1. 稀疏 MoE(存储与算力分离)

  • 总参数决定存储成本,激活参数决定每 token 计算成本
  • 路由参考 DeepSeek 方案:sigmoid 打分 + 独立 bias 负载均衡
    • bias 只影响专家选择,不参与输出加权,由简单计数规则在反向传播外更新
    • 避免"路由崩溃"(少数专家垄断 → 越用越强 → 更强 → 更被选中)
    • 不引入与主目标竞争梯度的辅助损失
  • 2 个共享专家每 token 都运行,处理通用信息;6 个路由专家 + 2 个共享专家的分数统一归一化后加权

2. 注意力:滑动窗口 + 全注意力 5:1

  • 66 层 = 55 层滑动窗口 + 11 层全注意力vLLM 集成说明给出的具体数字)
  • 全注意力层用于远距离信息传递(约每 6 层 1 个),其余 5 层处理邻近上下文,成本线性增长
  • 长上下文模型的常见局限:能把握整体内容但容易漏掉埋在中间的细节

3. 位置编码:弃 RoPE,用相对位置方案

  • 采用 Shaw et al. 相对位置编码:学习 token 之间"距离"对应的值,直接加到注意力分数上
  • 超过截断距离(如 128)共用同一学习值 → 长距离外推无需外推技巧
  • 团队自测:比 RoPE 表现更好、长序列外推更稳
  • 代价:vLLM 等推理框架需针对新格式写新代码(现有生态围绕 RoPE 构建)

4. 多模态:无独立预训练编码器

  • 音频mel 频谱图 → dMel 方法量化(纯数学取整,无需训练)
  • 图像:切 40×40 像素 patch → 四阶段 hMLP stem → 轻量转换层 → 与文本 token 拼接
  • 多模态组件与主模型从零一起训练(通用领域数据)
  • 注:官方"encoder-free"指无大型预训练编码器,并非零处理;模型卡同时称图像经"hierarchical patch encoder"编码,两者描述一致

5. Thinking effort(思考努力度,训练进模型的可调参数)

  • 数值 0~1,预设:0(无)/ 0.1(最低)/ 0.2(低)/ 0.7(中)/ 0.9(默认) / 0.99(最高)
  • 机制:以系统消息形式在对话前注入;通过强化学习训练
  • RL 时变化 effort 消息 + 调整每 token 计费成本(高 effort 允许长推理、低 effort 重罚长输出)
  • 与 max token 上限相互独立;effort=0 只是倾向最少推理,非硬性规则
  • 效果:Terminal Bench 2.1 上达到 NVIDIA Nemotron 3 Ultra 同等分数,但只生成约 1/3 token

权衡与局限

  • 硬件下限高:稀疏路由让每 token 便宜,但整模型必须全部加载到内存
  • 权重开源 ≠ 完全可复现:训练数据、配方、训练代码均不公开,模型卡只给泛化数据来源描述
  • 安全行为可被重训者调整:官方建议消费者场景在模型外叠加审核/护栏工具
  • 官方自认整体能力不如现有最强开源/闭源模型,卖点是从第一天可微调 + 量化版本降低部署门槛

参考资料

  1. Inkling: Our Open-Weights Model — Thinking Machines Lab
  2. Inkling Model Card — Thinking Machines Lab
  3. The Future Worth Building Is Human — Thinking Machines Lab
  4. Tinker — Thinking Machines Lab(微调服务)
  5. Interaction Models: A Scalable Approach to Human-AI Collaboration
  6. Thinking effort — Tinker Documentation
  7. thinkingmachines/Inkling — vLLM Recipes
  8. DeepSeek-V3 Technical Report
  9. Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
  10. Self-Attention with Relative Position Representations
  11. dMel: Speech Tokenization made Simple
  12. Three things everyone should know about Vision Transformers

相关笔记