AI 快讯Inkling-Small以小博大
模型上新

Inkling-Small以小博大

2026-07-31T09:03:56.804Z
Inkling-Small以小博大

Thinking Machines Lab 开放 276B MoE 模型 Inkling-Small 完整权重,以约三成参数量逼近 975B 旗舰 Inkling,并在 HLE 测试中反超。

Inkling-Small 发布:276B MoE 用三成规模逼近旗舰

Thinking Machines Lab 于 7 月 30 日正式发布 Inkling-Small,并开放完整模型权重。根据其披露的数据,这款混合专家模型拥有 2760 亿总参数、120 亿激活参数,在参数规模显著小于旗舰 Inkling 的情况下,仍然在推理、智能体工具使用和指令遵循任务中取得接近乃至超过后者的成绩。

这次发布距离 Inkling 家族首次亮相并不久。北京时间 7 月 31 日,IT之家援引 Thinking Machines Lab 官方信息称,Inkling-Small 已从此前的预览状态转为完整权重可用,同时接入 Tinker 微调服务,并在 Tinker Playground 提供文本、图像和音频交互体验。

Inkling-Small 是一个采用混合专家架构的开放权重原生多模态模型。所谓混合专家模型,也就是将模型内部划分为多个功能不同的专家网络,每处理一个 Token 时只调用其中一部分,从而把模型的知识容量与单次推理计算量部分解耦。

它最值得关注的地方不是又多了一个 276B 模型,而是模型缩小以后,能力并没有按照参数量同比缩水。

Inkling-Small 与 Inkling 总参数、激活参数及 HLE 成绩对比图

名叫 Small,实际上仍是超大模型

Inkling-Small 的 Small 只是相对于 975B 的 Inkling 而言,并不意味着它可以轻松运行在普通消费级显卡上。它拥有 276B 总参数,每个 Token 激活其中约 12B;旗舰 Inkling 则拥有 975B 总参数,每个 Token 激活 41B。

从严格的数字关系看,Inkling-Small 并不完全等于旗舰的四分之一。其总参数相当于 Inkling 的 28.3%,激活参数相当于后者的 29.3%,更准确的说法应该是规模接近三成,或者大约缩小至四分之一到三分之一之间。

| 对比项目 | Inkling-Small | Inkling | Small 相对旗舰 | |---|---:|---:|---:| | 模型架构 | MoE | MoE | 相同路线 | | 总参数量 | 276B | 975B | 28.3% | | 单 Token 激活参数 | 12B | 41B | 29.3% | | 最大上下文窗口 | 1M Token | 1M Token | 相同 | | 原生输入模态 | 文本、图像、音频 | 文本、图像、音频 | 相同 | | 可变思考强度 | 支持 | 支持 | 相同 | | HLE 成绩 | 31.6% | 29.7% | 高 1.9 个百分点 | | 完整权重 | 已开放 | 已开放 | 均可定制 | | 官方推理价格 | 暂未披露 | 暂未披露 | 无法比较 |

Inkling-Small 的理论权重存储需求仍然远超单张显卡容量。仅按参数本身粗略计算,276B 权重使用 BF16 保存约需 552GB 显存,使用 FP8 约需 276GB,即使压缩至 4-bit 也仍需约 138GB;这些数字还没有计入 KV Cache、路由器、运行时缓冲区和多模态组件。

激活参数少并不等于模型可以只加载 12B 参数。MoE 在一次前向计算中只激活部分专家,因此计算量和延迟可能接近更小的稠密模型,但全部专家权重通常仍要驻留在显存、内存或高速存储中;12B 主要描述计算路径,而不是完整部署体积。

这意味着 Inkling-Small 降低的是集群规模和推理计算压力,而不是把 Inkling 变成一款桌面模型。它更适合拥有多卡服务器、工作站集群或托管推理资源的团队,而不是只有一两张消费级 GPU 的个人开发者。

276B 为什么能追上 975B

Inkling-Small 的成绩说明,模型能力并不只由总参数量决定。Thinking Machines Lab 将性能改善归因于更好的预训练数据和训练配方,而 Small 与旗舰模型共享同一套可扩展的后训练体系。

预训练数据决定模型在训练阶段看过什么,训练配方则决定这些数据以什么比例、顺序和优化目标进入模型。对于 MoE 来说,专家路由是否均衡、不同模态如何混合、难例在训练后期占多大比例,都会直接影响参数利用率;一个路由质量更高的 276B 模型,完全可能比一个参数更多但训练效率偏低的模型表现更好。

后训练体系则决定基础模型能否把已有知识转化为可用能力。指令遵循、工具调用、长链推理和可控思考强度通常都依赖监督微调、偏好优化与强化学习等后训练步骤,因此共享同一套成熟后训练栈,可以明显缩小 Small 与旗舰之间的差距。

这次结果也再次说明,MoE 的竞争已经从堆叠专家数量转向提高专家利用率。总参数更像知识仓库的容量,激活参数更像每次回答实际调动的人手;仓库大并不保证取货更快,人手多也不保证分工合理,真正重要的是路由器能否及时找到合适的专家。

不过,Thinking Machines Lab 暂未披露 Inkling-Small 的专家数量、每 Token 选取专家数、注意力结构和各精度下吞吐量。缺少这些参数意味着外界目前还无法准确估算它相对 Inkling 的真实延迟、显存通信压力与单位 Token 成本。

HLE 反超旗舰,但还不能只看一个分数

Inkling-Small 在 Humanity's Last Exam 上取得 31.6%,超过 Inkling 的 29.7%。Humanity's Last Exam 是一套面向前沿模型的高难度综合测试,覆盖数学、科学、人文等专业问题,主要用于区分已经在传统基准上趋近饱和的强模型。

31.6% 相比 29.7% 高出 1.9 个百分点,按相对增幅计算约为 6.4%。考虑到 Inkling-Small 的总参数和激活参数均不足旗舰的三成,这一结果至少证明 Small 并非简单蒸馏出的低配版本,而是一套经过重新优化的独立训练结果。

Thinking Machines Lab 还表示,Inkling-Small 在不同思考预算下的测试时计算曲线均高于 Inkling。测试时计算是指模型在回答阶段通过生成更多推理步骤、调用工具或进行验证来换取更高准确率;曲线更高意味着在消耗相同推理预算时,Small 能获得更好的任务成绩。

测试时计算效率可能比单个最高分更有商业价值。真实产品通常需要在准确率、延迟和成本之间设定上限,如果 Small 用较少激活参数就能在同一思考预算下超过旗舰,那么它在批量智能体、代码分析、研究助手和复杂文档处理中的单位任务成本更有机会下降。

但 HLE 的领先不能直接等价为所有能力全面超过 Inkling。1.9 个百分点是否具有统计稳定性,需要结合重复运行、提示模板、工具配置、采样参数和评测误差判断;目前公开资料也没有给出完整逐项分数,因此外界仍需等待独立评测验证。

官方还称 Inkling-Small 可以与相同权重级别的其他模型竞争,但没有在本次资料中给出完整竞品名单和统一价格数据。缺少同一推理框架、同一精度和同一硬件环境下的横向测试,使得这句话暂时更接近产品定位,而不是已经被充分证明的市场结论。

百万上下文和原生多模态没有缩水

Inkling-Small 保留了最高 100 万 Token 的上下文窗口。上下文窗口是模型单次请求中能够读取和处理的信息上限,100 万 Token 足以容纳多本书、一个中型代码仓库的大量文件,或者长时间会议与音频转录内容。

百万上下文的实际价值取决于有效检索能力,而不只是能否把内容塞进去。模型需要在几十万甚至上百万 Token 中准确定位早期细节、理解跨文档关系,并避免在长输入末端遗忘关键信息;目前资料没有公布 Needle-in-a-Haystack、长文档问答或代码仓库检索等专项结果。

百万上下文也会显著放大 KV Cache 和推理延迟。即使模型权重经过量化,超长输入仍可能占用大量显存,因此企业部署时更可能结合检索增强、上下文压缩和分段处理,而不是把 100 万 Token 当作每次请求的默认配置。

Inkling-Small 还保留了文本、图像和音频的原生推理能力。原生多模态模型是在统一训练过程中学习不同模态之间的对应关系,而不是先用外部识别工具把图片和音频转成文字,再交给语言模型处理。

原生多模态的优势主要出现在模态信息无法被完整转写的场景。比如分析图表中的空间关系、判断截图中的界面状态、识别语音中的停顿和语气,都会比单纯读取 OCR 或语音转写文本需要更多跨模态理解能力。

需要注意的是,Inkling 家族的预训练资料包含文本、图像、音频和视频,但当前公开交互能力主要强调文本、图像和音频输入。预训练使用视频数据不等于现阶段已经提供完整的视频输入产品能力,两者不应混为一谈。

可变思考强度比单纯拉长推理更实用

可变思考强度是允许用户或应用根据任务难度调节模型推理预算的机制。简单分类、摘要和信息抽取可以使用较低预算,数学证明、工具规划和复杂代码问题则可以分配更多计算时间。

这种机制的意义在于避免所有请求都以最高推理成本运行。一个客服系统每天可能处理数十万条简单问题,如果每条都触发长链推理,额外延迟和计算支出会迅速超过模型本身带来的收益。

Inkling-Small 的 12B 激活规模使可变思考更有吸引力。开发团队可以把低预算模式用于高并发任务,再把高预算模式留给少量困难请求;如果官方所称的测试时计算曲线能够被独立复现,它可能比固定使用 41B 激活参数的旗舰更容易控制成本。

真正影响开发者选择的仍是端到端数据。Thinking Machines Lab 目前没有披露首 Token 延迟、每秒输出 Token、不同思考档位的平均生成长度,以及 GB300 NVL72 上的并发吞吐量,因此暂时不能把参数缩小直接换算成明确的成本降幅。

在 GB300 NVL72 上训练,硬件门槛仍然很高

Inkling-Small 使用 NVIDIA GB300 NVL72 系统训练。GB300 NVL72 是面向超大模型训练和推理的机架级计算系统,通过高速互连把 72 颗 Blackwell Ultra GPU 组织成统一计算域,重点解决 MoE 模型中的专家并行与跨 GPU 通信问题。

这一训练平台表明 Small 的定位依然是数据中心级基础模型。它相比 975B 旗舰更容易部署,但更容易是相对概念:企业可能从超大规模集群缩减到较小的多节点或单机架配置,普通用户却仍然很难在本地完整加载原始精度权重。

MoE 的瓶颈也不只在矩阵计算。不同 Token 被路由到不同专家时,GPU 之间需要频繁交换数据,如果互连带宽不足,理论上只激活 12B 参数的优势可能被通信等待抵消;这也是 GB300 NVL72 这类高带宽系统对 MoE 尤其重要的原因。

社区后续最值得关注的是量化版本和分层加载方案。如果 4-bit 量化能够维持推理与多模态能力,Inkling-Small 的理论权重体积可降至约 138GB,配合多张大显存 GPU 或 CPU 内存卸载,才有可能进入更多实验室和开发团队的可部署范围。

开放权重不自动等于完全开源

Inkling-Small 已经提供完整权重,但开放权重与开源软件不是完全相同的概念。开放权重意味着用户可以下载、部署或进一步微调模型参数,而是否允许商业使用、再分发和修改,还要以具体许可证及可接受使用条款为准。

开发者在部署前仍需核对许可证,而不能只看到权重可下载就默认没有限制。尤其是准备将微调模型集成进商业产品、托管服务或行业解决方案的团队,需要确认衍生模型、输出内容和再分发行为是否处于许可范围内。

权重开放仍然是 Inkling-Small 相对闭源模型的重要优势。团队可以在自有环境中处理敏感数据,检查推理行为,为垂直领域继续训练,也可以根据硬件条件自行量化,而不必把所有业务逻辑绑定到单一在线服务。

Tinker 微调服务则降低了定制门槛。它让没有完整训练集群的团队也能围绕 Inkling-Small 进行后训练实验,而 Tinker Playground 提供的文本、图像和音频聊天入口,可以用于在正式部署前验证模型能力边界。

真正的看点是更高的参数效率

Inkling-Small 不是一款面向个人电脑的小模型,而是一款试图把旗舰级能力压缩到更可管理集群规模的模型。276B 总参数依旧庞大,但 12B 激活参数、百万上下文和原生多模态的组合,让它在大规模智能体与企业定制场景中具备明确吸引力。

这次发布最有价值的信号,是预训练数据、训练配方和后训练质量正在削弱单纯堆参数的收益。Inkling-Small 以 28.3% 的总参数,在 HLE 上从 29.7% 提升到 31.6%,说明模型公司仍然可以通过数据治理和训练方法获得比扩容更划算的性能提升。

Inkling-Small 目前还不能被直接判定为新的开放模型性价比之王。官方尚未给出标准化推理价格、吞吐量、延迟、量化损失以及完整第三方横评,这些数据决定它究竟只是榜单上高效,还是在真实部署中同样高效。

对开发者而言,现阶段最合理的态度是把它视为一个值得验证的高参数效率底座,而不是已经完成定论的旗舰替代品。等社区完成量化、部署测试和独立基准复现后,Inkling-Small 是否真正改变 200B 至 300B 级开放权重模型的竞争格局,才会有更清晰的答案。

参考来源

相关推荐

查看全部