开源
Thinking Machines 发布首个模型 Inkling-Small
Thinking Machines 发布 276B 总参 / 12B 激活的 MoE 模型 Inkling-Small,…
2026.07.31 · 周五约 2 分钟阅读
Thinking Machines 发布了其首个公开模型 Inkling-Small,采用 276B 总参数、12B 激活参数的 MoE 架构,并支持 100 万 token 的上下文窗口。该模型已上线官方博客,并同步提供 NVFP4 量化版与 GGUF 版本供社区下载使用。
模型规格
Inkling-Small 的核心参数如下:
- 架构:MoE,总参数 276B,每 token 激活约 12B 参数
- 上下文长度:1,000,000 token
- 训练方与许可证:官方博客暂未披露详细技术报告与许可证类型
12B 激活意味着推理时的计算开销接近一个中等规模的稠密模型,而 1M 上下文在当前开源权重模型中仍属于较长水平,适合长文档理解与多轮对话场景。
发布渠道与可用资源
模型已在以下渠道上线:
- 官方博客:thinkingmachines.ai/news/inkling-small
- NVFP4 权重:huggingface.co/thinkingmachines/Inkling-Small-NVFP4
- GGUF 权重:huggingface.co/unsloth/Inkling-Small-GGUF
NVFP4 量化版面向 NVIDIA 新一代硬件优化,社区知名量化团队 Unsloth 则完成了 GGUF 版本的转换,方便在 llama.cpp 等本地推理框架上直接运行。
社区关注点
作为 Thinking Machines 的首个公开发布的模型,Inkling-Small 在 r/LocalLLaMA 等社区引发讨论,开发者关注的焦点主要集中在三方面:
- 实际推理质量与现有开源 MoE(如 DeepSeek、Qwen3 系列)的对比
- 1M 上下文在长文本任务中的真实可用性
- 权重许可证条款及商业使用限制
待补信息
截至本次发布,官方暂未公开完整的 benchmark 数据、训练数据构成与许可证细则,性能与使用边界仍需以 Thinking Machines 后续发布的博客原文与模型卡为准。
