桃子桃子快讯
返回首页
开源

Thinking Machines 发布首个模型 Inkling-Small

Thinking Machines 发布 276B 总参 / 12B 激活的 MoE 模型 Inkling-Small,…

2026.07.31 · 周五2 分钟阅读

Thinking Machines 发布了其首个公开模型 Inkling-Small,采用 276B 总参数、12B 激活参数的 MoE 架构,并支持 100 万 token 的上下文窗口。该模型已上线官方博客,并同步提供 NVFP4 量化版与 GGUF 版本供社区下载使用。

模型规格

Inkling-Small 的核心参数如下:

  • 架构:MoE,总参数 276B,每 token 激活约 12B 参数
  • 上下文长度:1,000,000 token
  • 训练方与许可证:官方博客暂未披露详细技术报告与许可证类型

12B 激活意味着推理时的计算开销接近一个中等规模的稠密模型,而 1M 上下文在当前开源权重模型中仍属于较长水平,适合长文档理解与多轮对话场景。

发布渠道与可用资源

模型已在以下渠道上线:

  • 官方博客:thinkingmachines.ai/news/inkling-small
  • NVFP4 权重:huggingface.co/thinkingmachines/Inkling-Small-NVFP4
  • GGUF 权重:huggingface.co/unsloth/Inkling-Small-GGUF

NVFP4 量化版面向 NVIDIA 新一代硬件优化,社区知名量化团队 Unsloth 则完成了 GGUF 版本的转换,方便在 llama.cpp 等本地推理框架上直接运行。

社区关注点

作为 Thinking Machines 的首个公开发布的模型,Inkling-Small 在 r/LocalLLaMA 等社区引发讨论,开发者关注的焦点主要集中在三方面:

  • 实际推理质量与现有开源 MoE(如 DeepSeek、Qwen3 系列)的对比
  • 1M 上下文在长文本任务中的真实可用性
  • 权重许可证条款及商业使用限制

待补信息

截至本次发布,官方暂未公开完整的 benchmark 数据、训练数据构成与许可证细则,性能与使用边界仍需以 Thinking Machines 后续发布的博客原文与模型卡为准。

信源