桃子桃子快讯
返回首页
工具

法国 11 人小团队 Kog,想用软件把 GPU 推理再榨一遍

法国初创 Kog 通过深度底层优化,在 AMD MI300X 与 NVIDIA H200 上对小型模型跑到 3000 T…

2026.08.14 · 周五4 分钟阅读

法国初创公司 Kog 正在押注一条与 Cerebras 等自研芯片公司截然不同的路线:通过深度软件优化,把企业已经在用的标准数据中心 GPU 的推理性能再榨一层。其核心产品 KIE(Kog Inference Engine)声称可以让 30B 以下 LLM 推理速度提升 30 倍——但截至目前,这一承诺只在小型模型上得到验证。

技术预览登顶 Hacker News,拿到 200 条商业线索

今年 5 月,Kog 在 Hacker News 首页发布了一次技术预览,重点演示在 AMD MI300X 与 NVIDIA H200 上「单请求极速解码」的可行性。CEO Gaël Delalleau 告诉 TechCrunch,发布后公司收到了 200 条有实质意向的商业线索。

  • 目标客户:被延迟劝退的 AI 工作流重度用户,尤其是需要长时间等待结果的资深 Claude Code 用户。
  • 商业模式参照系:Anthropic 对 Claude Fast Mode 收取更高溢价,证明速度本身就有商业价值。
  • 设计合作伙伴:能让用户通过一句话生成游戏和应用的公司——更快的推理直接对应更多收入。

Demo 数据亮眼,但离 LLM 还差一步

Kog 的演示跑出了一个令人印象深刻的数字:单请求 3000 tokens/秒。但需要注意的是,该演示使用的并不是大模型,而是其开源的 2B 参数小模型 Laneformer 2B。

Delalleau 表示,团队从早期反馈中学到一件事:潜在客户「并不准备去微调小模型」,所以公司从发布起就全力转向加速大模型。他预计首批「大模型 10x 加速」成果将在 9 月落地,届时可以开始展示客户牵引力,并据此推进 A 轮融资。

创始人背景:物理 + 白帽黑客的组合

Delalleau 并不是传统意义上的研究者。他在法国综合理工学院学过固态物理,后来转向进攻性网络安全(白帽黑客),并四次入围 DEF CON CTF 决赛。他把这两段经历总结为 Kog 的方法论:

  • 物理思维:用理解物理定律的方式去理解 GPU 的「定律」,榨干硬件潜力。
  • 黑客思维:在汇编与二进制层面逆向工程硬件,让它完成「原本并不打算完成的事」。

这种深度路线的代价是高度人力密集:每加入一款新 GPU,团队需要花数周乃至数月进行底层 GPU 工程研究。Kog 目前只有 11 人,这直接限制了其短期内能覆盖的芯片型号数量。

竞品与生态位

Kog 不是唯一一家相信「软件可以让 GPU 做更多事」的团队:

  • 同样来自法国的 ZML:发布跨硬件推理软件,绕过 NVIDIA 的 CUDA,可在多种竞品芯片上跑高速推理。
  • 斯坦福 Hazy Research:学术实验室,在 GPU 加速上有更底层的研究。

Delalleau 认为 Kog 更接近 Hazy Research 的路线,只是聚焦更窄、更工程化。

欧洲主权叙事与下一步

Kog 已获得 Scaleway 的支持,背后有法国国家投资银行 Bpifrance 以及 French Tech 2030 计划的背书,种子轮由 Varsity VC 联合领投。长远看,公司希望把方法论输入到 agent 流水线里,以覆盖更多芯片与模型——这恰好契合欧洲构建自有 AI 算力与模型能力的方向。

但眼下最关键的一步仍然很清楚:把承诺中的 10x 大模型加速做出来,并拿到可重复的客户数据。在那之前,30x 的标语还只是写在网页上的数字。

信源