桃子桃子快讯
返回首页
行业动态

Fireworks AI 估值跃至 175 亿美元,「Token 工厂」赛道持续升温

AI 推理平台 Fireworks AI 完成 15 亿美元 D 轮融资,估值达 175 亿美元;ARR 破 10 亿美…

2026.07.22 · 周三6 分钟阅读

AI 推理云平台 Fireworks AI 近日完成 15.05 亿美元(约合 102 亿元人民币)D 轮融资,投后估值 175 亿美元。本轮由 Atreides Management、Index Ventures 和 TCV 领投,英伟达跟投,红杉、基准资本、Lightspeed、Bessemer、Menlo 等老股东继续加码。从 2024 年 B 轮 5.52 亿美元估值,到 2025 年 10 月 C 轮 40 亿美元,再到此轮 175 亿美元,不到两年估值涨了约 30 多倍。

公司创始人兼 CEO 林倩(Lin Qiao)毕业于复旦大学计算机科学专业,后赴美国加州大学圣塔芭芭拉分校取得计算机博士。她 2015 年加入 Meta,在七年时间里从高级经理一路做到工程高级总监,期间共同创立并主导了 PyTorch,将 Meta 的 AI 工作负载从数据加载、分布式推理到全球数据中心训练全部重建一遍。2022 年 10 月,也就是 ChatGPT 发布前一个月,她从 Meta 出走,在加州红木城创办 Fireworks AI。

业务核心:把开源模型变成企业专用智能

Fireworks AI 不自训前沿大模型,也不做面向消费者的 AI 应用,而是提供一套推理云平台:开发者可通过兼容 OpenAI 的 API 调用平台上 200 多个开源模型,覆盖文本、图像与多模态;企业可在自有数据上做 SFT、DPO、RFT 等微调,并能同时挂载最多 100 个 LoRA 适配器而不额外收费。合规层面已取得 SOC 2、HIPAA、GDPR 等认证,并于 2026 年 3 月接入微软 Foundry,使得 Azure 客户可直接调用其推理服务。

工程能力是其差异化关键。公司自研了一套名为 Fire Attention 的 CUDA 内核栈,在 DeepSeek V4 Pro 上可实现每秒 167 个 token 的生成速度,官方称达到同价位对手的 5 倍;结合解耦服务、语义缓存与推测解码,长尾延迟得到明显压缩。

商业层面,无服务器推理起步价大约为每百万 token 0.2 美元(8B 级别模型)至 0.9 美元(70B 级别),另有按小时出租 GPU 的选项。客户名单包括 Cursor、Notion、Quora、Sourcegraph、Uber、Shopify、Perplexity 等。其营收结构也在发生变化:早期约一半收入来自 Cursor,如今已分散到更广泛的企业客户群体。

财务与运营数据

  • ARR 突破 10 亿美元,为上一年同期的 5 倍;
  • 平台每日处理 token 从 15 万亿增长至 40 万亿以上;
  • 平台上超过 95% 的 token 来自客户在自有数据上定制过的模型,而非现成通用模型;
  • 据 CNBC,同等质量下 Fireworks 比闭源模型便宜 5 到 10 倍。

本轮融资的主要用途是扩大算力采购与工程团队规模。Fireworks 目前从 20 多家供应商采购 GPU(微软是其中之一),并计划将工程团队从约 200 人扩至年底 600 人,同时深化与微软、英伟达的合作。

中美「Token 工厂」同步升温

「Token 工厂」指的是将底层算力、开源大模型与推理引擎打包为标准化 API 的中间层服务商,按调用量收费。美国一侧除 Fireworks 外,还有多家公司处于高速增长中:

  • Together AI:2025 年 7 月完成 8 亿美元 C 轮,估值 83 亿美元,由沙特阿美旗下 Aramco Ventures 领投,年预订额据称已破 11.5 亿美元;
  • Baseten:2025 年 6 月完成 15 亿美元 F 轮,估值 130 亿美元,18 个月内连融四轮,收入同比增长约 20 倍,英伟达同样是其股东;
  • 其他玩家还包括 Anyscale、Lepton(贾扬清创立)、Modal、Replicate、Groq、Cerebras 等。

中国一侧的叙事侧重点有所不同。由于国产芯片生态碎片化,本土厂商普遍押注异构架构,强调跨芯片、多模型适配能力。代表性公司包括:

  • 硅基流动:清华系背景,已向港交所递表,估值约 77.4 亿元人民币,阿里巴巴持股 7.42%、华为哈勃持股 4.07%;累计支持 170 多个主流模型,是业内首家走通国产昇腾芯片部署满血版 DeepSeek 的公司;
  • 无问芯穹:由清华电子工程系教授汪玉发起,近期获超 7 亿元融资,Agentic MaaS 平台上线 160 多种模型,日均 token 调用量较 2025 年底增长超 20 倍;
  • 九章云极:清华系背景,刚发布「Token 工厂」战略与 Alaya NeW 智算云体系,目标平台日均 Token 流转承载力达 10 万亿。

推理层的价值重估与不确定性

今年随着 Kimi K3 等模型开源、DeepSeek V4 满血版即将推出,基础模型层的估值与壁垒受到冲击,资本开始重新评估 AI 技术栈中推理层的价值。投资逻辑的转变在于:训练是一次性投入,而推理是持续消耗——产品越受欢迎、调用越频繁,成本压力越大。「能不能把每次调用的成本压下来」成为企业的生死线,而这正是「Token 工厂」们所解决的问题。

但这条赛道并非没有风险。算力采购价、GPU 利用率与客户压价都会啃食毛利率;如果未来竞争加剧、价格战升级,推理层可能滑向「高收入、低利润」的转售生意;如果训练强度下降,云厂商与大模型公司也可能向推理层延伸、独立推理层会被两头夹击。正如文章所追问的:当云计算最终收敛为 AWS、微软、谷歌三家时,推理层会不会也走上同样的收敛之路?独立推理层究竟是「AI 时代的台积电」,还是只是又一家租车行,最终取决于它能否把「跑模型」变成客户离不开的、带垄断性的效率。

信源