桃子桃子快讯
返回首页
行业动态

Etched估值飙至103亿美元,推理专用芯片挑战英伟达

AI推理ASIC芯片公司Etched获3亿美元C轮融资,估值升至103亿美元,其Transformer专用芯片声称性能达…

2026.07.29 · 周三5 分钟阅读

Etched,这家专为 Transformer 架构打造 AI 推理芯片的硅谷创业公司,在 2026 年 7 月完成由红杉资本领投、a16z 与 Jane Street 等参投的 3 亿美元 C 轮融资后,估值迅速攀升至 103 亿美元。叠加此前的 A 轮与 B 轮融资,Etched 累计融资额已超过 9 亿美元,背后站着 Peter Thiel、Andrej Karpathy、李飞飞等知名个人投资者,以及 Stripe、TSMC、SK Hynix 等机构股东。支撑这一估值的关键并非愿景,而是已经落地的商业进展:Etched 已在 TSMC 完成 A0 芯片流片,并构建了前沿推理集群,斩获超过 10 亿美元的客户合同。

为什么 AI 推理值得专用芯片

随着生成式 AI 渗透到真实工作流,推理负载正以远超训练的速度膨胀。Google 披露的数据显示,其产品与 API 每月处理的 token 数量从 2024 年 5 月的 9.7 万亿,飙升至 2026 年 5 月的 3.2 千万亿,两年增长超过 300 倍。NVIDIA 数据中心季度收入也从 2023 年初的 36.2 亿美元增长至 2026 年初的 623 亿美元。

推理负载的快速稳定化,为专用硬件打开了窗口。Etched 团队判断,当某类计算负载规模呈指数级增长、计算特征趋于稳定时,围绕其量身打造专用芯片和整套系统的商业逻辑便水到渠成——正如 GPU 之于图形渲染,网络芯片之于互联网传输。Transformer 正是当下满足这一条件的核心负载形态。

Etched 的技术路线

Etched 的核心产品 Sohu 是一颗只服务 Transformer 推理的 ASIC 芯片。据公司公布的数据,搭载 8 颗 Sohu 的服务器在运行 Llama 70B 时,可达到每秒 50 万 token 的推理速度,是同样数量 H100 服务器的 20 倍。围绕这一目标,公司做了两项关键架构创新:

  • 低电压推理(LVI):芯片计算单元运行电压不到主流 AI 芯片的一半,根据登纳德缩放定律,动态功耗大致与电压平方成正比,从而使 FLOPs 密度提升数倍。在推理万亿参数稀疏 MoE 模型时,可维持 80% 以上峰值 FLOPs 而不触发降频。
  • 集群级内存(CSM):在纵向扩展域内构建低延迟共享内存池,结合 HBM/SRAM 混合设计,解决了解码阶段对内存带宽的瓶颈,同时规避纯 SRAM、3D DRAM 与光互连在成本、良率与散热上的权衡。

LVI 的运行需要从晶体管到 token 每个层级的协同设计,包括可拆分计算阵列、供电网络、VRM 架构、先进封装与冷板设计。Etched 的团队覆盖了这些环节:前 Cypress Semiconductor CTO Mark Ross 担任公司 CTO,参与过 NVIDIA V100/A100/H100 架构的 Saptadeep Pal 负责 ASIC 设计,从零搭建 Google TPU v1 至 v5 软件团队的 David Munday 负责软件栈。

商业化进展与行业意义

Etched 首批机架产品将于今夏发货,并已全面启动量产以履行超 10 亿美元的客户合同。早期客户测试反馈显示,Etched 系统在吞吐量、延迟与能效上均达到当前最优(SOTA)水平,其主要投资人在尽调中收到客户评价称,这是首个能真正在规模化应用中颠覆推理单位经济模型的系统。

这一进展意味着,绕开 NVIDIA GPU 与 CUDA 生态、围绕特定模型架构构建专用推理基础设施,正从技术设想走向规模化商业验证。如果 Etched 能在产能、客户与软件生态上持续兑现承诺,AI 推理市场的硬件格局将出现实质性松动。

中国市场的窗口与变量

推理基础设施从通用走向专用,在中国同样形成强劲需求。一方面,DeepSeek 的 FlashMLA、DeepGEMM、DeepEP 与 TileLang,以及 Kimi 开源的 Mooncake,已将软件层面的推理优化推向全球前沿;另一方面,海外高端芯片供应的不确定性,使得基于开源 EDA 工具与成熟制程的 ASIC 路线更具吸引力。Kimi K3 曾在 48 小时内基于开源 EDA 工具与 45nm 工艺库,自主完成了一款面向 Nano 模型的专用芯片设计与仿真验证。

云端推理芯片对先进制程的要求相对宽松,创业公司可以避开与通用 GPU 在制程与规模上的正面竞争。设计门槛、制造条件与推理需求的变化,正在共同打开一个新的创业窗口——而真正能够抓住它的,将是那些既看得到模型演进方向、又能以极快工程节奏让硬件迭代跟上的少数团队。

信源