Cursor 联手 Together AI:在 NVIDIA Blackwell 上构建低延迟编码推理
Cursor 与 Together AI 在 NVIDIA Blackwell 平台合作优化推理栈,实现编辑器内实时 A…
AI 编程平台 Cursor 与 AI 原生云服务商 Together AI 合作,在 NVIDIA Blackwell 架构(GB200 NVL72 / HGX B200)上部署生产级实时推理服务,将新模型权重从训练完成到上线可测试的周期压缩到数天级别。该合作聚焦于解决编辑器内 AI 智能体对最坏延迟的硬性要求,尤其在并发场景下必须保持响应的可预测性。
为什么编辑器内的延迟要求不同
Cursor 的智能体在开发者持续编辑代码的过程中生成输出:调试问题、生成功能、执行重构。模型生成结果时使用的代码上下文与开发者最终看到的上下文必须对齐——一旦开发者跳转至代码其他区域,输出与它原本要支持的代码状态就会错位。这意味着服务端不能再按传统批处理思路设计,而必须保证实时、低延迟,并且在并发请求下保持一致性与稳定性。
在 NVIDIA Blackwell 上的工程优化
Together AI 与 Cursor 早期介入了 NVIDIA Blackwell 的部署与调优,主要涉及四个层面的工作:
- 前沿硬件的早期交付:Together AI 在新硬件生命周期早期即与 NVIDIA 协作,把 GB200 NVL72 快速交付给 Cursor,并通过快速升级与替换保障可靠性。
- ARM 主机的全栈调优:GB200 NVL72 搭配 NVIDIA Grace CPU(ARM 指令集),但多数高性能推理生态默认跑在 x86 上。团队将推理栈移植到 ARM,并在内核与主机层进行了针对性调优。
- Blackwell Tensor Core 的自定义内核:Blackwell 引入面向低精度格式优化的新 Tensor Core 指令,Together AI 直接围绕这些指令构建自定义内核,捕获更多硬件吞吐量。
- NVL72 域内高效并行:GB200 NVL72 以全互联拓扑连接 72 颗 GPU,跨芯片分配模型会带来通信与同步开销。Together AI 为该拓扑设计了并行网格,把协调成本控制在可接受范围内,确保计算收益传递到推理端。
缩短从权重到生产的链路
Cursor 内部研究团队结合专有数据与编码场景的定向优化训练模型,并产出候选权重。Together AI 为此搭建了一条可重复的路径:候选权重产出后,通过基于 NVIDIA TensorRT-LLM 与 NVFP4 的量化流水线进行压缩与校验,在数天内启动一个生产级测试端点。Cursor 随后运行内部评估套件,并在生产流量下进行 A/B 测试,最终切换由验证与实时流量校验把关。
量化的关键挑战在于压缩比与质量的平衡:编码场景下,输出质量下降可能表现为隐蔽的逻辑错误或语法错误,因此必须在降低延迟与成本的同时保住 Cursor 编码模型的质量基线。
下一步:从延迟到吞吐
目前 Cursor 的生产部署已运行在多个数据中心的 NVIDIA Blackwell GPU 上,GB200 NVL72 负责推理,基础设施支持研究团队持续迭代新权重。延迟目标达成后,双方的重点转向吞吐与利用率——在 Blackwell 平台上构建更高吞吐的端点,以随使用量增长改善单 GPU 经济性。
