贾扬清二度创业做 Intent Lab:用一句话让 AI 自主产出生产级系统
贾扬清离开英伟达创立 Intent Lab,核心产品 Fleet 演示三项系统级成果,标志 AI Infra 从「管算力…
贾扬清正式宣布离开英伟达,联合 Junjie Bai、Xiang L.、Casber Wang 等开源领域资深工程师,创办新公司 Intent Lab(意图实验室)。这一次他不再聚焦 GPU 云或算力调度,而是瞄准一个更上层的问题:当模型越来越会写代码,AI 离自主开发生产级软件还差什么?
公司同步亮出了基于核心产品 Fleet 的三个系统级成果:把 GLM-5.2 推理引擎在 Grace Blackwell 节点上的输出速度提升 6.3 倍;用一句话生成的数据库引擎跑通了 600 万条 SQLite 兼容性测试;以及一个附带形式化验证、能捕获普通 coding agent 数据损坏 bug 的分布式文件系统 AgentFS。
Fleet 不是更快补全,而是自主工程团队
Intent Lab 的核心产品 Fleet 被定位为「全球第一个把意图变成生产级软件的自主团队」。它不是更快的代码补全,也不是 IDE 插件,而是一组面向生产系统的智能体,目标是从一句粗糙的人类意图出发,端到端完成设计、实现、验证,并在生产环境中持续演进。
这与今天常见的 coding agent 有本质差别。大多数 agent 解决的是「代码生成」——用户说一句话,AI 写一段函数、改一个 bug、补一组测试;但真实软件工程远不止于此,需要先理解需求、拆分目标、设计架构、确定接口、权衡性能与成本,再进入编码、测试、评审、验证和上线,上线后还要根据真实负载继续修正和演进。Fleet 想把这整条链路交给 AI。
三个标杆案例:推理引擎、数据库与文件系统
首批展示的三个成果共同指向一个主题:让 AI 构建对性能、可靠性、兼容性、正确性要求极高的系统软件,而非简单的应用层 demo。
GLM-5.2 推理引擎:起点是一句高层意图——在英伟达 TensorRT-LLM 已有体系上继续榨性能,让 GLM-5.2 在 Grace Blackwell 节点上跑得更快。Fleet 自己识别优化空间、自己实现、自己验证,最终交付四类优化:
- 内核层:通过 kernel fusion,并直接生成 PTX 与 SASS,绕过普通编译器路径,拿指令级控制权
- 运行时:通过 H2D batching,减少稳定 decode 阶段 CPU 到 GPU 的元数据拷贝
- 通信:把 residual add 与 RMSNorm 折进融合后的 all-reduce,减少每层 kernel launch 与内存往返
- 投机解码:配合更好的 drafter,让模型一次提出多个 token 再由大模型批量验证
最终输出速度从 102 tokens/s 提升至 647 tokens/s,提升 6.3 倍。
数据库引擎:用户输入一句模糊需求,Fleet 自动构建并最终跑通 600 万条 SQLite 兼容性测试,覆盖复杂语句、异常输入、并发状态与历史兼容等场景。
AgentFS 分布式文件系统:专为云端 AI Agent 高频、小文件、强并发的工作负载设计。基础目录与文件操作相比 Amazon EFS 提速数十倍到数百倍,部分指标超过 600 倍;Git 操作提速 2.5 到 14 倍。同时,Fleet 对核心协议做了约 190 万个状态的形式化验证,配合 300 个集成测试、故障注入与模糊测试,并在过程中发现并修复了一个 coding agent 在分布式创建和删除文件时导致数据损坏的 bug。
AI Infra 的命题正在重写
把贾扬清的经历连起来看,主线始终是「降低别人用上算力和系统的门槛」:Caffe 让深度学习走出实验室,PyTorch 让模型成为生产基础设施,LeptonAI 让 GPU 集群更好用。到了 Intent Lab,他试图让「造一个生产级系统」这件事本身,从手艺活变成自动化的东西。
这背后是 AI Infra 的价值重估。过去最值钱的是「资源与封装」——帮人管理算力、降低使用门槛。但在 Cursor、Claude Code、Codex 等 Agentic Coding 工具崛起后,一部分封装复杂性的价值正在被 AI 自己吃掉。AI Infra 的竞争正从「帮人管理基础设施」转向「让 AI 成为基础设施的建造者」。
贾扬清的判断很直白:「我们把整个职业生涯花在了世界上最大的分布式系统和 AI 基础设施上,但现在更感兴趣的,是一次能产出一千个系统的系统。」如果这个方向跑通,未来的软件形态可能会更碎片化、更专用——因为软件本质上就是把意图变成机器可执行的规则,而 Infra 层正在试图解构这层翻译。
