工具
免费电子书《Inference Engineering》上线,系统梳理 AI 推理全栈技术
一本面向 AI 推理工程师的免费电子书,覆盖硬件、软件、关键优化技术与多模态模型推理全流程。
2026.08.20 · 周四约 3 分钟阅读
一本名为《Inference Engineering》的免费电子书正式发布,旨在为从业者提供 AI 推理(inference)全链路的技术地图。该书从 runtime、基础设施与工具链三个层面,系统梳理了大模型及多模态模型从训练后到生产部署所涉及的关键技术与工程方法。
全书结构概览
全书共七章加两个附录,按从前期准备到落地生产的顺序编排:
- 第 1 章 Prerequisites:讨论模型上线前的产品与工程准备,包括用例定义、延迟与成本预算、以及模型选型与评估方法。
- 第 2 章 Models:介绍 AI 模型的技术架构,从大语言模型到图像、视频生成模型,并重点分析推理瓶颈与注意力机制的优化方向。
- 第 3 章 Hardware:从现代 GPU 规格表出发,拆解算力与显存的关键参数,详细澄清 NVIDIA 数据中心级产品的架构与 SKU 差异,并简要概览其他加速器。
- 第 4 章 Software:从 CUDA 抽象出发,逐层介绍 PyTorch、Transformers、Diffusers 等框架以及 vLLM、SGLang、TensorRT-LLM 等推理引擎,并引入 NVIDIA 最新的大规模分布式推理服务系统 Dynamo。
- 第 5 章 Techniques:讨论量化、推测解码(speculative decoding)、KV cache 复用、模型并行与 disaggregation 等核心性能优化技术,结合生产实践进行分析。
- 第 6 章 Modalities:将推理工程拓展到语音与视觉领域,覆盖视觉语言模型、嵌入模型、ASR 与语音合成模型,以及图像/视频生成模型的独立架构与优化方法。
- 第 7 章 Production:收尾讨论推理服务运营中的实际问题,包括基础设施运维与高性能应用构建。
附录 A 提供推理工程术语表,附录 B 汇总推荐阅读资源。
技术覆盖面与适用人群
从目录可见,本书并非聚焦单一工具的入门教程,而是一本覆盖 "硬件 + 软件 + 算法 + 部署" 的系统性参考资料:对希望深入理解 LLM 推理优化、研究 KV cache 与 speculative decoding 等技术的工程师,以及需要搭建生产级推理服务的团队,具备较高参考价值。书中涉及的多款主流推理引擎(vLLM、SGLang、TensorRT-LLM)与 NVIDIA Dynamo 等均为当前业界关注的热点组件,相关章节可作为读者进入该领域的索引。
获取方式
该书以免费形式发布,感兴趣的读者可通过原帖链接访问完整内容。
