图书前言

前言

一、 为什么要写本书

随着人工智能特别是深度学习技术的广泛应用,AI 系统的复杂性正在不断提高。以往,模型训练往往是开发者关注的核心,但如今,如何将模型高效、稳定、安全地部署到不同平台上,如何在多种硬件环境中调度资源、优化性能,已成为深度学习工程中的关键课题。

深度学习的系统运行涉及从框架前端到中间表示、从编译器到运行时、从驱动固件到底层硬件架构的多层协同。过去相关

图书往往偏重某一层: 要么聚焦算法和模型训练,忽略系统实现; 要么介绍某一类工具的用法,缺乏系统观和底层机制解释。这种割裂使得许多读者在学习与实践中面临“模型能训练,系统难落地”的困境。

本书旨在打破这一割裂,构建一条完整的深度学习系统技术路径。作者从最常见的深度学习框架出发,逐步深入编译优化、运行时调度、底层驱动、异构硬件与性能分析,力图让读者建立起一套贯穿“从模型到硬件”的系统化理解。

二、 内容特色

1. 全栈贯通,体系完整

本书围绕深度学习系统的五大核心层次: 框架前端→中间表示与编译器→算法库→运行时系统与驱动→硬件平台,搭建出一条完整的技术路径,帮助读者理解深度学习模型在不同系统层之间的流动与执行机制。

2. 聚焦实践,注重工程性

作者长期从事AI平台系统研发与优化,书中大量内容来自实际工程项目积累与总结。全书注重理论与实践结合,配有典型系统架构图、模块流程图和性能优化方法,可直接指导读者在开发中应用。

3. 覆盖主流,紧跟发展

书中涵盖PyTorch、TensorFlow、开放式神经网络交换(Open Neural Network Exchange,ONNX)、张量虚拟机(Tensor Virtual Machine,TVM)、底层虚拟机(Low Level Virtual Machine,LLVM)、cuDNN、ROCm 等主流工具链与技术平台,并介绍通用图形处理器(GeneralPurpose Graphics Processing Unit,GPGPU)、

神经网络处理单元(Neural Processing Unit,NPU)、

张量处理单元(Tensor Processing Unit,TPU)架构

及它们的

对比,以及存算一体、光子计算等新兴硬件方向,帮助读者构建面向未来的系统视野。

4. 图文并茂,结构清晰

本书采用模块化分章结构,配合清晰的思维导图与插图说明,使复杂概念更易理解。每章均设有总结,便于读者自查与复习。

三、 读者对象

 有志于构建深度学习系统与平台的工程技术人员; 

 从事模型部署、性能调优、AI编译器与加速器开发的专业读者; 

 人工智能、计算机体系结构等相关专业的高年级本科生与研究生; 

 对AI系统底层机制感兴趣的开发者与科研人员。

四、 数字资源

 教学课件、思维导图等资源: 扫描下方“教学资源”二维码下载,或者到清华大学出版社官方网站本书页面下载。

 微课视频(126分钟,42集): 扫描书中相应章节的二维码在线学习。

教学资源

注: 请先扫描封底刮刮卡中的文泉云盘防盗码进行绑定后再获取配套资源。

五、 致谢

感谢长期以来与我共事的项目团队成员,是你们的讨论、设计与工程实践不断推动我从模型走向系统,积累了这本书的内容基础。感谢深度学习开源社区的所有贡献者,正是你们推动了技术的开放与共享,使我有机会基于最前沿的框架与工具进行系统性的整理与总结。特别感谢我的导师与合作单位在学术与工程上的持续支持,感谢你们为我提供了思考系统架构深度与广度的土壤。感谢家人在我编写过程中给予的理解与陪伴,是你们的鼓励让我有足够的耐心与动力坚持写作。

限于作者的水平和经验,疏漏之处在所难免,敬请读者批评指正。

最后,衷心感谢每一位读者,你们的关注与支持,是我不断前行的动力源泉。希望这本书能为你们深入理解深度学习软硬件系统提供帮助,并能够为你们在技术创新与实际应用中提供实用的知识与指导。

胡群超2026年5月