学习路线图与进阶方向
本教程共 60 篇 · 第 60 篇 · 更新于 2026-08-17 · 约 3 分钟阅读
本节目标:回顾全书主线,找到适合自己的进阶方向,知道接下来该学什么、怎么学。
回头看看走过的路
60 章读下来,回头看其实只有四条线。
第一条线:地基(§01–§18)。从安装环境开始,张量是带维度的表格(§04),autograd 自动算梯度(§06),nn.Module 是搭模型的积木(§09),DataLoader 管数据(§11),损失函数和优化器让模型学会更新(§13、§14)。到 §16 的完整训练循环,你已经能训练任何小模型了。
第二条线:模型(§19–§33)。MLP、CNN、RNN、Transformer 四大件(§19–§23),经典模型演进(§24),然后是「把模型练好」的工程能力:保存加载(§25)、迁移学习(§26)、正则化(§27)、归一化(§28)、初始化(§29)。§30–§33 是可视化、Profiler 和调试,以后排查问题全靠它们。
第三条线:领域(§34–§48)。CV 从分类到检测、分割、生成(§34–§40),NLP 从词嵌入到 seq2seq、聊天机器人(§41–§44),语音入门(§45)。然后是编译加速三连:torch.compile、Inductor、FX(§46–§48),一行代码白拿加速。
第四条线:生产(§49–§59)。模型要落地:导出(§50、§51)、推理加速(§52)、量化(§53)、混合精度(§54)、剪枝(§55)。模型要变大:DDP(§56)、FSDP(§57)、DeviceMesh 与张量并行(§58)、性能调优(§59)。
Tip时间紧的话,最小闭环是:§04 → §06 → §09 → §11 → §16 → §19 → §25。这七章能让你跑通一个完整训练任务,其余章节按需回头查。
学完这本书,你能做什么
先给自己打个分。读完 60 章,你应该已经具备这些能力:
- 能搭 MLP、CNN、RNN、Transformer,并完成训练、评估、保存加载(§19–§25);
- 能处理图像、文本、语音三类数据(§34–§45);
- 能用 torch.compile 给模型加速,用 Profiler 和 benchmark 定位瓶颈(§46、§59);
- 能把模型导出成 ONNX 或 ExecuTorch 部署(§50–§52);
- 能让模型在多卡上训练,从 DDP 一路到 FSDP 和 TP(§56–§58)。
如果哪一项还心虚,翻回对应章节补一补。能力清单比读书进度更能说明问题。
下一步:四条进阶路线
基础打完了,接下来按兴趣选方向。每条路线都给出具体的下一步。
路线 A:计算机视觉。你已经会分类、检测、分割。往下走:精读 TorchVision 模型源码(§34 的延续),学 Diffusion 图像生成,或试视频理解。动手复现一个 YOLO 或 Stable Diffusion 的简化版,比看十篇教程有用。
路线 B:NLP 与大语言模型(LLM)。这是当下最热的方向。从 transformers 库开始,用预训练模型做微调(§26 的迁移学习就是它的理论基础),再学 LoRA、QLoRA 这类参数高效微调,之后了解 RAG(检索增强生成)和 Agent。中文开源模型(Qwen、ChatGLM 等)社区资料多,适合上手。
路线 C:推理部署。把模型变成服务:走通 ONNX(§51)和 TensorRT(§52)的完整链路,用 ExecuTorch 部署到手机和边缘设备,配合量化(§53)压体积。这条路工程性强,适合喜欢落地的同学。
路线 D:大规模训练。继续分布式方向:用 TorchTitan 跑一个真实的 3D 并行训练(§58 的组合实战),研究序列并行、上下文并行,再看 torchcomms 这类新通信后端。
Note路线不用一次选死。很多人是 A、B 都摸一摸,最后被项目推着走。关键是别停在「看懂了」,要「跑通了」。
生态工具值得认识
PyTorch 周边有一圈成熟的工具,用到时再学,先混个脸熟:
- HuggingFace Transformers:预训练模型的集散地,LLM 路线必备;
- TorchRL:强化学习,§40 的 GAN 之后想玩智能体可以看它;
- TorchRec:推荐系统,嵌入表分片(§57 的分片思想在推荐场景的应用);
- Ray:分布式调度,超参搜索(Ray Tune)和模型服务(Ray Serve);
- Ax:超参与架构搜索,自动找最优配置;
- TorchTitan:Meta 开源的 3D 并行训练框架,大规模训练的活教材。
跟住 PyTorch 2.13 的脚步
写作时(2026-08)最新稳定版是 PyTorch 2.13.0。几个新特性值得留意:
- FlexAttention:灵活的注意力机制,支持自定义注意力变体,还登上了 Apple Silicon;
- CuTeDSL:新的 DSL 后端,用原生 DSL 写 GPU 内核;
- torchcomms:新的通信后端,优化大规模训练的网络通信;
- FSDP2:通信重叠进一步优化(§57 的主角);
- ExecuTorch:并入核心,边缘部署一体化;
- nn.LinearCrossEntropyLoss:把线性层和交叉熵损失融合,省显存又提速。
框架半年一个大版本,API 会变,但 §06 的 autograd、§09 的 nn.Module 这些核心概念不会变。学概念,别背 API,这是跟上版本更新的唯一办法。
几个最后的小建议
多读官方文档。PyTorch 官方教程更新很勤,版本差异都写在里面。遇到弃用警告(比如 TorchScript,§46 提过),按提示换新 API 就行。版本发布和最佳实践可以关注 pytorch.org 的官方博客。
做一个小项目。Kaggle 或天池的入门赛是检验学习成果的好方式。数据、模型、训练、评估、部署全走一遍,才算是真的学会了。项目不在大,完整最重要。
写自己的笔记。踩过的坑、想通的点,记下来。三个月后回头翻,你会发现成长比想象中快。
保持好奇,动手验证。看十遍 loss.backward() 不如自己画一遍计算图。本系列的所有示例代码,都值得亲手敲一遍。
保持节奏。深度学习内容多,别贪快。每周固定几小时,一章一章消化,代码跑通再往下走。断断续续没关系,坚持比速度重要。如果你还是学生,珍惜有大块时间的阶段;如果在职,利用好通勤和周末。环境不重要,持续写代码才重要。
60 章到这里就结束了。从第一行 import torch 到大模型的分布式训练,你已经走完了绝大多数人没走完的路。接下来,去解决一个真实的问题——那才是最好的老师。