2023年必装的Windows软件
平时学习、Coding、内容生产必备工具
配合 DeepSeek-V4 技术报告 §2 一起读的连载:沿序列、深度、宽度三个维度,把压缩稀疏注意力(CSA)、重压缩注意力(HCA)、流形约束的 Hyper-Connections(mHC)、改过打分函数和路由的 DeepSeekMoE,以及 Muon 优化器一个模块一个模块拆开。每篇都有一张「你现在在这里」的总图,和该模块自己的方块图。
专栏 · 6 个章节 · 11 篇Kimi K3 模型结构配合 Kimi K3 技术报告 §2 一起读的连载:按论文自己的叙事,沿序列、深度、宽度三个维度,把 KDA、Gated MLA、Attention Residuals、Stable LatentMoE 和视觉通路一个模块一个模块拆开。每篇都有一张「你现在在这里」的总图,和该模块自己的方块图。
专栏 · 4 个章节 · 5 篇大模型笔记从模型结构到训练系统:新开源模型的架构拆解、并行策略、训练框架的软件工程,以及性能优化。按知识结构组织,不按时间。
平时学习、Coding、内容生产必备工具
长上下文服务里一次前缀缓存 miss 比 hit 贵几个数量级,所以整条路径都围着缓存转:块哈希的前缀缓存怎么复用,KV 在 GPU、DRAM、SSD 之间按 write-through 还是 write-back 搬,集群层面怎么让请求跟着缓存走、又不被长请求的突发拖垮。
「性能优化」章的开篇。训练时一张卡的显存分五类:权重、梯度、优化器状态、激活、通信缓冲。前三类由参数量和并行度决定,激活由 micro-batch 长度和流水线在途份数决定。每种省显存的技巧都是把账本某一行搬走并付一种货币:FLOPs、精度、PCIe、网络。
数据并行是唯一不减少每卡显存的并行,ZeRO 用分片把它补上。从每个参数 16 字节的账开始,推 ZeRO-1、2、3 各自的每卡显存和通信量,再讲梯度分片放到 CPU 之后 GPU 上为什么只需要两个缓冲。
把模型按层切成 P 段之后,micro-batch 怎么排才能让每段都有活干。从 GPipe 到 1F1B 到 interleaved 1F1B 到 Zero Bubble,每一步只改一件事。推气泡占比 (P−1)/m、每个 rank 在途激活 P−r 份、虚拟段的显存代价,配一个可以拖的时间线。
「并行」章的开篇。一次训练里能下刀的位置只有六个:batch、序列、权重矩阵的行列、层、expert,以及注意力内部的序列。每种切法一节,回答同一组问题:切什么、为什么能切、前向和反向各发生什么通信、通信量多大、每卡的计算和显存少了多少。最后看 Megatron、DeepSpeed、PyTorch DTensor / FSDP / torchtitan、JAX GSPMD 怎么用各自的方式表达同一套切法,以及它们怎么在一个 device mesh 上叠起来。
系统篇收尾。1M 上下文的 RL 和线上服务里,瓶颈从算力变成「状态放哪」:KV 块和 KDA 状态在 GPU 与 DRAM 池之间的 write-back,训练态让位到 NVMe,参考模型权重借梯度缓冲的槽位流进 GPU,沙箱的 pause / fork / snapshot,以及集群级的缓存亲和与预算准入。三篇里第三次出现双槽位模式。