2023年必装的Windows软件
平时学习、Coding、内容生产必备工具
配合 Kimi K3 技术报告 §2 一起读的连载:按论文自己的叙事,沿序列、深度、宽度三个维度,把 KDA、Gated MLA、Attention Residuals、Stable LatentMoE 和视觉通路一个模块一个模块拆开。每篇都有一张「你现在在这里」的总图,和该模块自己的方块图。
专栏 · 4 个章节 · 0 篇大模型笔记从模型结构到训练系统:新开源模型的架构拆解、并行策略、训练框架的软件工程,以及性能优化。按知识结构组织,不按时间。
平时学习、Coding、内容生产必备工具
连载收尾。前六篇的每个结构选择都逼着系统那边做了一件事:KDA 的三种内核和为什么它的上下文并行不能直接把状态加起来;Block AttnRes 的内存和通信处理;LatentMoE 的融合 GEMM 与 token 中心的解码内核;混合架构下 512-token 粒度的前缀缓存;投机解码时 KDA 状态怎么回滚。
主干之外的部分。从零训练的视觉编码器 MoonViT-V2 和它的投影层,一张 3584×3584 的图变成多少个 token;预训练的 MTP 层怎么被微调成 EAGLE-3 的 draft;Per-Head Muon 改了 Muon 的什么;以及词表、稠密层这些零碎的事实。
896 选 16 的 MoE 为什么要在一半宽度的 latent 空间里跑。先复述 NVIDIA LatentMoE 的论证链,再逐个拆 K3 加的三样东西:latent 上的 RMSNorm、SiTU-GLU 激活、Quantile Balancing 负载均衡,包括它从平衡指派问题推出来的过程。
每四层一层的全局注意力。MLA 的低秩 KV 压缩按 K3 的真实维度走一遍,解释为什么 K3 敢让所有 MLA 层完全不带位置编码,满秩输出门是什么,3:1 这个比例怎么选出来的,以及 1M 上下文时 KV cache 和 KDA 状态各占多少。
KDA 的 chunkwise 并行形式:WY 表示、UT 变换、块间递推加块内矩阵乘。然后是 K3 的改动:给每步的 log-decay 加一个 −5 的下界,让 16-token 对角 tile 也能用 Tensor Core 算。附一个可以拖的曲线对比。
Kimi Delta Attention 的递推形式。先把记忆看成在线学习,从目标函数推出「加、擦、忘」三个动作,再沿两条路径走完线性注意力到 KDA 的谱系(RetNet、Mamba2、GLA、HGRN2、DeltaNet、GDN、RWKV-7 等),用三个合成任务看每一步买来了什么,把状态更新公式的每一项画出来,解释为什么转移矩阵的累乘就是位置编码,最后对上 K3 的真实维度和 K3 在输出门上的第一个改动。