深度学习 · 点云 · 折腾记录

Java不加糖

记录深度学习、点云,
以及各种折腾。 偶尔写点数学。

21篇文章
4个分类
2022年至今
专栏 · 6 个章节 · 8 篇Kimi K3 模型结构

配合 Kimi K3 技术报告 §2 一起读的连载:按论文自己的叙事,沿序列、深度、宽度三个维度,把 KDA、Gated MLA、Attention Residuals、Stable LatentMoE 和视觉通路一个模块一个模块拆开。每篇都有一张「你现在在这里」的总图,和该模块自己的方块图。

专栏 · 4 个章节 · 0 篇大模型笔记

从模型结构到训练系统:新开源模型的架构拆解、并行策略、训练框架的软件工程,以及性能优化。按知识结构组织,不按时间。

最近文章

全部 21 篇

Kimi K3 模型结构(7):结构决定系统

连载收尾。前六篇的每个结构选择都逼着系统那边做了一件事:KDA 的三种内核和为什么它的上下文并行不能直接把状态加起来;Block AttnRes 的内存和通信处理;LatentMoE 的融合 GEMM 与 token 中心的解码内核;混合架构下 512-token 粒度的前缀缓存;投机解码时 KDA 状态怎么回滚。

11 min

Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

896 选 16 的 MoE 为什么要在一半宽度的 latent 空间里跑。先复述 NVIDIA LatentMoE 的论证链,再逐个拆 K3 加的三样东西:latent 上的 RMSNorm、SiTU-GLU 激活、Quantile Balancing 负载均衡,包括它从平衡指派问题推出来的过程。

11 min

Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

Kimi Delta Attention 的递推形式。先把记忆看成在线学习,从目标函数推出「加、擦、忘」三个动作,再沿两条路径走完线性注意力到 KDA 的谱系(RetNet、Mamba2、GLA、HGRN2、DeltaNet、GDN、RWKV-7 等),用三个合成任务看每一步买来了什么,把状态更新公式的每一项画出来,解释为什么转移矩阵的累乘就是位置编码,最后对上 K3 的真实维度和 K3 在输出门上的第一个改动。

20 min