NOTES
笔记
图谱
关于
把散着的东西,一件件拆开重新装回去。
每篇笔记都从一个我答不上来的问题开始,做实验、画图、写清楚为止。不写综述,不抄结论。
注意力:为什么 CNN 和 RNN 不够用
搜到的说法是「CNN 感受野受限、RNN 梯度衰减」。我想直接跑个实验看看,到底是怎么不够用的。
attention · cnn · rnn · 梯度
还没写的 11 篇
Transformer Block
纯注意力会秩坍缩,FFN 和残差各自在挡哪一半。
自回归与 GPT
怎么从一个 block 变成会生成的模型。
图像如何变成 token
ViT / CLIP / SigLIP 是三种答案。
token 如何进入 LLM
projector 和 cross-attention 是两条独立的轴。
模仿学习与动作表示
问题本身长什么样:多模态、连续、有时序。
扩散模型基础
怎么把一个分布学下来,而不是学一个平均值。
Diffusion Policy
把扩散接到动作上,多模态才没被平均掉。
Flow Matching
同一个分布,把采样步数压下来。
π0
前面所有零件第一次拼到一起。
RDT2
另一条路线,同一个问题。
π0.5
泛化靠的是数据配方,不是结构。