NOTES

把散着的东西,一件件拆开重新装回去。

每篇笔记都从一个我答不上来的问题开始,做实验、画图、写清楚为止。不写综述,不抄结论。

VLA 主线

从注意力一路走到 π0.5,每站解决上一站留下的一个具体问题。

VLA 主线 / 01

注意力:为什么 CNN 和 RNN 不够用

搜到的说法是「CNN 感受野受限、RNN 梯度衰减」。我想直接跑个实验看看,到底是怎么不够用的。

attention · cnn · rnn · 梯度
还没写的 11 篇
  1. 02Transformer Block纯注意力会秩坍缩,FFN 和残差各自在挡哪一半。
  2. 03自回归与 GPT怎么从一个 block 变成会生成的模型。
  3. 04图像如何变成 tokenViT / CLIP / SigLIP 是三种答案。
  4. 05token 如何进入 LLMprojector 和 cross-attention 是两条独立的轴。
  5. 06模仿学习与动作表示问题本身长什么样:多模态、连续、有时序。
  6. 07扩散模型基础怎么把一个分布学下来,而不是学一个平均值。
  7. 08Diffusion Policy把扩散接到动作上,多模态才没被平均掉。
  8. 09Flow Matching同一个分布,把采样步数压下来。
  9. 10π0前面所有零件第一次拼到一起。
  10. 11RDT2另一条路线,同一个问题。
  11. 12π0.5泛化靠的是数据配方,不是结构。