浅谈VLA中的Action Tokenizer
从标量离散化、轨迹压缩到学习式动作表征,梳理 VLA 中 Action Tokenizer 的三大技术路线,以及 RT-1、FAST、ActionCodec、OAT 各自的设计权衡。
Read moreNotes, updates, and writing collected in one place.
从标量离散化、轨迹压缩到学习式动作表征,梳理 VLA 中 Action Tokenizer 的三大技术路线,以及 RT-1、FAST、ActionCodec、OAT 各自的设计权衡。
Read more
从 AWR、IQL、RECAP 到 ViVa、ROVE、WCM,梳理 VLA-RL 中 Critic 的演进:value model 如何一步步变成 world critic,以及 Progress Model 与 Critic-Free RL 的路线之争。
Read more
从为什么要一次预测多个动作,到应该预测多长,再到到底执行多长,梳理 Action Chunking 在具身智能中的机制与设计取舍。
Read more
2024 年对抗性蒸馏的三条路线:ACT 用 JS 散度消去 CT 的误差累积,Hyper-SD 借轨迹分段蒸馏打通 ODE 保真与对抗重建,DMD2 以多时间尺度更新和 GAN 损失让分布匹配超越教师。
Read more
2024 年 DMD 与 Consistency Model 的关键改进:Score identity Distillation 用恒等式消去假 score 模型,ECT 让 CT 稳定可训,sCM 将一致性模型推向连续时间极限。
Read more
深入讲解 Consistency Model 的自洽性原理与两种训练范式(CD/CT),以及 DMD 如何从分布匹配视角绕开轨迹蒸馏的固有困难。
Read more
深入讲解 Progressive Distillation 的核心思想、v-prediction 参数化,以及为什么 2-to-1 蒸馏设计是保守但稳定的选择。
Read more
复习 Efficient Diffusion 相关基础知识,梳理 Diffusion 为什么需要多步采样,以及传统采样加速方法的核心思想与局限。
Read more
复习 Diffusion-RL 相关基础知识,整理 PPO 与 GRPO 的核心思想、公式和训练流程。
Read more
整理 Diffusion RL 中概率计算困难的来源,以及当前主流方法如何通过逐步转移建模来绕开这一问题。
Read moreNo posts match your search.