Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
ICML, 2026
VLA-MBPO integrates a series of pratical techniques to train VLAs in world models, including (i) adapting unified multimodal models (UMMs) for data-efficient world modeling; (ii) an interleaved view decoding mechanism to enforce multi-view consistency; and (iii) chunk-level branched rollout to mitigate error compounding.