DiLA: Disentangled Latent Action World Models

TL;DR AI
2 min readKey summary
Researchers introduced DiLA, a self-supervised world model trained on unlabeled video.
DiLA disentangles content from structure to learn continuous, semantically organized latent actions.
This improves action abstraction without hurting generation quality, preserving high-fidelity video synthesis.
The approach could make video-based world models more useful for planning, simulation, and action transfer.
