Adding 3D depth supervision to video world models improves both geometric consistency and visual quality, enabling more reliable 3D reasoning for robot manipulation without requiring architectural changes to pretrained video models.
This paper presents DepthWorld, a 3D world model for robot manipulation that predicts both RGB video and metric depth.