Long-horizon planning improves most when agents learn explicit world models during pre-training, and multi-teacher distillation works better than single-teacher methods for integrating diverse planning strategies across tasks.
This paper systematically studies how AI agents learn long-horizon planning through three stages: pre-training (what data helps), post-training (GRPO vs OPD methods), and multi-teacher integration (MOPD).