PulseExploreJournal ClubDebatesTrendingResearchersJournals
Instagram
HomeExploreJournal ClubTrending
Synapse
⌘+K
Synapse
June 10, 202525 citations

Navigation World Models

View Full Paper
ABAmir BarGZGaoyue ZhouNew York UniversityDTDanny TranThe University of Texas at Austin

Key Points

  • This study aims to develop a Navigation World Model (NWM) that predicts visual observations for navigation tasks.
  • Developed a Conditional Diffusion Transformer (CDiT) model trained on diverse egocentric video data.
  • Scaled the model to 1 billion parameters to enhance its predictive capabilities.
  • Evaluated trajectory planning both from scratch and using an external policy for ranking trajectories.
  • NWM effectively plans navigation trajectories in familiar environments, achieving desired goals.
  • The model incorporates dynamic constraints into planning, enhancing adaptability.
  • NWM can imagine trajectories in unfamiliar environments from a single input image.

Abstract

Navigation is a fundamental skill of agents with visual-motor capabilities. We introduce a Navigation World Model (NWM), a controllable video generation model that predicts future visual observations based on past observations and navigation actions. To capture complex environment dynamics, NWM employs a Conditional Diffusion Transformer (CDiT), trained on a diverse collection of egocentric videos of both human and robotic agents, and scaled up to 1 billion parameters. In familiar environments, NWM can plan navigation trajectories by simulating them and evaluating whether they achieve the desired goal. Unlike supervised navigation policies with fixed behavior, NWM can dynamically incorporate constraints during planning. Experiments demonstrate its effectiveness in planning trajectories from scratch or by ranking trajectories sampled from an external policy. Furthermore, NWM leverages its learned visual priors to imagine trajectories in unfamiliar environments from a single input image, making it a flexible and powerful tool for next-generation navigation systems1.

Ask AI
Helpful
Bookmark
Share
View Full Paper

Cite This Study

Bar et al. (2025) studied this question.

synapsesocial.com/papers/6a0eda9425c30b2cc7f9d728https://doi.org/10.1109/cvpr52734.2025.01472
Ask AI
Helpful
Bookmark
Share
View Full Paper

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation2025
  2. 2DreamerNav: learning-based autonomous navigation in dynamic indoor environments using world models2025 · 2 citations
  3. 3ImagineNav++: Prompting Vision-Language Models as Embodied Navigator Through Scene Imagination2026 · 1 citations
  4. 4MemoNav: Working Memory Model for Visual Navigation2024
  5. 5Visual navigation via spatio-temporal adaptive attention and meta-variational policy algorithm2025 · 2 citations