PulseTrendingJournal ClubResearchersJournalsExplore
Instagram
HomeTrendingJournal ClubExplore
Synapse
⌘+K
Synapse
September 24, 2025Open Access

Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos

View Full Paper
Ask AI
Bookmark
Share

Authors

MCMert CokelekHOHalit OzsoyNİNevrez İmamoğlu

Discussion

Loading...

Member takes

Overview

Observational analysis reveals significant improvements in saliency prediction using audio-visual cues in 360-degree videos, suggesting integration of spatial audio is key.

Key Points

  • SalViT360 and SalViT360-AV significantly enhance saliency prediction in 360-degree videos, improving viewer attention understanding.
  • The YT360-EyeTracking dataset of 81 omnidirectional videos was curated to explore saliency prediction in unique audio-visual conditions.
  • Applying spherical geometry-aware attention layers helps effectively capture the complexities in predicting viewer focus in 360-degree environments.
  • Integrating spatial audio cues in the model architecture is crucial for optimal saliency prediction in omnidirectional videos.

Cite This Study

Cokelek et al. (2025) studied this question.

synapsesocial.com/papers/68d6d82e8b2b6861e4c3e272https://doi.org/10.48550/arxiv.2508.20221
View Full Paper
Ask AI
Bookmark
Share