Key points are not available for this paper at this time.
본 보고서에서는 Ego4D 챌린지의 다섯 가지 트랙에 대한 우리의 챔피언 솔루션을 제시합니다. 우리는 다섯 가지 Ego4D 작업인 Moment Queries, 자연어 쿼리, 미래 손 예측, 상태 변화 객체 탐지 및 단기 객체 상호작용 예측을 위해 개발한 비디오 기초 모델인 InternVideo를 활용합니다. InternVideo-Ego4D는 간단한 헤드 설계를 통해 강력한 기초 모델을 다운스트림 에고 중심 비디오 이해 작업에 적응시키는 효과적인 패러다임입니다. 이 다섯 가지 작업에서 InternVideo-Ego4D의 성능은 기준 방법과 CVPR2022의 챔피언을 포괄적으로 초월하여 비디오 기초 모델로서의 InternVideo의 강력한 표현 능력을 보여줍니다. 우리의 코드는 https://github.com/OpenGVLab/ego4d-eccv2022-solutions 에서 공개될 예정입니다.
Guo et al. (목요일) 이 질문을 연구했습니다.