Key points are not available for this paper at this time.
인간 활동은 종종 특정 장면 맥락에서 발생합니다. 예를 들어, 농구 코트에서 농구를 하는 것입니다. 기존 비디오 데이터셋을 사용하여 모델을 훈련시키면 이러한 편향을 불가피하게 포착하고 활용하게 됩니다(실제 구별 신호를 사용하는 대신). 학습된 표현은 새로운 행동 클래스나 다른 작업에 잘 일반화되지 않을 수 있습니다. 본 논문에서는 비디오 표현 학습을 위한 장면 편향 완화 방법을 제안합니다. 구체적으로, 우리는 1) 장면 유형에 대한 적대적 손실과 2) 인간 행동자가 마스킹된 비디오에 대한 인간 마스크 혼돈 손실을 추가하여 행동 분류를 위한 표준 교차 엔트로피 손실을 보강합니다. 이 두 손실은 증거가 없을 때 장면 유형과 올바른 행동을 예측할 수 없는 표현을 학습하도록 유도합니다. 우리는 사전 훈련된 모델을 행동 분류, 시간적 위치 지정 및 시공간 행동 탐지를 포함한 세 가지 다른 작업으로 전이하여 방법의 효과성을 검증합니다. 우리의 결과는 디바이징 없이 기준 모델에 비해 일관된 개선을 보여줍니다.
최 외(수요일)는 이 질문을 연구했습니다.