Key points are not available for this paper at this time.
비디오에서 객체 상태의 존재를 시간적으로 지역화하는 것은 행동과 객체를 넘어 인간 활동을 이해하는 데 중요합니다. 이 작업은 객체 상태의 고유한 모호성과 다양성으로 인해 훈련 데이터가 부족하여 어려움을 겪고 있습니다. 소모적인 주석 작업을 피하기 위해, 교육 비디오에서 필기된 내레이션으로부터 학습하는 것이 흥미로울 것입니다. 그러나 내레이션에서는 행동에 비해 객체 상태가 적게 설명되어 있어 효과성이 떨어집니다. 본 연구에서는 대규모 언어 모델(LLMs)을 사용하여 내레이션에 포함된 행동 정보에서 객체 상태 정보를 추출할 것을 제안합니다. 우리의 관찰 결과 LLMs는 행동과 그에 따른 객체 상태 간의 관계에 대한 세계 지식을 포함하고 있으며, 과거 행동 시퀀스에서 객체 상태의 존재를 추론할 수 있습니다. 제안된 LLM 기반 프레임워크는 임의의 범주에 대해 그럴듯한 가상 객체 상태 레이블을 생성하는 유연성을 제공합니다. 우리는 60개 객체 상태 범주의 밀집한 시간 주석이 포함된 새로 수집한 다중 객체 상태 전환(MOST) 데이터셋을 통해 우리의 방법을 평가합니다. 생성된 가상 레이블로 훈련된 우리의 모델은 강력한 제로샷 비전-언어 모델 대비 29% 이상의 mAP 개선을 보여주어, LLM을 통해 행동에서 객체 상태 정보를 명시적으로 추출하는 효과성을 입증합니다.
Tateno 외(Thu,)는 이 질문을 연구했습니다.