초록 학습 기반 3D 시각 기하학 모델은 대규모 트랜스포머의 출현으로 크게 발전하였습니다. 이 중, StreamVGGT는 프레임별 인과 주의를 활용하여 안정적이고 효율적인 스트리밍 3D 복원을 제공합니다. 그러나, 다중 이미지 및 긴 비디오 입력에서 발생하는 방대한 양의 비전 토큰으로 인해 키-값(KV) 캐시의 무한정 성장에 시달리고 있으며, 이는 입력 프레임이 누적됨에 따라 메모리 소비 및 추론 대기 시간이 증가하는 문제를 초래합니다. 이러한 격차를 해소하기 위해, 우리는 KV 캐시를 체계적으로 압축하여 극도로 메모리 효율적인 스트리밍 추론을 가능하게 하는 조정 필요 없는 접근 방식인 XStreamVGGT를 제안합니다. 구체적으로, 다중 프레임 입력에서 생성된 중복 KVs는 고정된 KV 메모리 예산을 만족하기 위해 먼저 제거됩니다. 이 과정은 효율적인 토큰 중요성 식별 메커니즘을 사용하여 FlashAttention과 같은 고성능 주의 커널과의 완벽한 호환성을 보장합니다. 또한, 메모리 소비를 더욱 줄이기 위해 차원 적응형 KV 양자화가 가지치기 파이프라인에 통합됩니다. KV 텐서의 내재적 분포 패턴을 활용함으로써 이 방법은 수치적 정확성을 효과적으로 보존합니다. 광범위한 평가 결과, XStreamVGGT는 메모리 사용량을 4.42배 줄이면서도 성능 저하가 거의 없고, 추론 속도를 5.48배 가속하여 실용적이고 확장 가능한 스트리밍 3D 애플리케이션을 가능하게 합니다. 코드는 https://github.com/ywh187/XStreamVGGT/ 에서 확인할 수 있습니다.
Su et al. (Thu,)는 이 질문을 연구했습니다.