대규모 시각-언어 모델(LVLMs)은 최근 체화된 추론과 로봇 제어를 결합하여 로봇 공학을 발전시키는 데 큰 가능성을 보여주고 있습니다. 일반적인 접근 방식은 감독 세부 조정(SFT)을 사용하여 로봇 제어와 관련된 체화된 추론 작업에 대해 훈련하는 것입니다. 하지만 SFT 데이터 세트는 종종 휴리스틱하게 구성되고 로봇 제어 개선을 위해 명시적으로 최적화되어 있지 않습니다. 더욱이, SFT는 재앙적 망각과 일반화 성능 저하와 같은 문제를 초래하는 경우가 많습니다. 이러한 한계를 해결하기 위해, 우리는 로봇 제어를 위해 특히 체화된 추론을 강화하기 위해 강화 학습을 활용하는 새로운 프레임워크인 로봇-R1을 소개합니다. 로봇-R1은 현재 장면 이미지와 전문가 시연에서 유도된 환경 메타데이터를 조건으로 해서 작업 완료를 위해 필요한 다음 키포인트 상태를 예측하는 방법을 학습합니다. DeepSeek-R1 학습 접근 방식에 영감을 받아, 로봇-R1은 추론 기반 응답을 샘플링하고 더 정확한 예측으로 이어지는 응답을 강화합니다. 우리의 실험 결과, 로봇-R1로 훈련된 모델이 체화된 추론 작업에서 SFT 방법보다 더 우수한 성능을 나타냅니다. 7B 매개변수만 보유하고 있음에도 불구하고, 로봇-R1은 공간적이고 원시적인 움직임 추론 등 저수준의 행동 제어와 관련된 추론 작업에서 GPT-4o를 능가합니다.
김 외. (2025) 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: