이 연구는 지속적인 인간-모델 상호작용 수준에서 대화형 AI의 정렬을 연구하기 위한 개념적 및 방법론적 프레임워크를 소개합니다. 대부분의 정렬 연구가 훈련 중이거나 고립된 프롬프트를 통해 행동을 평가하는 반면, 본 논문은 행동 제약이 어떻게 지속되고, 변화하며, 회복되는지를 다룹니다. 우리는 행동 제약 프로파일 (BCP)을 상호작용 중 모델 행동을 안내하는 가치, 추론 규범, 어조 경계 및 협력 규칙의 명시적 사양으로 정의합니다. 이 개념을 바탕으로, 우리는 사용자가 모델과 함께 이러한 제약을 반복적으로 설정하고 강화하며 복원하는 상호작용 프로토콜인 공동 적응 정렬 시스템 (JAAS)을 제안합니다. 본 논문은 파일럿 연구 디자인을 개요하고 드리프트 빈도, 수정 지연, 제약 회상, 자기 수정 등 여러 세션 간 상호작용에서 측정 가능한 신호를 소개합니다. 경험적 결과를 제시하기보다는, 이 작업은 하류 검증을 위한 테스트 가능한 프레임워크를 형식화합니다. JAAS는 기존의 정렬 방법을 보완하는 접근 방식으로 자리매김하여 사용자, 맥락 및 과제 전반에 걸쳐 행동 안정성의 장기적 평가를 가능하게 합니다.
James Bridges (Fri,)는 이 질문을 연구했습니다.