Key points are not available for this paper at this time.
정보 검색 시스템은 사용자가 정보 요구를 충족하는 데 도움을 주는 것을 목표로 합니다. 우리는 시스템을 사용하는 사람의 목표와 그 목표를 달성하기 위해 보여주는 행동 패턴이 정보 검색 시스템의 효과성을 평가하는 데 사용되는 방법 및 기법에 통합되어야 한다고 주장합니다. 이렇게 함으로써 결과적으로 얻어진 효과성 점수가 사용자 검색 경험에 유의미하게 해석될 수 있습니다. 특히 우리는 검색 작업 복잡성의 역할을 조사하고, 이것이 정보 요구에 대한 응답으로 사용자가 추구하는 관련 답변 문서의 수에 직접적인 영향을 미친다는 것을 보여주며, 유용한 효과성 지표는 목표에 민감해야 한다고 제안합니다. 우리는 또한 결과 목록을 스캔하는 동안 사용자 행동이 그들의 목표가 실현되는 속도에 영향을 받으며, 따라서 적절한 효과성 지표는 랭킹 내의 관련 문서의 존재 여부에 적응해야 한다고 제안합니다. 이러한 두 가지 관찰에 대한 응답으로, 우리는 원하는 두 가지 속성을 갖춘 새로운 효과성 지표인 INST를 제시합니다: INST는 사용자의 검색 목표를 직접적으로 측정하는 매개변수 T를 사용하여 평가 점수의 최상위 가중치를 조정합니다; 더욱이 목표 T를 향해 진행함에 따라 모델링된 사용자 행동이 남은 기대를 반영하도록 조정됩니다. INST는 평균 정밀도(AP), 정규화 할인 누적 이득(NDCG), 랭크 편향 정밀도(RBP)와 같은 이전 효율성 지표와 실험적으로 비교하여 INST의 유용성을 입증합니다. RBP와 마찬가지로 INST는 가중치 정밀도 지표로, 각 점수는 판단되지 않은 문서에서 발생한 점수 불확실성의 정도를 정량화하는 잔여값을 동반할 수 있습니다. 우리의 실험의 일환으로, 우리는 크라우드 소싱된 데이터와 점수 잔여값을 사용하여 매우 특정한 정보 요구에도 불구하고 다양한 쿼리가 발생하며, 이러한 변이 쿼리가 일반적인 실험 평가에 상당한 수준의 잔여 불확실성을 도입한다는 것을 입증합니다. 이러한 변동 원인은 실험 설계 및 테스트 컬렉션 구축에 광범위한 영향을 미칩니다.
Moffat et al. (Mon,)가 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: