Key points are not available for this paper at this time.
이 기사에서는 학자들이 대량 디지털화된 텍스트를 새로운 판, 보조 판, 역사적 출처의 인쇄물로 구성된 집합체로 이해해야 하며, 이러한 다양한 부분은 지속적인 서지 분석 및 설명이 필요하다고 주장합니다. 주요 또는 보조 출처를 키워드 검색을 통해 발견하는 연구를 포함한 대규모 텍스트 아카이브에서 수행된 모든 연구를 적절히 이론화하기 위해, 페이지 이미지가 제공하는 대리성 신화를 피하고 대신 그 위에 겹쳐져 있는 텍스트 파일을 직접 고려해야 합니다. 이 기사는 대부분의 대규모 역사 텍스트 데이터가 유도되는 OCR(광학 문자 인식)에 초점을 맞추고, 이 "자동" 과정의 결과가 실제로는 출처 텍스트의 새로운 판으로서, 그들이 재현하는 역사적 텍스트와 더 최근의 재현 시대에 대한 독특한 통찰력을 제공한다고 주장합니다. 디지털 아카이브의 구성과 출처는 적어도 어느 정도는 알 수 있고 설명 가능합니다. 타이프, 잉크 또는 종이의 세부 사항이나 인쇄기 기록과 같은 패러텍스트가 인쇄된 책이 생성된 역사를 설정하는 데 도움이 되는 것처럼, 형식, 인터페이스 및 심지어 보조금 제안서의 세부 사항도 대량 디지털화 조건 하에서 생성된 코포라의 역사를 설정하는 데 도움이 될 수 있습니다.
라이언 코델(Ryan Cordell)(선(Sun),)은 이 문제를 연구했습니다.