Clinical AI systems increasingly integrate genomic data—exome/genome sequences, gene-expression profiles, polygenic risk scores—alongside conventional phenotypes to refine diagnosis and prognosis. Evaluating this multi-modal reasoning requires benchmark families that pair genomic findings with clinical narratives, test inference across inheritance models, and measure consistency of reasoning under uncertainty. This note outlines design principles for comprehensive genomics-informed AI benchmarks.
Tarek Ahmed Ibrahim Etman (Sun,) studied this question.