Literature review categorizes trustworthiness failure modes and benchmarks in medical multimodal large language models, indicating critical pathways for safe clinical integration.
Key Points
To address the critical trustworthiness gap between experimental capabilities and real-world clinical requirements in medical multimodal large language models.
Surveyed existing literature analyzing methodologies, evaluation strategies, and benchmarks for trustworthiness across the full lifecycle of medical multimodal models.
Categorized existing systems across a multi-scale clinical hierarchy spanning microscopic tissue analysis, organ-level imaging, patient modeling, and population health surveillance.
Established a six-dimensional trustworthiness taxonomy covering truthfulness, robustness, fairness, safety, privacy, and explainability.
Identified recurring model failure modes across clinical domains and synthesized targeted remediation strategies.
Assessed evaluation bottlenecks in automated metrics and LLM-as-a-Judge protocols, advocating for dynamic, workflow-oriented clinical evaluations.