Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
AI 摘要
该论文提出了一种利用视觉指令调整的视觉-语言框架,通过理解医学图像来提高生存预测的准确性。
主要贡献
- 提出了基于视觉指令调整的3D CT图像理解框架
- 利用大规模CT图像和放射报告进行预训练,学习临床有意义的视觉-文本表示
- 通过整合生存预测头,提高了生存预测性能,尤其是在临床数据较弱的情况下
方法论
使用视觉指令调整对3D CT图像进行预训练,然后通过生存预测头进行微调,以提高生存预测性能。
原文摘要
Accurate prognostication and risk estimation are essential for guiding clinical decision-making and optimizing patient management. While radiologist-assessed features from CT scans provide valuable indicators of disease severity and outcomes, interpreting such images requires expert knowledge, and translating rich visual information into textual summaries inevitably leads to information loss. In this work, we propose a vision-language framework for 3D CT image understanding that leverages large-scale open-sourced CT images paired with radiology reports through visual instruction tuning. This pre-training enables the model to learn clinically meaningful visual-textual representations, which can then be adapted to downstream survival prediction tasks. By incorporating a survival prediction head on top of the pre-trained model, our approach improves survival prediction from CT images and clinical data while generating clinically meaningful language responses to predefined questions. Experimental results demonstrate that our method outperforms baseline methods in survival prediction, particularly, when clinical data alone is less predictive. The code will be released upon acceptance.