Beyond single-run metrics with CP-fuse: A rigorous multi-cohort evaluation of clinico-pathological fusion for improved survival prediction in TCGA

Juan Duran, Yujing Zou, Martin Vallières, Shirin Abbasinejad Enger · Machine Learning with Applications · 2025

Accurate prediction of progression-free survival (PFS) is critical for precision oncology. However, most existing multimodal survival studies rely on single fusion strategies, one-off cross-validation runs, and focus solely on discrimination metrics, leaving gaps in systematic evaluation and calibration. We evaluated multimodal fusion approaches combining histopathology whole-slide images (via Hierarchical Image Pyramid Transformer) and clinical variables (via Feature Tokenizer-Transformer) across five TCGA cohorts: bladder cancer (BLCA), uterine corpus endometrial carcinoma (UCEC), lung adenocarcinoma (LUAD), breast cancer (BRCA), and head and neck squamous cell carcinoma (HNSC) (N=2,984). Three intermediate (marginal, cross-attention, Variational Autoencoder or VAE) and two late fusion strategies (trainable-weight, meta-learning) were trained end-to-end with DeepSurv. Our 100-repetition 10-fold cross-validation (CV) framework mitigates the variance overlooked in single-run CV evaluations. VAE fusion achieved superior PFS prediction (Concordance-index) in BLCA (0.739±0.019), UCEC (0.770±0.021), LUAD (0.683±0.018), and BRCA (0.760±0.021), while meta-learning was best for HNSC (0.686±0.022). However, Integrated Brier Score values (0.066–0.142) revealed calibration variability. Our findings highlight the importance of multimodal fusion, combined discrimination and calibration metrics, and rigorous validation for clinically meaningful survival modelling. • VAE-based fusion outperforms unimodal models across most cancer types. • Both discrimination and calibration are vital for survival modeling. • Single cross-validation splits can lead to misleading performance claims. • We provide a public benchmark for multimodal survival analysis using clinical variables and biopsy whole slide images. • Our framework promotes reproducible and robust AI in medicine.

Read the paper · More papers on PaperTik