Both Text and Images Leaked! A Systematic Analysis of Multimodal LLM Data Contamination

EMNLP Findings 2025, ICML 2025 DIG-BUG Workshop Oral

Dingjie Song*, Sicheng Lai*, Mingxuan Wang, Shunian Chen, Lichao Sun, Benyou Wang

* denotes equal contribution.

TL;DR MM-Detect distinguishes unimodal and cross-modal benchmark contamination, showing that inflated multimodal evaluation scores can stem from unimodal pretraining as well as later multimodal training stages.

← All publications