Aligning Multimodal LLM with Human Preference: A Survey

arXiv, Under Review

Tao Yu, Yi-Fan Zhang, Chaoyou Fu, Junkang Wu, Jinda Lu, Kun Wang, Xingyu Lu, Yunhang Shen, Guibin Zhang, Dingjie Song, Yibo Yan, Tianlong Xu, Qingsong Wen, Zhang Zhang, Yan Huang, Liang Wang, Tieniu Tan

TL;DR This survey reviews methods for aligning multimodal LLMs with human preferences across image, video, and audio tasks, organizing alignment algorithms, preference dataset construction, evaluation benchmarks, and future research directions.

← All publications