Aligning Multimodal LLM with Human Preference: A Survey
arXiv, Under Review
Tao Yu, Yi-Fan Zhang, Chaoyou Fu, Junkang Wu, Jinda Lu, Kun Wang, Xingyu Lu, Yunhang Shen, Guibin Zhang, Dingjie Song, Yibo Yan, Tianlong Xu, Qingsong Wen, Zhang Zhang, Yan Huang, Liang Wang, Tieniu Tan
TL;DR This survey reviews methods for aligning multimodal LLMs with human preferences across image, video, and audio tasks, organizing alignment algorithms, preference dataset construction, evaluation benchmarks, and future research directions.