Skip to yearly menu bar Skip to main content


Poster Thu, Apr 23, 2026 • 3:15 PM – 5:45 PM -03

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

YiFan Zhang ⋅ Xingyu Lu ⋅ Xiao Hu ⋅ Chaoyou Fu ⋅ Bin Wen ⋅ Tianke Zhang ⋅ Changyi Liu ⋅ Kaiyu Jiang ⋅ Kaibing Chen ⋅ Kaiyu Tang ⋅ Haojie Ding ⋅ Jiankang Chen ⋅ Fan Yang ⋅ Zhang Zhang ⋅ Tingting Gao ⋅ Di ZHANG ⋅ Guorui Zhou ⋅ Liang Wang

Abstract

Video

Chat is not available.