Chat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning This paper explores the use of Reinforcement Fine-Tuning (RFT) with Group Relative Policy Optimization (GRPO) to enhance spatio-temporal perception in video multimodal large language models (MLLMs),
VideoChat-R1: Spatio-Temporal Perception via Reinforcement Fine-Tuning
By
–
