"Group Sequence Policy Optimization" Qwen introduces Group Sequence Policy Optimization (GSPO), a RL algorithm for LLMs that uses sequence-level importance weighting and clipping instead of token-level methods, which provides high performing training for MoE models.
Qwen Introduces Group Sequence Policy Optimization for LLMs
By
–
