CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models CPGD introduces a novel reinforcement learning algorithm designed to stabilize policy updates for language models trained with rule-based rewards, addressing instability and training collapse issues found
CPGD: Stabilizing Rule-Based Reinforcement Learning for Language Models
By
–
