AI Dynamics

Global AI News Aggregator

About

DGPO: Stable Soft-Clipping via Bilateral Decoupled Probability Gradient Decay

"From log π to π: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight" This paper argues that RLVR should optimize probability gradients, not log-probability gradients. So they proposed, DGPO, which applies decoupled decay at the clipping boundaries to preserve exploration while preventing gradient divergence. This results in a more stable soft-clipping objective that consistently outperforms GRPO and prior variants on mathematical reasoning benchmarks.

→ View original post on X — @askalphaxiv, 2026-04-04 02:27 UTC