AI Dynamics

Global AI News Aggregator

About

Risk-based Policy Optimization Improves LLM Reasoning Through Reward Risk-Taking

RL keeps evolving! Now you can teach LLMs to reason better by rewarding risk-taking. Risk-based Policy Optimization (RiskPO) is a new reinforcement learning framework for post-training LLMs. Instead of averaging rewards like GRPO, RiskPO uses a Mixed Value-at-Risk objective

→ View original post on X — @jiqizhixin