Learning to Reason under Off-Policy Guidance This paper presents LUFFY (Learning to reason Under oFF-policY guidance), a framework that improves zero-shot reinforcement learning (zero-RL) by incorporating off-policy reasoning traces alongside on-policy exploration, enabling
LUFFY: Off-Policy Reasoning for Zero-Shot Reinforcement Learning
By
–
