AI Dynamics

Global AI News Aggregator

About

RL Verification Rewards vs SFT Synthetic Data Training

this isn't right. RL with verification-based-rewards is a different learning signal than generating synthetic data via language modeling and then using SFT, which is what you're describing

→ View original post on X — @jxmnop