El uso de RL para entrenar a los razonadores actuales encontraba el problema de que para problemas muuuuy complejos que requieren mucho tiempo para resolverlos y verificar que estaban correctos (y darle feedback a la IA de que lo ha hecho bien o mal para mejorar su
Reinforcement Learning Challenges Training Complex AI Reasoners
By
–
