Esta semana escucharemos bastante sobre el SWE-bench ya que parece se convertirá en el nuevo benchmark para evaluar las capacidades de razonamiento y de resolución de tareas complejas de la próxima generación de modelos. Ya en Marzo os decía
SWE-bench: New Benchmark for Complex AI Reasoning Tasks
By
–
