9. SWE-EVO SWE-EVO introduces a benchmark for evaluating coding agents on long-horizon software evolution tasks that require multi-step modifications spanning an average of 21 files per task.
SWE-EVO Benchmark for Long-Horizon Software Evolution Tasks
By
–
