5. Stress Testing Large Reasoning Models Proposes a new benchmark framework called REST to evaluate the robustness of Large Reasoning Models (LRMs) under multi-question stress.
REST Benchmark Framework Evaluates Large Reasoning Models Robustness
By
–
