AI Dynamics

Global AI News Aggregator

About

REST Benchmark Framework Evaluates Large Reasoning Models Robustness

5. Stress Testing Large Reasoning Models Proposes a new benchmark framework called REST to evaluate the robustness of Large Reasoning Models (LRMs) under multi-question stress.

→ View original post on X — @dair_ai