AI Dynamics

Global AI News Aggregator

About

Sonnet 4.5 vs GPT-5: METR benchmark autonomous work hours

Sonnet 4.5 aparece en la gráfica de METR colocándose en la línea de tendencia pero sin superar al punto más alto, ocupado por GPT-5, en este benchmark que mide el equivalente de horas de trabajo humano que un LLM puede resolver de forma autónoma.

→ View original post on X — @dotcsv