Sonnet 4.5 aparece en la gráfica de METR colocándose en la línea de tendencia pero sin superar al punto más alto, ocupado por GPT-5, en este benchmark que mide el equivalente de horas de trabajo humano que un LLM puede resolver de forma autónoma.
Sonnet 4.5 vs GPT-5: METR benchmark autonomous work hours
By
–
