El gráfico, aunque sólo se base MMLU, es consistente con las evaluaciones en el resto de benchmarks donde Llama 3.1 alcanza a Sonnet 3.5/GPT-4o, así que las conclusiones sí me parecen validas. Respecto al open source, efectivamente, estrictamente hablando, no lo es y encajaría
Llama 3.1 Performance Benchmarks Compared to Sonnet and GPT-4o
By
–