¡NUEVO VÍDEO en el LAB! La noticia de la semana, el nuevo rey de la pista, Grok 4 presentado hace sólo unas horas nos ha sorprendido a todos! Si queréis saber toda la información relacionada con este lanzamiento no te pierdas el vídeo. Link a continuación 🙂
@dotcsv
-
AI Intelligence Costs Decrease While Computational Demands Rise
By
–
De hecho lo es. El costo de la inteligencia a la que accedíamos a determinado precio hace un año es (mucho) más barata ahora. Lo que no impide que los modelos también puedan volverse mucho más potentes con usos más intensivos de computación, y por tanto más caros 🙂
-
Grok 4 evaluation results on ARC-AGI benchmark
By
–
Info chula sobre la evaluación de Grok 4 en ARC-AGI
-
Humanity’s Next-to-last Exam: Creating Non-Saturated AI Benchmarks
By
–
Ok, y si por si acaso le llamamos Humanity's Next-to-last Exam y vamos preparando otro benchmark que no quede saturado en los próximos meses?
-

Grok Launches Natural-Sounding Spanish Voices, Outperforms ChatGPT
By
–
También han presentado nuevas voces para Grok que la verdad suenan muy muy naturales! Ganas de escucharlo hablar en español. Además han ido a hacer daño comparando con ChatGPT en directo 🙂
-

o3 vs Grok 4 benchmark comparison guide
By
–
Más benchmarks. Recordatorio que para hacer la comparación justa tenéis que comparar: o3 -> Grok 4
o3 pro (no aparece) -> Grok 4 Heavy -

Grok 4 Heavy Achieves 44.4% on HLE Benchmark
By
–
Esta sería la photo finish en el benchmark de HLE con todas las preguntas (text-only y multimodales) donde Grok 4 Heavy alcanza un sorprendente 44.4% Por comparar manzanas con manzanas, el salto entre Gemini 2.5 Pro (SOTA previo) y Grok 4 es de +11% y es una locura!
-

Powerful AI Demos Missing Accessibility and Public Understanding
By
–
Aquí la parte que mejor ilustra el "problema" actual de las IAs tan potentes que recibimos: demostrar lo inteligentes que es la IA con problemas que la mayoría de mortales ni entendemos. En muchos casos ni los propios presentadores entienden
-

Grok 4 Heavy multiagent system achieves 50.7% on HLE
By
–
Ojo que ejecutado en paralelo dedicando más computación se meriendan la mitad de preguntas del HLE, con un 50.7% !!! La versión multiagente es la que se podrá usar en la versión más cara de Grok, llamada Grok 4 Heavy

