Y hasta aquí la semana grande de OpenAI
@dotcsv
-
GPT-5 Release Announcement Surprises AI Community
By
–
Wait, WHAT DE FUQ? https://
r.mtdv.me/blog/posts/gpt
-5
… -
SAE for LLM Feature Extraction and Behavior Conditioning
By
–
Y lo que ha sacado OpenAI, pues bueno, se le parece demasiado… → Explorar el uso de SAE.
→ Para extraer features de un LLM.
→ Que podrían servir para condicionar el comportamiento del modelo. Ajam -

Anthropic’s Scaling Monosemanticity: Breakthrough in Transformer Interpretability
By
–
Es el tema del próximo vídeo y es FAS-CI-NAN-TE, pero el crédito va a Anthropic que no sólo ha hecho un increíble trabajo de interpretabilidad, sino también de documentación que os invito a leer si os interesa. https://
transformer-circuits.pub/2024/scaling-m
onosemanticity/index.html
… -

Sparse Autoencoders: Anthropic’s Recent AI Research Breakthrough
By
–
Todos esperando GPT-5 y nos salen con un artículo sobre Sparse Autoencoders… 😅
— Carlos Santana (@DotCSV) 6 juin 2024
Lo más gracioso es que JUSTO me ha pillado animando para el próximo vídeo un Sparse Autoencoder. Y es que esto que acaban de presentar es una copia del trabajo reciente de Anthropic. 🌉 https://t.co/WhOMFxAWlR pic.twitter.com/bUe63lh4ywTodos esperando GPT-5 y nos salen con un artículo sobre Sparse Autoencoders… Lo más gracioso es que JUSTO me ha pillado animando para el próximo vídeo un Sparse Autoencoder. Y es que esto que acaban de presentar es una copia del trabajo reciente de Anthropic.
-
Open Source LLMs Continue Compression Trend Evolution
By
–
Otro paso más en la evolución de los LLMs open source, que siguen la tendencia de comprimir más potencia en menos tamaño. A falta de ver las pruebas de la comunidad.
-

Model Context Windows: 128K Tokens in 72B and 7B Models
By
–
Ventas de contexto de 128K tokens en los modelos 72B y 7B 64K tokens en el modelo 57B 32K tokens en los modelos 1.5B y 0.5B
-

Qwen vs Llama 3: Programming and Math Capabilities Comparison
By
–
Efectivamente el punto fuerte en el que hacen hincapié desde Qwen es en las capacidades de programación y matemática frente a Llama 3.
-

New 7B Model Outperforms Llama 3 8B in Programming
By
–
También el modelo 7B que la mayoría de vosotros utilizaréis también tiene muy buena pinta, con mejor rendimiento que Llama 3 8B -sobre todo en programación y matemáticas-. Si acostumbrabais a usar el modelo 8B de Meta, pues ahora tenéis un buen upgrade que probar 🙂
-
Chinese SORA Alternative Kling Video Generation Model Released
By
–
🔴 ¡El SORA CHINO ya está AQUI!
— Carlos Santana (@DotCSV) 6 juin 2024
Ojito que desde china nos llega Kling, un nuevo modelo de generación de vídeo que se acerca a la propuesta de OpenAI.
→ 120s a 30FPS en 1080p
Según indican en este tweet se podría acceder a través de una app china. Más ejemplos en este hilo 👇 https://t.co/3mJPCKAnKf¡El SORA CHINO ya está AQUI! Ojito que desde china nos llega Kling, un nuevo modelo de generación de vídeo que se acerca a la propuesta de OpenAI. → 120s a 30FPS en 1080p Según indican en este tweet se podría acceder a través de una app china. Más ejemplos en este hilo