

FYI, not gpt-5 but still something you can play with, check inside

By
–


FYI, not gpt-5 but still something you can play with, check inside
By
–
Improved methods for training sparse autoencoders at scale. Shows promise towards interpreting GPT-4's neural activity: https://t.co/zNbYnYr6lE
— Greg Brockman (@gdb) 6 juin 2024
Improved methods for training sparse autoencoders at scale. Shows promise towards interpreting GPT-4's neural activity:
By
–
I saw something like this before. Curious why Chinese characters are multiple tokens, and how it would be different if they were single tokens.
By
–
I asked it to make it token efficient, but I didn’t provide details beyond that. Though for reasons pointed out by others, I don’t think is the right approach.
By
–
Otro paso más en la evolución de los LLMs open source, que siguen la tendencia de comprimir más potencia en menos tamaño. A falta de ver las pruebas de la comunidad.

By
–
Ventas de contexto de 128K tokens en los modelos 72B y 7B 64K tokens en el modelo 57B 32K tokens en los modelos 1.5B y 0.5B

By
–
Efectivamente el punto fuerte en el que hacen hincapié desde Qwen es en las capacidades de programación y matemática frente a Llama 3.

By
–
También el modelo 7B que la mayoría de vosotros utilizaréis también tiene muy buena pinta, con mejor rendimiento que Llama 3 8B -sobre todo en programación y matemáticas-. Si acostumbrabais a usar el modelo 8B de Meta, pues ahora tenéis un buen upgrade que probar 🙂
By
–
Running on Macbook M1 pro (16GB RAM) using the @ollama
.

By
–
Google’s NotebookLM is now running Gemini 1.5 Pro