AI Dynamics

Global AI News Aggregator

About

Local 26B LLM Running at 166 Tokens/s on NVIDIA RTX 5090

Voici c'est quoi 166 token/s sur une NVIDIA RTX 5090 sur Gemma4 , avec le modele 26B – 8 bits (qui est à mon sens largement ok!) Regardez la vitesse svp. On est en avril 2026 et on a ce niveau de LLM en local à une vitesse incroyable. Je suis vraiment trop heureux. Imaginez fin

→ Voir le post original sur X — @dfintelligence