AI Dynamics

Global AI News Aggregator

About

DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation

"DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation" End to end backprop stores activations through every layer, which is why deep Transformers is expensive to train. This paper reinterprets residual blocks as diffusion denoising steps, so each

→ View original post on X — @askalphaxiv