"DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation" End to end backprop stores activations through every layer, which is why deep Transformers is expensive to train. This paper reinterprets residual blocks as diffusion denoising steps, so each
DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation
By
–
