VAE-only visual tokenizers has hit a wall for diffusion, as better pixel-level accuracy does NOT lead to higher-quality generation To be truly effective, this MiniMax paper adds semantic objectives via CLIP + self-supervision during tokenizer pretraining, having the latent space
Visual Tokenizers Enhanced: Semantic Objectives Beyond VAE Pixel-Level Accuracy
By
–
