Most TTS models convert audio into discrete tokens. That compression strips acoustic detail. Emotional texture gets flattened. Timbre gets approximated. VoxCPM 2 uses a Diffusion-Autoregressive Continuous Representation framework instead. Continuous signal. Less information
VoxCPM 2: Continuous Representation for Enhanced Audio Synthesis
By
–