一起看看 HuggingFace TTS 中文区排行的第三的 Spark-TTS – 单流解耦语音编码 简洁高效
基于 Qwen2.5 构建,无需额外声学模型。直接用 LLM 预测的编码重建音频,减少流程,提高效率。 高质量声音克隆
支持零样本音色克隆,无需专门训练即可复制说话人音色,适用于跨语言和代码混合场景。
Spark-TTS: Single-Stream Speech Codec with Voice Cloning
By
–
By
–
一起看看 HuggingFace TTS 中文区排行的第三的 Spark-TTS – 单流解耦语音编码 简洁高效
基于 Qwen2.5 构建,无需额外声学模型。直接用 LLM 预测的编码重建音频,减少流程,提高效率。 高质量声音克隆
支持零样本音色克隆,无需专门训练即可复制说话人音色,适用于跨语言和代码混合场景。