Spark-TTS

Spark-TTS

Spark-TTS 是一个基于大语言模型(Qwen2.5)的开源零样本文本转语音(TTS)工具,支持中英文、多音色与可控语音生成。 定价:免费开源。推荐指数:⭐ 4.5。

4.5
(18 评价)9.5k 浏览免费可用
Web
Spark-TTS 是什么?

简单说,Spark-TTS是一个开源的文本转语音(TTS)工具,你可以直接输入文字,它就能生成语音。支持中文、英文等多种语言,最大的亮点是零样本语音克隆——你给它一小段参考音频,它就能用类似的声音说话,不需要提前训练模型。 2026年最新版本增加了情感控制功能,可以调节语音的情绪倾向,比如开心、悲伤、严肃等;同时支持实时流式输出,适合做直播字幕、语音交互这类场景。开源免费,自己能部署着玩,也能用在项目里。 给一段几秒到几十秒的音频作为参考,它就能模仿这段声音生成新内容。适合需要特定音色但又不想花时间训练模型的场景。很多用户拿它来做个性化语音合成,比如给有声书配不同角色的声音。 支持中文、英文等主流语言,生成效果在开源TTS里算是比较自然的。中文的连贯性和韵律表现可以接受,英文发音也基本过关,但不是那种能达到录音棚级别的效果。 2026版新增的功能,可以通过参数调节语音的情感倾向。具体效果取决于输入的文本和参数配置,总体上能让合成语音听起来不那么“机械”,增加一些表现力。

优点

  • + 完全开源免费,可自行部署
  • + 支持零样本语音克隆
  • + 多语言支持包括中文、英文等
  • + 推理速度快,延迟低
  • + 社区活跃,持续更新迭代

缺点

  • - 需要一定的技术能力部署
  • - 音色数量相对有限
  • - 部分高级功能需要配置GPU
  • - 缺乏官方商业支持

Spark-TTS是免费的吗?

是的,Spark-TTS是完全开源免费的工具,可以直接在GitHub上免费使用,支持自行部署。

Spark-TTS支持中文语音合成吗?

支持,Spark-TTS支持中文、英文、日文等多种语言的语音合成,中文效果表现良好。

Spark-TTS需要什么配置?

建议使用NVIDIA显卡(至少8GB显存)以获得最佳性能,CPU也可以运行但速度较慢。

如何快速体验Spark-TTS?

可以通过Hugging Face上的在线演示页面直接体验,或者使用pip安装后通过Python脚本快速调用。

常见问题

用户评价