TTS开源项目收集一批
高真人质感开源TTS项目清单(2026实测,侧重自然人声、换气、情绪、生活化亲动感)
按中文优先、真人感强度、上手难度、商用权限排序,全部本地离线可跑,无强制联网,人声贴近日常说话,没有机械播报腔。
一、顶级真人感·中文首选(短视频/有声书/数字人,亲动感最强)
1. IndexTTS 2(B站开源,最推荐日常人声)
核心真人优势:自带自然换气、长短句停顿、口语轻重音,读小说/对话完全不像机器,5–10秒人声即可克隆音色,情绪迁移极强,能复刻普通人说话松弛感。
- 亮点:DiT扩散声码器,避免电子毛刺;长文本不崩韵律;多音字、数字、英文混合识别优秀
- 显存:6G起,4G低显存模式可用
- 协议:开源免费,非商用宽松,二次开发友好
- 适合:有声书、自媒体配音、日常对话数字人、克隆自己/亲友声音
2. CosyVoice 2(阿里达摩院,专业播音+生活化双风格)
核心真人优势:同时覆盖温柔生活化人声、标准播音腔;支持方言(川普、粤语、东北话),自带自然呼吸声,语速/情绪平滑渐变,短句闲聊氛围感拉满。
- 亮点:3秒零样本克隆;支持多角色对话切换;前端文本处理极强,不会读错数字、符号
- 显存:5G显存即可跑0.5B轻量版
- 协议:开源可商用(关键优势)
- 适合:客服语音、知识口播、方言内容、企业商用配音
3. Qwen3-TTS(通义千问开源,轻量化高自然度)
核心真人优势:人声柔和温润,没有尖锐电子音;支持文字描述生成音色(“温柔年轻女生,轻声聊天”),多人对话音色区分自然,长文本连贯不割裂。
- 亮点:0.6B小模型仅需4G显存,低配电脑/笔记本流畅运行;流式实时合成,第一字秒出
- 协议:Apache 2.0,完全免费商用
- 适合:本地语音助手、短视频批量配音、低配主机离线使用
4. VoxCPM2(清华面壁,文字自定义音色天花板)
核心真人优势:不用参考音频,纯文字描述生成全新人声,能做出慵懒、低语、小声吐槽等生活化语气,呼吸、停顿完全模拟真人闲聊,30种语言+9种中文方言。
- 亮点:一句话定制声线;支持LoRA微调专属音色;广播级48kHz音质
- 显存:8G推荐,低显存可裁剪
- 协议:Apache 2.0 商用无限制
- 适合:定制专属虚拟人声、多语种内容、剧情向配音
二、广播级高保真·长音频专用(播客、长篇小说、48kHz立体声)
1. Fish Speech S2(FishAudio开源,立体声真人录音质感)
核心真人优势:48kHz立体声输出,底噪极低,人声饱满通透,强弱语气层次丰富,适合对音质有专业要求的播客、有声剧,多语种切换自然不突兀。
- 亮点:超长文本自动分段、自动换气;中英日韩无缝混合朗读
- 显存:6G+
- 协议:开源,商用需遵守条款
- 适合:付费有声书、专业播客、出海多语言内容
2. MOSS-VoiceGenerator(复旦MOSS,电影级情绪人声)
核心真人优势:主打“生活化瑕疵真实感”,刻意模拟真人轻微卡顿、气息起伏、小声呢喃,消除AI标准播音感,情绪跨度极大(委屈、兴奋、平静闲聊)。
- 亮点:无需参考音,文本指令控制情绪;最长10分钟一次性合成
- 协议:Apache 2.0 可商用
- 适合:剧情短视频、短剧配音、沉浸式数字人
三、轻量边缘端·手机/小主机离线(低配置,保留基础真人感)
1. Kokoro TTS(超小参数,嵌入式首选)
核心真人优势:仅82M超小模型,CPU无显卡也能跑,人声干净柔和,没有廉价机械音,短句日常对话自然,延迟极低适合实时交互。
- 显存:无GPU也能运行,内存4G足够
- 适合:本地语音助手、车载离线播报、小程序离线语音
2. NeuTTS(移动端优化,3秒极速克隆)
核心真人优势:手机端实时推理,克隆声线还原度高,日常口语节奏自然,nano小模型功耗极低,安卓手机离线运行无压力。
- 适合:本地随身配音、移动端AI对话
四、传统成熟稳定基线(FastSpeech/VITS系列,易二次开发)
MeloTTS
轻量化多语言TTS,人声干净,上手最简单,一行代码调用,适合快速集成;缺点长文本韵律略生硬,适合短播报。
SamBERT-HiFiGAN(阿里)
老牌中文情感TTS,内置多款成熟真人音色,情绪调节梯度细腻,Docker一键部署,适合企业快速搭建语音服务。
五、真人质感横向对比(快速选型)
| 项目 | 生活化闲聊感 | 播音专业感 | 显存门槛 | 商用许可 | 特色 |
|---|---|---|---|---|---|
| IndexTTS2 | ★★★★★ | ★★★☆ | 6G | 非商用免费 | 换气/停顿最自然,克隆极强 |
| CosyVoice2 | ★★★★ | ★★★★★ | 5G | 可商用 | 方言+多角色平衡 |
| VoxCPM2 | ★★★★★ | ★★★★ | 8G | 可商用 | 文字凭空生成音色 |
| Qwen3-TTS | ★★★★ | ★★★☆ | 4G | 可商用 | 低配友好,流式实时 |
| Fish Speech S2 | ★★★★ | ★★★★★ | 6G | 部分商用 | 48k立体声广播音质 |
| Kokoro | ★★★ | ★★☆ | CPU可跑 | 开源 | 嵌入式/离线设备 |
六、想要最强“亲动感”使用小贴士
- 优先 IndexTTS2 / VoxCPM2:专门优化日常对话、呼吸、自然断句,最像真人面对面说话;
- 克隆音色时尽量用日常闲聊录音(不要朗诵录音),合成出来会更松弛;
- 文案多加入语气词(啊、呢、唉、好吧),模型会自动匹配轻声、拖音;
- 调低语速0.85–0.95,真人日常说话普遍慢于AI默认1.0语速,大幅降低机械感。
补充全新一批高亲动感开源TTS(完全避开上一轮提到的IndexTTS、CosyVoice、FishSpeech、Qwen3-TTS、VoxCPM2、Kokoro、MeloTTS)
全部侧重生活化自然人声、对话松弛感、情绪/呼吸细节,分五大类:微调克隆神器、LLM式零样本音色、方言/情绪专用、超轻量CPU离线、海外多语种标杆,附带真人感评分、显存、商用权限、核心亮点。
一、中文社区顶流·少样本克隆(做专属人声、日常对话亲动感极强)
1. GPT-SoVITS(GitHub 59k+星,中文TTS生态天花板)
真人感亮点:1分钟日常闲聊录音即可完整微调专属音色,换气、尾音拖腔、口语轻重音还原度碾压多数零样本模型;中英日混读自然,长小说朗读不机械,适合复刻亲友、博主人声,聊天氛围感拉满。
- 显存:6G起步,4G量化可跑
- 协议:非商用免费,商用需联系作者授权
- 适合:长期固定角色配音、有声书、短视频固定旁白
2. F5-TTS(新一代端到端扩散TTS,无音素分割,极致流畅口语)
真人感亮点:抛弃传统文本前端硬分割,完全模拟真人说话连续韵律,短句闲聊、碎碎念、带停顿吐槽非常自然,无生硬断句;5秒音频克隆,长文本稳定性优秀,电子毛刺极少。
- 显存:8G推荐,6G低精度可用
- 协议:MIT宽松开源,商用友好
- 适合:短剧对话、直播口播、生活化旁白
3. Spark-TTS(轻量化扩散TTS,低配机高自然度)
真人感亮点:轻量DiT扩散架构,人声温润柔和,自带自然气声,支持情绪微调(开心/低落/慵懒闲聊),克隆音色不会出现尖锐AI嗓,日常对话亲和力强。
- 显存:5G即可流畅运行
- 协议:Apache2.0,可商用
- 适合:笔记本本地配音、数字人实时对话
二、指令可控·文字生成音色(不用参考音频,自定义聊天人声)
1. VoiceSculptor 西工大开源
真人感亮点:纯文字描述生成全新人声(“22岁女生,轻声温柔聊天,语速偏慢,带轻微气音”),支持迭代微调音色年龄、情绪、口音;可精细控制呼吸、停顿、音量起伏,闲聊松弛感顶级。
- 显存:7G+
- 协议:完全开源可商用
- 特色:RAG音色迭代、单维度人声属性编辑
2. Confucius4-TTS 网易有道子曰
真人感亮点:跨语种无痕音色迁移,3秒零样本克隆,复刻真人说话语气习惯;多语种混合对话无割裂,日常闲聊、客服温柔话术质感真实,无机器播报腔。
- 显存:8G
- 协议:Apache2.0,商用无限制
- 适合跨境短视频、多语言数字人、海外配音
3. OmniVoice 小米开源
真人感亮点:600+语种覆盖,中文发音精准,口语连读、轻声处理细腻;3秒极速克隆,人声通透自然,低延迟流式输出,适合实时对话类场景。
- 显存:6G起,量化后4G可跑
- 协议:Apache2.0,免费商用
- 适合多语种AI助手、全球短视频批量配音
三、方言/情绪专项TTS(接地气、生活化口语,极强亲切感)
1. Parrot-TTS v3.2
真人感亮点:内置17种中文方言(四川话、东北话、粤语、闽南语等)+56种细分情绪标签;方言语调完全贴合本地人日常聊天,不是生硬普通话转方言,市井口语氛围感拉满。
- 显存:8G
- 协议:Apache2.0商用
- 适合方言短剧、本地生活短视频、乡土剧情配音
2. Muyan-TTS(播客专属TTS)
真人感亮点:基于10万小时真人播客闲聊数据训练,人声松弛慵懒,像电台主播面对面聊天;长文本连贯不卡顿,自然换气、语气转折丰富,适合播客、睡前故事、谈心类音频。
- 显存:6G
- 协议:非商用免费
- 特色:0.33s生成1秒音频,实时低延迟
四、超轻量·CPU无显卡离线(嵌入式、手机、低配电脑本地跑)
1. KittenTTS(仅25MB超小模型)
真人感亮点:仅15M参数,树莓派、老旧笔记本纯CPU运行;人声干净柔和,无廉价机械音,短句日常对话、播报亲和力足够,功耗极低。
- 硬件:无GPU,4G内存即可
- 协议:MIT开源
- 适合车载离线语音、本地小程序、硬件语音助手
2. MOSS-TTS-Nano(复旦MOSS轻量版)
真人感亮点:0.1B极小参数,CPU直接输出48kHz立体声;人声饱满,基础情绪可控,支持中英20语种,一键部署,离线隐私友好。
- 硬件:纯CPU运行,无需独显
- 协议:Apache2.0商用
- 适合随身本地配音、离线机器人交互
五、海外成熟开源生态(多语种、影视级情绪,适合海外内容)
1. Coqui TTS 全家桶(XTTS-v2 / Tortoise / Bark)
XTTS-v2(最推荐)
真人感亮点:海外零样本克隆标杆,6秒参考音频复刻人声,多语种自然连读,英文口语地道松弛,适合海外短视频、英文播客;支持音色融合,做出独特聊天声线。
- 显存:8G
- 协议:个人免费,商用单独授权
Tortoise-TTS
主打影视级情绪人声,低语、激动、平静叙事区分极强,氛围感浓厚,英文真人感顶尖;缺点推理速度偏慢。
Bark
自带环境音效、笑声、叹气、停顿气口,模拟真人完整说话状态,适合剧情类英文配音。
2. AudioCraft(Meta)
包含MusicGen+AudioGen+TTS模块,TTS部分支持自然语气、口语化填充词(uh、um),高度模拟外国人日常闲聊,适合英文对话AI。
六、小众但特色极强补充项目
- ChatTTS:专为对话场景训练,模仿聊天碎片化语气,短句、问答、吐槽自然;适合AI聊天机器人,缺点长文本稳定性一般。
- VoiceClone4VITS:轻量化VITS微调工具链,上手极简,少量音频快速训练专属音色,适合新手自制人声。
- WeNet-TTS:国内工业级语音开源框架,支持流式实时播报,播音腔+生活化双模式,企业私有化部署首选。
快速选型总结(追求“亲动感”优先顺序)
- 自制专属人声、长期配音:GPT-SoVITS > F5-TTS
- 凭空生成全新聊天音色、精细情绪控制:VoiceSculptor
- 方言接地气本地口语:Parrot-TTS
- 无显卡、低配设备离线用:KittenTTS / MOSS-TTS-Nano
- 多语种跨境内容:OmniVoice / Confucius4-TTS / XTTS-v2
- 播客、电台温柔闲聊:Muyan-TTS
中文自然度拉满、效果顶尖开源TTS全汇总(按口语亲动感、中文专项优化分级)
全部原生深度优化中文四声、儿化音、语气词、连读、方言、对话呼吸感,剔除机械朗读腔,分五大梯队,标注核心中文优势、适用场景、显存、商用权限。
第一梯队:对话口语天花板(日常聊天、短视频、数字人,真人松弛感最强)
1. ChatTTS(对话专用首选)
中文独家优势:专门用海量中文闲聊、播客数据训练,自动生成自然换气、停顿、笑声、语气助词(呃、那个、唉),虚词轻重完全贴合国人说话习惯;对“的、了、吧、呢”尾音处理远超绝大多数模型,碎碎念、问答、闲聊几乎看不出AI痕迹。
- 显存:4G可跑量化版,6G流畅
- 协议:非商用免费
- 适合:AI聊天机器人、Vlog旁白、播客、短剧日常对话
2. GPT-SoVITS(中文克隆生态王者,59k+星)
中文优势:国内适配度最高的少样本克隆,1分钟日常闲聊干音就能复刻人声;完美兼容中英粤日韩混读,多音字、数字、符号不读错;情绪迁移极强,哭腔、温柔闲聊、吐槽语气均可精准复刻,长小说朗读韵律稳定不割裂。
- 显存:6G起步,4G低显存量化
- 协议:个人免费,商用需联系作者授权
- 适合:固定角色配音、有声书、复刻亲友/博主声音、漫剧配音
3. F5-TTS(新一代流畅无生硬断句)
中文优势:端到端扩散架构,抛弃传统音素硬分割,中文长句不会出现卡顿、断句割裂;5秒零样本克隆,语速、轻重音连续顺滑,吐槽、碎碎念口语感突出,电子毛刺极少,中英混合朗读流畅自然。
- 显存:6G最低,8G推荐
- 协议:MIT宽松开源,可商用
- 适合:口播短视频、直播旁白、剧情对话
第二梯队:全能旗舰(播音+口语双兼顾,可商用,企业私有化首选)
1. CosyVoice 2(阿里达摩院)
中文优势:普通话标准柔和,内置自然呼吸声;支持川普、粤语、东北话等多类中文方言;3秒零样本克隆,多角色切换无违和,文本纠错强,数字、地名、专业名词朗读零失误,同时兼顾生活化闲聊与专业口播。
- 显存:5G可跑轻量0.5B版本
- 协议:开源可商用
- 适合:客服语音、知识口播、企业配音、方言短视频
2. Qwen3-TTS(通义千问开源)
中文优势:0.6B轻量低配友好,原生区分中文多音字词义(东西、地道等);支持文字描述自定义音色(温柔少女、沉稳大叔闲聊声);流式实时输出,第一字秒出,长文本连贯无音色漂移,人声温润无尖锐机械音。
- 显存:4G低配笔记本流畅运行
- 协议:Apache2.0,完全免费商用
- 适合:本地语音助手、批量短视频配音、低配主机离线部署
3. VoxCPM2(清华面壁)
中文优势:无离散分词损失人声细节,9种中文方言全覆盖;纯文字凭空生成全新人声,可精细控制慵懒、低语、谈心语气,48kHz高保真立体声,口语起伏、气息层次丰富,适合追求广播级音质的中文内容。
- 显存:8G推荐
- 协议:Apache2.0商用无限制
- 适合:定制专属虚拟人声、长篇播客、多方言内容
第三梯队:方言/情绪专项(接地气市井口语,特色极强)
Parrot-TTS v3.2
中文核心强项:17种中文方言(四川话、东北话、闽南语、吴语等)原生训练,不是普通话生硬转译;内置56种细分中文情绪(委屈、慵懒、兴奋、吐槽),本地市井聊天氛围感拉满,方言四声、俚语发音地道。
- 显存:8G
- 协议:Apache2.0可商用
- 适合:地方生活短视频、乡土短剧、方言有声书
EmotiVoice(网易有道)
中文优势:内置2000+成熟中文音色,情绪粒度极细;多音字、语境语调精准区分,零样本克隆稳定,自带Web可视化界面,新手不用代码快速生成喜怒哀乐各类中文人声。
- 显存:6G
- 协议:开源,商用合规
- 适合:情感类短视频、虚拟主播、剧情配音
第四梯队:播客/长文本专用(松弛电台感,适合长篇朗读)
Muyan-TTS
中文优势:基于十万小时真人中文播客闲聊训练,人声慵懒松弛,像面对面谈心;超长文本自动分配自然换气、段落停顿,没有紧绷的播报感,睡前故事、谈心类音频效果独一档。
- 显存:6G
- 协议:非商用免费
VibeVoice(微软开源)
中文优势:一次性生成45分钟长音频,最多4个中文角色自然切换,角色音色不会漂移;扩散模型高保真,多人访谈、广播剧对话逻辑、语气衔接极度自然。
- 显存:8G
- 协议:MIT开源
第五梯队:轻量CPU离线(无独显也能跑,保留基础中文自然度)
Spark-TTS
中文优势:轻量扩散架构,CPU可推理,人声柔和带自然气声;支持情绪微调,克隆音色无刺耳AI嗓,短句日常对话亲和力充足,笔记本/小主机离线友好。
- 显存:5G,无显卡CPU可运行
- 协议:Apache2.0商用
MOSS-TTS-Nano(复旦)
中文优势:仅0.1B极小参数,纯CPU输出48kHz立体声;中文基础韵律完整,无明显机械感,中英双语支持,树莓派、老旧电脑、嵌入式设备可用。
- 硬件:无需独显,4G内存即可
Kokoro TTS
超轻82M模型,纯CPU运行,中文短句干净柔和,无廉价电子音,适合车载、本地小程序简单播报。
老牌稳定工业级(易集成、服务部署,中文成熟基线)
- SamBERT-HiFiGAN(阿里):老牌多情感中文TTS,Docker一键部署,播音腔+生活化双模式,企业私有化语音服务首选。
- WeNet-TTS:国内工业语音开源框架,流式实时中文播报,纠错能力强,适合车载、客服实时语音。
- MeloTTS:上手最简单,一行代码调用,中文发音标准,适合短文本快速播报(短板:长文本韵律偏生硬)。
快速选型指南(只看中文自然度,按需求选)
- 做日常闲聊、对话、播客,要呼吸/语气细节:ChatTTS > Spark-TTS
- 克隆特定人的声音、长期固定配音、有声书:GPT-SoVITS
- 想要可商用、低配电脑、批量短视频:Qwen3-TTS / CosyVoice2
- 四川话/东北话等方言内容:Parrot-TTS v3.2
- 凭空创造全新温柔聊天人声、广播级音质:VoxCPM2
- 无独立显卡、老旧笔记本/嵌入式离线使用:MOSS-TTS-Nano / Kokoro
- 多人广播剧、长篇访谈:VibeVoice
主流中文优质开源TTS 完整使用教程合集
分懒人一键整合包、源码手动部署、基础使用/调参/避坑三部分,覆盖你之前看过的所有高自然度项目,优先Windows小白友好方案,附带官方仓库地址、显存门槛、实操步骤。
一、GPT-SoVITS(中文克隆天花板,有声书/复刻人声首选)
1. 懒人一键包(Windows零代码,90%用户推荐)
- 下载整合包(quark/百度盘社区整合版),解压路径不能有中文、空格,放固态硬盘
- 打开文件夹,双击
go-webui.bat,自动拉取缺失模型、启动Gradio网页 - 浏览器自动打开
http://127.0.0.1:9874 - 标准克隆流程:
- 上传10–60秒无杂音日常闲聊干音(不要朗诵录音)
- UVR5一键分离人声/伴奏(自带工具)
- 输入配音文本,调节语速0.85–0.95,开启自然停顿
- 生成导出wav音频
2. 源码手动部署(Windows/Linux/Mac)
# 1.拉取代码
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
# 2.创建虚拟环境
conda create -n gptso python=3.10
conda activate gptso
# 3.安装依赖
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
# Windows手动放ffmpeg.exe到根目录;Linux:sudo apt install ffmpeg
# 4.自动下载模型
bash install.sh
# 5.启动网页
python webui.py3. 关键调参(提升真人感)
- 语速:0.88~0.92(日常说话速度)
- 情感权重:0.6–0.8,太高会失真
- 长文本开启自动分句,每段≤150字
官方仓库:https://github.com/RVC-Boss/GPT-SoVITS
二、ChatTTS(对话闲聊专用,自带换气/笑声/口语语气)
1. 极简一键WebUI整合包(小白首选)
- 下载ChatTTS-webui离线包,解压纯英文路径
- 双击
运行.bat,自动下载4G模型权重 - 访问
127.0.0.1:7860 - 核心玩法:
- 音色种子抽卡:随机生成温柔/慵懒/少年人声,保存常用音色
- 文本加入语气词:啊、唉、呢、对吧,自动生成气口停顿
- 开启“自然填充语气”,自动添加轻微停顿、吸气声
2. 纯Python一行部署(二次开发)
conda create -n chattts python=3.10
conda activate chattts
pip install ChatTTS gradio==4.35.0 torch==2.1.2+cu118
# 启动简易界面
python -c "import ChatTTS; ChatTTS.Chat().webui()"3. CPU低配方案
安装 torch==2.1.2+cpu,关闭半精度,单次生成200字以内
官方仓库:https://github.com/2noise/ChatTTS
三、CosyVoice2 0.5B(阿里,可商用、方言、3秒零样本克隆)
1. Windows WSL2源码部署(稳定方案)
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice
conda create -n cosy python=3.10
conda activate cosy
conda install pynini==2.1.5
pip install -r requirements.txt -i https://mirrors.aliyun.com/pypi/simple/
# 下载预训练模型
python download_model.py
# 启动webui
python webui.py2. Docker一键部署(服务器/企业私有化)
docker build -t cosyvoice2:0.5b .
docker run -d --gpus all -p 7860:7860 cosyvoice2:0.5b3. 特色方言使用教程
- 克隆时上传普通话参考音
- 风格文本填入:
四川话,温柔闲聊,语速偏慢 - 支持粤语、东北话、河南话原生语调,不是生硬转译
显存门槛:5G可运行0.5B轻量版
官方仓库:https://github.com/FunAudioLLM/CosyVoice
四、Fish Speech S2(48K高保真,播客/长篇配音)
1. Windows整合包5分钟上手
- 下载FishSpeech一键包,解压无中文路径
- 双击
fish-speech.exe,自动加载模型 - 界面操作要点:
- 迭代提示长度:低配50–100,高配200–300(控制长文本连贯性)
- Top-p:0.65–0.75,平衡自然度与不乱读
- 支持中英日韩混合朗读,自动断句换气
2. 源码部署命令
git clone https://github.com/fishaudio/fish-speech
cd fish-speech
conda create -n fish python=3.11
conda activate fish
pip install -r requirements.txt
python tools/download_model.py
python webui.py --half # 半精度省显存避坑:模型至少预留15GB磁盘空间,低显存必须加--half参数
官方仓库:https://github.com/fishaudio/fish-speech
五、IndexTTS2(零样本情感克隆,情绪迁移极强)
1. 整合包傻瓜教程
- 解压整合包到固态纯英文目录,路径不能有中文/括号
- 双击启动程序,等待模型加载(首次5–10分钟)
- 操作流程:
- 上传5–20秒参考人声
- 文本框输入配音文案,情绪描述:慵懒、轻声谈心、吐槽
- speed speed数值越大语速越慢,推荐1.2–1.5
2. 源码轻量化部署(6G显存低配)
git clone https://github.com/index-tts/index-tts.git
cd index-tts
python -m venv tts_env
# Windows激活:tts_env\Scripts\activate
pip install -r requirements.txt
# 模型下载
uv tool install modelscope
modelscope download --model IndexTeam/IndexTTS-2 --local_dir checkpoints
# 低显存启动(8bit量化)
uv run webui.py --load_in_8bit显存优化技巧:开启load_in_8bit、device_map自动CPU卸载
官方仓库:https://github.com/index-tts/index-tts
六、F5-TTS(新一代流畅无割裂,短句口语最强)
极简部署
git clone https://github.com/SWivid/F5-TTS
cd F5-TTS
conda create -n f5tts python=3.10
conda activate f5tts
pip install -r requirements.txt
python gradio_app.py使用特点
无需复杂音素处理,长句不会生硬断句;5秒短音频即可克隆,适合短视频口播。
七、ChatTTS/GPT-SoVITS/CosyVoice 选型快速教程
| 需求场景 | 首选项目 | 最简上手方式 |
|---|---|---|
| 复刻亲友/博主固定声音、长篇小说 | GPT-SoVITS | Windows一键整合包 |
| 聊天对话、Vlog、带笑声/气口旁白 | ChatTTS | WebUI离线包,音色抽卡 |
| 商用合规、方言配音、3秒快速克隆 | CosyVoice2 | WSL源码 / Docker |
| 48K广播级播客、多语种长篇 | Fish Speech | 一键exe整合包 |
| 情绪丰富、影视剧情配音 | IndexTTS2 | 量化低显存启动 |
通用避坑大全(所有TTS通用)
- 路径绝对不能含中文、空格、特殊符号,否则模型加载失败
- 音频素材必须16K/44.1K wav,无背景音乐、无杂音
- 想要真人感:语速统一调低至0.85–0.95,不要默认1.0
- 显存<6G:全部开启半精度/8bit量化,单次生成≤300字
- 网络差:提前手动下载模型放入项目models文件夹,离线运行