My Blog
← Back to home

TTS开源项目收集一批

高真人质感开源TTS项目清单(2026实测,侧重自然人声、换气、情绪、生活化亲动感)

中文优先、真人感强度、上手难度、商用权限排序,全部本地离线可跑,无强制联网,人声贴近日常说话,没有机械播报腔。

一、顶级真人感·中文首选(短视频/有声书/数字人,亲动感最强)

1. IndexTTS 2(B站开源,最推荐日常人声)

核心真人优势:自带自然换气、长短句停顿、口语轻重音,读小说/对话完全不像机器,5–10秒人声即可克隆音色,情绪迁移极强,能复刻普通人说话松弛感。

  • 亮点:DiT扩散声码器,避免电子毛刺;长文本不崩韵律;多音字、数字、英文混合识别优秀
  • 显存:6G起,4G低显存模式可用
  • 协议:开源免费,非商用宽松,二次开发友好
  • 适合:有声书、自媒体配音、日常对话数字人、克隆自己/亲友声音

2. CosyVoice 2(阿里达摩院,专业播音+生活化双风格)

核心真人优势:同时覆盖温柔生活化人声、标准播音腔;支持方言(川普、粤语、东北话),自带自然呼吸声,语速/情绪平滑渐变,短句闲聊氛围感拉满。

  • 亮点:3秒零样本克隆;支持多角色对话切换;前端文本处理极强,不会读错数字、符号
  • 显存:5G显存即可跑0.5B轻量版
  • 协议:开源可商用(关键优势)
  • 适合:客服语音、知识口播、方言内容、企业商用配音

3. Qwen3-TTS(通义千问开源,轻量化高自然度)

核心真人优势:人声柔和温润,没有尖锐电子音;支持文字描述生成音色(“温柔年轻女生,轻声聊天”),多人对话音色区分自然,长文本连贯不割裂。

  • 亮点:0.6B小模型仅需4G显存,低配电脑/笔记本流畅运行;流式实时合成,第一字秒出
  • 协议:Apache 2.0,完全免费商用
  • 适合:本地语音助手、短视频批量配音、低配主机离线使用

4. VoxCPM2(清华面壁,文字自定义音色天花板)

核心真人优势:不用参考音频,纯文字描述生成全新人声,能做出慵懒、低语、小声吐槽等生活化语气,呼吸、停顿完全模拟真人闲聊,30种语言+9种中文方言。

  • 亮点:一句话定制声线;支持LoRA微调专属音色;广播级48kHz音质
  • 显存:8G推荐,低显存可裁剪
  • 协议:Apache 2.0 商用无限制
  • 适合:定制专属虚拟人声、多语种内容、剧情向配音

二、广播级高保真·长音频专用(播客、长篇小说、48kHz立体声)

1. Fish Speech S2(FishAudio开源,立体声真人录音质感)

核心真人优势:48kHz立体声输出,底噪极低,人声饱满通透,强弱语气层次丰富,适合对音质有专业要求的播客、有声剧,多语种切换自然不突兀。

  • 亮点:超长文本自动分段、自动换气;中英日韩无缝混合朗读
  • 显存:6G+
  • 协议:开源,商用需遵守条款
  • 适合:付费有声书、专业播客、出海多语言内容

2. MOSS-VoiceGenerator(复旦MOSS,电影级情绪人声)

核心真人优势:主打“生活化瑕疵真实感”,刻意模拟真人轻微卡顿、气息起伏、小声呢喃,消除AI标准播音感,情绪跨度极大(委屈、兴奋、平静闲聊)。

  • 亮点:无需参考音,文本指令控制情绪;最长10分钟一次性合成
  • 协议:Apache 2.0 可商用
  • 适合:剧情短视频、短剧配音、沉浸式数字人

三、轻量边缘端·手机/小主机离线(低配置,保留基础真人感)

1. Kokoro TTS(超小参数,嵌入式首选)

核心真人优势:仅82M超小模型,CPU无显卡也能跑,人声干净柔和,没有廉价机械音,短句日常对话自然,延迟极低适合实时交互。

  • 显存:无GPU也能运行,内存4G足够
  • 适合:本地语音助手、车载离线播报、小程序离线语音

2. NeuTTS(移动端优化,3秒极速克隆)

核心真人优势:手机端实时推理,克隆声线还原度高,日常口语节奏自然,nano小模型功耗极低,安卓手机离线运行无压力。

  • 适合:本地随身配音、移动端AI对话

四、传统成熟稳定基线(FastSpeech/VITS系列,易二次开发)

MeloTTS

轻量化多语言TTS,人声干净,上手最简单,一行代码调用,适合快速集成;缺点长文本韵律略生硬,适合短播报。

SamBERT-HiFiGAN(阿里)

老牌中文情感TTS,内置多款成熟真人音色,情绪调节梯度细腻,Docker一键部署,适合企业快速搭建语音服务。

五、真人质感横向对比(快速选型)

项目 生活化闲聊感 播音专业感 显存门槛 商用许可 特色
IndexTTS2 ★★★★★ ★★★☆ 6G 非商用免费 换气/停顿最自然,克隆极强
CosyVoice2 ★★★★ ★★★★★ 5G 可商用 方言+多角色平衡
VoxCPM2 ★★★★★ ★★★★ 8G 可商用 文字凭空生成音色
Qwen3-TTS ★★★★ ★★★☆ 4G 可商用 低配友好,流式实时
Fish Speech S2 ★★★★ ★★★★★ 6G 部分商用 48k立体声广播音质
Kokoro ★★★ ★★☆ CPU可跑 开源 嵌入式/离线设备

六、想要最强“亲动感”使用小贴士

  1. 优先 IndexTTS2 / VoxCPM2:专门优化日常对话、呼吸、自然断句,最像真人面对面说话;
  2. 克隆音色时尽量用日常闲聊录音(不要朗诵录音),合成出来会更松弛;
  3. 文案多加入语气词(啊、呢、唉、好吧),模型会自动匹配轻声、拖音;
  4. 调低语速0.85–0.95,真人日常说话普遍慢于AI默认1.0语速,大幅降低机械感。

补充全新一批高亲动感开源TTS(完全避开上一轮提到的IndexTTS、CosyVoice、FishSpeech、Qwen3-TTS、VoxCPM2、Kokoro、MeloTTS)

全部侧重生活化自然人声、对话松弛感、情绪/呼吸细节,分五大类:微调克隆神器、LLM式零样本音色、方言/情绪专用、超轻量CPU离线、海外多语种标杆,附带真人感评分、显存、商用权限、核心亮点。

一、中文社区顶流·少样本克隆(做专属人声、日常对话亲动感极强)

1. GPT-SoVITS(GitHub 59k+星,中文TTS生态天花板)

真人感亮点:1分钟日常闲聊录音即可完整微调专属音色,换气、尾音拖腔、口语轻重音还原度碾压多数零样本模型;中英日混读自然,长小说朗读不机械,适合复刻亲友、博主人声,聊天氛围感拉满。

  • 显存:6G起步,4G量化可跑
  • 协议:非商用免费,商用需联系作者授权
  • 适合:长期固定角色配音、有声书、短视频固定旁白

2. F5-TTS(新一代端到端扩散TTS,无音素分割,极致流畅口语)

真人感亮点:抛弃传统文本前端硬分割,完全模拟真人说话连续韵律,短句闲聊、碎碎念、带停顿吐槽非常自然,无生硬断句;5秒音频克隆,长文本稳定性优秀,电子毛刺极少。

  • 显存:8G推荐,6G低精度可用
  • 协议:MIT宽松开源,商用友好
  • 适合:短剧对话、直播口播、生活化旁白

3. Spark-TTS(轻量化扩散TTS,低配机高自然度)

真人感亮点:轻量DiT扩散架构,人声温润柔和,自带自然气声,支持情绪微调(开心/低落/慵懒闲聊),克隆音色不会出现尖锐AI嗓,日常对话亲和力强。

  • 显存:5G即可流畅运行
  • 协议:Apache2.0,可商用
  • 适合:笔记本本地配音、数字人实时对话

二、指令可控·文字生成音色(不用参考音频,自定义聊天人声)

1. VoiceSculptor 西工大开源

真人感亮点:纯文字描述生成全新人声(“22岁女生,轻声温柔聊天,语速偏慢,带轻微气音”),支持迭代微调音色年龄、情绪、口音;可精细控制呼吸、停顿、音量起伏,闲聊松弛感顶级。

  • 显存:7G+
  • 协议:完全开源可商用
  • 特色:RAG音色迭代、单维度人声属性编辑

2. Confucius4-TTS 网易有道子曰

真人感亮点:跨语种无痕音色迁移,3秒零样本克隆,复刻真人说话语气习惯;多语种混合对话无割裂,日常闲聊、客服温柔话术质感真实,无机器播报腔。

  • 显存:8G
  • 协议:Apache2.0,商用无限制
  • 适合跨境短视频、多语言数字人、海外配音

3. OmniVoice 小米开源

真人感亮点:600+语种覆盖,中文发音精准,口语连读、轻声处理细腻;3秒极速克隆,人声通透自然,低延迟流式输出,适合实时对话类场景。

  • 显存:6G起,量化后4G可跑
  • 协议:Apache2.0,免费商用
  • 适合多语种AI助手、全球短视频批量配音

三、方言/情绪专项TTS(接地气、生活化口语,极强亲切感)

1. Parrot-TTS v3.2

真人感亮点:内置17种中文方言(四川话、东北话、粤语、闽南语等)+56种细分情绪标签;方言语调完全贴合本地人日常聊天,不是生硬普通话转方言,市井口语氛围感拉满。

  • 显存:8G
  • 协议:Apache2.0商用
  • 适合方言短剧、本地生活短视频、乡土剧情配音

2. Muyan-TTS(播客专属TTS)

真人感亮点:基于10万小时真人播客闲聊数据训练,人声松弛慵懒,像电台主播面对面聊天;长文本连贯不卡顿,自然换气、语气转折丰富,适合播客、睡前故事、谈心类音频。

  • 显存:6G
  • 协议:非商用免费
  • 特色:0.33s生成1秒音频,实时低延迟

四、超轻量·CPU无显卡离线(嵌入式、手机、低配电脑本地跑)

1. KittenTTS(仅25MB超小模型)

真人感亮点:仅15M参数,树莓派、老旧笔记本纯CPU运行;人声干净柔和,无廉价机械音,短句日常对话、播报亲和力足够,功耗极低。

  • 硬件:无GPU,4G内存即可
  • 协议:MIT开源
  • 适合车载离线语音、本地小程序、硬件语音助手

2. MOSS-TTS-Nano(复旦MOSS轻量版)

真人感亮点:0.1B极小参数,CPU直接输出48kHz立体声;人声饱满,基础情绪可控,支持中英20语种,一键部署,离线隐私友好。

  • 硬件:纯CPU运行,无需独显
  • 协议:Apache2.0商用
  • 适合随身本地配音、离线机器人交互

五、海外成熟开源生态(多语种、影视级情绪,适合海外内容)

1. Coqui TTS 全家桶(XTTS-v2 / Tortoise / Bark)

XTTS-v2(最推荐)

真人感亮点:海外零样本克隆标杆,6秒参考音频复刻人声,多语种自然连读,英文口语地道松弛,适合海外短视频、英文播客;支持音色融合,做出独特聊天声线。

  • 显存:8G
  • 协议:个人免费,商用单独授权

Tortoise-TTS

主打影视级情绪人声,低语、激动、平静叙事区分极强,氛围感浓厚,英文真人感顶尖;缺点推理速度偏慢。

Bark

自带环境音效、笑声、叹气、停顿气口,模拟真人完整说话状态,适合剧情类英文配音。

2. AudioCraft(Meta)

包含MusicGen+AudioGen+TTS模块,TTS部分支持自然语气、口语化填充词(uh、um),高度模拟外国人日常闲聊,适合英文对话AI。

六、小众但特色极强补充项目

  1. ChatTTS:专为对话场景训练,模仿聊天碎片化语气,短句、问答、吐槽自然;适合AI聊天机器人,缺点长文本稳定性一般。
  2. VoiceClone4VITS:轻量化VITS微调工具链,上手极简,少量音频快速训练专属音色,适合新手自制人声。
  3. WeNet-TTS:国内工业级语音开源框架,支持流式实时播报,播音腔+生活化双模式,企业私有化部署首选。

快速选型总结(追求“亲动感”优先顺序)

  1. 自制专属人声、长期配音:GPT-SoVITS > F5-TTS
  2. 凭空生成全新聊天音色、精细情绪控制:VoiceSculptor
  3. 方言接地气本地口语:Parrot-TTS
  4. 无显卡、低配设备离线用:KittenTTS / MOSS-TTS-Nano
  5. 多语种跨境内容:OmniVoice / Confucius4-TTS / XTTS-v2
  6. 播客、电台温柔闲聊:Muyan-TTS

中文自然度拉满、效果顶尖开源TTS全汇总(按口语亲动感、中文专项优化分级)

全部原生深度优化中文四声、儿化音、语气词、连读、方言、对话呼吸感,剔除机械朗读腔,分五大梯队,标注核心中文优势、适用场景、显存、商用权限。

第一梯队:对话口语天花板(日常聊天、短视频、数字人,真人松弛感最强)

1. ChatTTS(对话专用首选)

中文独家优势:专门用海量中文闲聊、播客数据训练,自动生成自然换气、停顿、笑声、语气助词(呃、那个、唉),虚词轻重完全贴合国人说话习惯;对“的、了、吧、呢”尾音处理远超绝大多数模型,碎碎念、问答、闲聊几乎看不出AI痕迹。

  • 显存:4G可跑量化版,6G流畅
  • 协议:非商用免费
  • 适合:AI聊天机器人、Vlog旁白、播客、短剧日常对话

2. GPT-SoVITS(中文克隆生态王者,59k+星)

中文优势:国内适配度最高的少样本克隆,1分钟日常闲聊干音就能复刻人声;完美兼容中英粤日韩混读,多音字、数字、符号不读错;情绪迁移极强,哭腔、温柔闲聊、吐槽语气均可精准复刻,长小说朗读韵律稳定不割裂。

  • 显存:6G起步,4G低显存量化
  • 协议:个人免费,商用需联系作者授权
  • 适合:固定角色配音、有声书、复刻亲友/博主声音、漫剧配音

3. F5-TTS(新一代流畅无生硬断句)

中文优势:端到端扩散架构,抛弃传统音素硬分割,中文长句不会出现卡顿、断句割裂;5秒零样本克隆,语速、轻重音连续顺滑,吐槽、碎碎念口语感突出,电子毛刺极少,中英混合朗读流畅自然。

  • 显存:6G最低,8G推荐
  • 协议:MIT宽松开源,可商用
  • 适合:口播短视频、直播旁白、剧情对话

第二梯队:全能旗舰(播音+口语双兼顾,可商用,企业私有化首选)

1. CosyVoice 2(阿里达摩院)

中文优势:普通话标准柔和,内置自然呼吸声;支持川普、粤语、东北话等多类中文方言;3秒零样本克隆,多角色切换无违和,文本纠错强,数字、地名、专业名词朗读零失误,同时兼顾生活化闲聊与专业口播。

  • 显存:5G可跑轻量0.5B版本
  • 协议:开源可商用
  • 适合:客服语音、知识口播、企业配音、方言短视频

2. Qwen3-TTS(通义千问开源)

中文优势:0.6B轻量低配友好,原生区分中文多音字词义(东西、地道等);支持文字描述自定义音色(温柔少女、沉稳大叔闲聊声);流式实时输出,第一字秒出,长文本连贯无音色漂移,人声温润无尖锐机械音。

  • 显存:4G低配笔记本流畅运行
  • 协议:Apache2.0,完全免费商用
  • 适合:本地语音助手、批量短视频配音、低配主机离线部署

3. VoxCPM2(清华面壁)

中文优势:无离散分词损失人声细节,9种中文方言全覆盖;纯文字凭空生成全新人声,可精细控制慵懒、低语、谈心语气,48kHz高保真立体声,口语起伏、气息层次丰富,适合追求广播级音质的中文内容。

  • 显存:8G推荐
  • 协议:Apache2.0商用无限制
  • 适合:定制专属虚拟人声、长篇播客、多方言内容

第三梯队:方言/情绪专项(接地气市井口语,特色极强)

Parrot-TTS v3.2

中文核心强项:17种中文方言(四川话、东北话、闽南语、吴语等)原生训练,不是普通话生硬转译;内置56种细分中文情绪(委屈、慵懒、兴奋、吐槽),本地市井聊天氛围感拉满,方言四声、俚语发音地道。

  • 显存:8G
  • 协议:Apache2.0可商用
  • 适合:地方生活短视频、乡土短剧、方言有声书

EmotiVoice(网易有道)

中文优势:内置2000+成熟中文音色,情绪粒度极细;多音字、语境语调精准区分,零样本克隆稳定,自带Web可视化界面,新手不用代码快速生成喜怒哀乐各类中文人声。

  • 显存:6G
  • 协议:开源,商用合规
  • 适合:情感类短视频、虚拟主播、剧情配音

第四梯队:播客/长文本专用(松弛电台感,适合长篇朗读)

Muyan-TTS

中文优势:基于十万小时真人中文播客闲聊训练,人声慵懒松弛,像面对面谈心;超长文本自动分配自然换气、段落停顿,没有紧绷的播报感,睡前故事、谈心类音频效果独一档。

  • 显存:6G
  • 协议:非商用免费

VibeVoice(微软开源)

中文优势:一次性生成45分钟长音频,最多4个中文角色自然切换,角色音色不会漂移;扩散模型高保真,多人访谈、广播剧对话逻辑、语气衔接极度自然。

  • 显存:8G
  • 协议:MIT开源

第五梯队:轻量CPU离线(无独显也能跑,保留基础中文自然度)

Spark-TTS

中文优势:轻量扩散架构,CPU可推理,人声柔和带自然气声;支持情绪微调,克隆音色无刺耳AI嗓,短句日常对话亲和力充足,笔记本/小主机离线友好。

  • 显存:5G,无显卡CPU可运行
  • 协议:Apache2.0商用

MOSS-TTS-Nano(复旦)

中文优势:仅0.1B极小参数,纯CPU输出48kHz立体声;中文基础韵律完整,无明显机械感,中英双语支持,树莓派、老旧电脑、嵌入式设备可用。

  • 硬件:无需独显,4G内存即可

Kokoro TTS

超轻82M模型,纯CPU运行,中文短句干净柔和,无廉价电子音,适合车载、本地小程序简单播报。

老牌稳定工业级(易集成、服务部署,中文成熟基线)

  1. SamBERT-HiFiGAN(阿里):老牌多情感中文TTS,Docker一键部署,播音腔+生活化双模式,企业私有化语音服务首选。
  2. WeNet-TTS:国内工业语音开源框架,流式实时中文播报,纠错能力强,适合车载、客服实时语音。
  3. MeloTTS:上手最简单,一行代码调用,中文发音标准,适合短文本快速播报(短板:长文本韵律偏生硬)。

快速选型指南(只看中文自然度,按需求选)

  1. 做日常闲聊、对话、播客,要呼吸/语气细节:ChatTTS > Spark-TTS
  2. 克隆特定人的声音、长期固定配音、有声书:GPT-SoVITS
  3. 想要可商用、低配电脑、批量短视频:Qwen3-TTS / CosyVoice2
  4. 四川话/东北话等方言内容:Parrot-TTS v3.2
  5. 凭空创造全新温柔聊天人声、广播级音质:VoxCPM2
  6. 无独立显卡、老旧笔记本/嵌入式离线使用:MOSS-TTS-Nano / Kokoro
  7. 多人广播剧、长篇访谈:VibeVoice

主流中文优质开源TTS 完整使用教程合集

懒人一键整合包源码手动部署基础使用/调参/避坑三部分,覆盖你之前看过的所有高自然度项目,优先Windows小白友好方案,附带官方仓库地址、显存门槛、实操步骤。

一、GPT-SoVITS(中文克隆天花板,有声书/复刻人声首选)

1. 懒人一键包(Windows零代码,90%用户推荐)

  1. 下载整合包(quark/百度盘社区整合版),解压路径不能有中文、空格,放固态硬盘
  2. 打开文件夹,双击 go-webui.bat,自动拉取缺失模型、启动Gradio网页
  3. 浏览器自动打开 http://127.0.0.1:9874
  4. 标准克隆流程:
    • 上传10–60秒无杂音日常闲聊干音(不要朗诵录音)
    • UVR5一键分离人声/伴奏(自带工具)
    • 输入配音文本,调节语速0.85–0.95,开启自然停顿
    • 生成导出wav音频

2. 源码手动部署(Windows/Linux/Mac)

# 1.拉取代码
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
# 2.创建虚拟环境
conda create -n gptso python=3.10
conda activate gptso
# 3.安装依赖
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
# Windows手动放ffmpeg.exe到根目录;Linux:sudo apt install ffmpeg
# 4.自动下载模型
bash install.sh
# 5.启动网页
python webui.py

3. 关键调参(提升真人感)

  • 语速:0.88~0.92(日常说话速度)
  • 情感权重:0.6–0.8,太高会失真
  • 长文本开启自动分句,每段≤150字

官方仓库:https://github.com/RVC-Boss/GPT-SoVITS

二、ChatTTS(对话闲聊专用,自带换气/笑声/口语语气)

1. 极简一键WebUI整合包(小白首选)

  1. 下载ChatTTS-webui离线包,解压纯英文路径
  2. 双击 运行.bat,自动下载4G模型权重
  3. 访问 127.0.0.1:7860
  4. 核心玩法:
    • 音色种子抽卡:随机生成温柔/慵懒/少年人声,保存常用音色
    • 文本加入语气词:啊、唉、呢、对吧,自动生成气口停顿
    • 开启“自然填充语气”,自动添加轻微停顿、吸气声

2. 纯Python一行部署(二次开发)

conda create -n chattts python=3.10
conda activate chattts
pip install ChatTTS gradio==4.35.0 torch==2.1.2+cu118
# 启动简易界面
python -c "import ChatTTS; ChatTTS.Chat().webui()"

3. CPU低配方案

安装 torch==2.1.2+cpu,关闭半精度,单次生成200字以内

官方仓库:https://github.com/2noise/ChatTTS

三、CosyVoice2 0.5B(阿里,可商用、方言、3秒零样本克隆)

1. Windows WSL2源码部署(稳定方案)

git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice
conda create -n cosy python=3.10
conda activate cosy
conda install pynini==2.1.5
pip install -r requirements.txt -i https://mirrors.aliyun.com/pypi/simple/
# 下载预训练模型
python download_model.py
# 启动webui
python webui.py

2. Docker一键部署(服务器/企业私有化)

docker build -t cosyvoice2:0.5b .
docker run -d --gpus all -p 7860:7860 cosyvoice2:0.5b

3. 特色方言使用教程

  1. 克隆时上传普通话参考音
  2. 风格文本填入:四川话,温柔闲聊,语速偏慢
  3. 支持粤语、东北话、河南话原生语调,不是生硬转译

显存门槛:5G可运行0.5B轻量版

官方仓库:https://github.com/FunAudioLLM/CosyVoice

四、Fish Speech S2(48K高保真,播客/长篇配音)

1. Windows整合包5分钟上手

  1. 下载FishSpeech一键包,解压无中文路径
  2. 双击 fish-speech.exe,自动加载模型
  3. 界面操作要点:
    • 迭代提示长度:低配50–100,高配200–300(控制长文本连贯性)
    • Top-p:0.65–0.75,平衡自然度与不乱读
    • 支持中英日韩混合朗读,自动断句换气

2. 源码部署命令

git clone https://github.com/fishaudio/fish-speech
cd fish-speech
conda create -n fish python=3.11
conda activate fish
pip install -r requirements.txt
python tools/download_model.py
python webui.py --half # 半精度省显存

避坑:模型至少预留15GB磁盘空间,低显存必须加--half参数

官方仓库:https://github.com/fishaudio/fish-speech

五、IndexTTS2(零样本情感克隆,情绪迁移极强)

1. 整合包傻瓜教程

  1. 解压整合包到固态纯英文目录,路径不能有中文/括号
  2. 双击启动程序,等待模型加载(首次5–10分钟)
  3. 操作流程:
    • 上传5–20秒参考人声
    • 文本框输入配音文案,情绪描述:慵懒、轻声谈心、吐槽
    • speed speed数值越大语速越慢,推荐1.2–1.5

2. 源码轻量化部署(6G显存低配)

git clone https://github.com/index-tts/index-tts.git
cd index-tts
python -m venv tts_env
# Windows激活:tts_env\Scripts\activate
pip install -r requirements.txt
# 模型下载
uv tool install modelscope
modelscope download --model IndexTeam/IndexTTS-2 --local_dir checkpoints
# 低显存启动(8bit量化)
uv run webui.py --load_in_8bit

显存优化技巧:开启load_in_8bit、device_map自动CPU卸载

官方仓库:https://github.com/index-tts/index-tts

六、F5-TTS(新一代流畅无割裂,短句口语最强)

极简部署

git clone https://github.com/SWivid/F5-TTS
cd F5-TTS
conda create -n f5tts python=3.10
conda activate f5tts
pip install -r requirements.txt
python gradio_app.py

使用特点

无需复杂音素处理,长句不会生硬断句;5秒短音频即可克隆,适合短视频口播。

七、ChatTTS/GPT-SoVITS/CosyVoice 选型快速教程

需求场景 首选项目 最简上手方式
复刻亲友/博主固定声音、长篇小说 GPT-SoVITS Windows一键整合包
聊天对话、Vlog、带笑声/气口旁白 ChatTTS WebUI离线包,音色抽卡
商用合规、方言配音、3秒快速克隆 CosyVoice2 WSL源码 / Docker
48K广播级播客、多语种长篇 Fish Speech 一键exe整合包
情绪丰富、影视剧情配音 IndexTTS2 量化低显存启动

通用避坑大全(所有TTS通用)

  1. 路径绝对不能含中文、空格、特殊符号,否则模型加载失败
  2. 音频素材必须16K/44.1K wav,无背景音乐、无杂音
  3. 想要真人感:语速统一调低至0.85–0.95,不要默认1.0
  4. 显存<6G:全部开启半精度/8bit量化,单次生成≤300字
  5. 网络差:提前手动下载模型放入项目models文件夹,离线运行