零样本克隆Zero-shot
5-10 秒参考音频即可复刻目标音色,无需训练与微调。
Features
音色来自参考音频,情感可另选音频、向量或文本描述,时长可按目标秒数对齐。
5-10 秒参考音频即可复刻目标音色,无需训练与微调。
四种模式:同音色、参考情感音频、情感向量滑块、文本描述情感。
按目标时长生成语音,适用于需要与画面同步的配音场景。
开始任务、任务记录、参考音色、模型管理、设置五个页面。
多任务排队生成,历史结果可回放、导出与重复使用。
模型不随安装包分发,首次运行按清单下载与校验。
应用内激活,支持检查新版本并下载更新。
安装向导自动创建桌面与开始菜单快捷方式,开箱可用。
中文、日文与粤语混合文本,经多语言分词器统一处理。
Engine
基于 IndexTTS2.5,文本经分词后由自回归模型生成语义标记,再经扩散与声码器还原波形。
01 / 音色参考
从参考音频中提取音色与可选的片段区间。
w2v-bert-2.002 / 文本预处理
数字、英文缩写与标点按规则展开后分句编码。
tiktoken03 / 情感建模
八类情感标签与情感向量,或由文本描述推导风格。
qwen0.6bemo404 / 自回归生成
按采样参数逐帧生成,时长控制在此生效。
gpt.pth · num_beams 305 / 声码还原
扩散模型与声码器输出 WAV 文件,可回放与导出。
s2mel.pth · codec.pth当前阶段:音色参考 · 提取说话人特征 20%
Scenarios
视频解说与广告配音
有声书与播客录制
多语言内容本地化
课件与培训语音
游戏与虚拟角色对白
音色样本整理与试听
Download
安装向导会创建桌面与开始菜单快捷方式;首次启动时软件自动下载并校验所需模型。
https://tts.qzent.ai/releases/TuTuShuVoiceClonePro-Setup-1.0.3.exe
SHA256 0c7d8781d168eb402c60b7ee15e42ff43bf4923433b79366999e4239acc9eefa
releases/ 下;模型与用户数据默认写入 %APPDATA%\兔兔薯语音克隆器 Pro,卸载时可选择保留。
直连不理想时改用云盘镜像,同一安装包,免登录、无需客户端。
提取码待填写
扫码加入用户群,获取更新提醒与使用答疑。
Quick Start
运行安装包,按向导完成后双击桌面快捷方式启动「兔兔薯语音克隆器 Pro」。
进入「模型管理」,按清单下载并校验所需模型文件。
在「开始任务」导入参考音频,可拖拽波形选定片段,不选则使用完整音频。
填写待合成文本,选择情感模式、时长控制与 FP16 加速等选项。
点击「生成」,任务完成后在「任务记录」回放或导出 WAV 文件。
Requirements
Tech Stack
上游为开源项目 IndexTTS2,本工具在其之上提供 Windows 桌面封装与模型管理。
FAQ
当前版本以 CUDA 推理为主,需要 NVIDIA 独立显卡,推荐 8 GB 以上显存并安装 CUDA 12.8 或更高版本驱动。
不需要。安装包内已包含启动器与环境管理组件,首次启动时由软件自动下载约 3 GB 的 AI 运行环境,无需手动配置 Python。
为了控制安装包体积,AI 运行环境与模型文件不随安装包分发。软件会在「模型管理」中按清单下载并校验,完成后即可离线合成。
不会。下载模型需要联网,合成过程在本机显卡上完成,参考音频与文本不经过云端接口。激活状态由授权服务校验。
默认写入 %APPDATA%\兔兔薯语音克隆器 Pro,包含 env、checkpoints 与 outputs 三个目录;卸载时可选择一并删除或保留。
可改用页面上的蓝奏云备用链接下载同一安装包;若两条链接都不可用,请通过用户群反馈。
支持中文、日文与粤语混合文本,由多语言分词器统一处理;数字、英文缩写等易读错的混合 token 会在送模型前自动展开。