兔兔薯语音克隆器 Pro 兔兔薯语音克隆器 Pro tts.qzent.ai

v1.0.3 Windows 10 / 11 桌面应用 · 本机推理

兔兔薯语音克隆器 Pro Windows 桌面语音合成工具

上传 5-10 秒参考音频与文本,即可复刻音色并合成语音;情感与时长可独立控制,全部在显卡上本机完成。

无需 Python 环境 推理不出本机 CUDA 12.8 加速

开始任务 IndexTTS2.5 已激活

音色参考音频 ref_voice_01.wav · 00:08

片段 00:01-00:07

合成文本

今天多云转晴,出门记得带上外套。

生成中 · 82%
旁白_第三段.wav 已激活
对白_角色A.wav 已完成
广告词_女声.wav 已完成

Features

克隆、情感与时长分开控制

音色来自参考音频,情感可另选音频、向量或文本描述,时长可按目标秒数对齐。

零样本克隆Zero-shot

5-10 秒参考音频即可复刻目标音色,无需训练与微调。

情感控制Emotion

四种模式:同音色、参考情感音频、情感向量滑块、文本描述情感。

时长控制Duration

按目标时长生成语音,适用于需要与画面同步的配音场景。

桌面界面PySide6 GUI

开始任务、任务记录、参考音色、模型管理、设置五个页面。

任务队列Queue

多任务排队生成,历史结果可回放、导出与重复使用。

模型管理Models

模型不随安装包分发,首次运行按清单下载与校验。

激活与更新License

应用内激活,支持检查新版本并下载更新。

一键安装Installer

安装向导自动创建桌面与开始菜单快捷方式,开箱可用。

多语言文本Multilingual

中文、日文与粤语混合文本,经多语言分词器统一处理。

Engine

推理链路

基于 IndexTTS2.5,文本经分词后由自回归模型生成语义标记,再经扩散与声码器还原波形。

推理链路:文本 → BPE 分词 → GPT 自回归 → Diffusion → BigVGAN → WAV

01 / 音色参考

提取说话人特征

从参考音频中提取音色与可选的片段区间。

w2v-bert-2.0

02 / 文本预处理

展开易读错的混合 token

数字、英文缩写与标点按规则展开后分句编码。

tiktoken

03 / 情感建模

按模式给出情感条件

八类情感标签与情感向量,或由文本描述推导风格。

qwen0.6bemo4

04 / 自回归生成

生成语义标记序列

按采样参数逐帧生成,时长控制在此生效。

gpt.pth · num_beams 3

05 / 声码还原

还原 22 kHz 波形

扩散模型与声码器输出 WAV 文件,可回放与导出。

s2mel.pth · codec.pth

当前阶段:音色参考 · 提取说话人特征 20%

显存要求 推荐 8 GB 以上显存,CUDA 12.8 或更高版本驱动;开启 FP16 可降低占用。
首次启动 自动下载 AI 运行环境与模型,约 3 GB 环境加约 3 GB 模型,需要预留磁盘空间。
数据边界 模型下载需要联网,音频与文本的推理在显卡上本机完成,不上传素材内容。

Scenarios

常见用途

视频解说与广告配音

有声书与播客录制

多语言内容本地化

课件与培训语音

游戏与虚拟角色对白

音色样本整理与试听

Download

下载与安装

安装向导会创建桌面与开始菜单快捷方式;首次启动时软件自动下载并校验所需模型。

兔兔薯语音克隆器 Pro v1.0.3 20261007
  • 适用平台Windows 10 / 11 64 位
  • 安装包大小约 38 MB
  • 图形界面PySide6 原生窗口
  • 运行环境首次启动自动下载
  • 模型文件按清单下载与校验
  • 显卡NVIDIA · 推荐 8 GB 显存以上
下载 TuTuShuVoiceClonePro-Setup-1.0.3.exe
https://tts.qzent.ai/releases/TuTuShuVoiceClonePro-Setup-1.0.3.exe
SHA256 0c7d8781d168eb402c60b7ee15e42ff43bf4923433b79366999e4239acc9eefa
安装包需放在站点部署根目录的 releases/ 下;模型与用户数据默认写入 %APPDATA%\兔兔薯语音克隆器 Pro,卸载时可选择保留。

Quick Start

五步完成一次合成

  1. 01 安装并启动

    运行安装包,按向导完成后双击桌面快捷方式启动「兔兔薯语音克隆器 Pro」。

  2. 02 下载模型

    进入「模型管理」,按清单下载并校验所需模型文件。

  3. 03 准备音色参考

    在「开始任务」导入参考音频,可拖拽波形选定片段,不选则使用完整音频。

  4. 04 输入文本并调参

    填写待合成文本,选择情感模式、时长控制与 FP16 加速等选项。

  5. 05 生成与导出

    点击「生成」,任务完成后在「任务记录」回放或导出 WAV 文件。

Requirements

系统要求

运行环境

  • 操作系统Windows 10 / 11 64 位
  • Python无需安装 · 随包分发
  • 安装包约 38 MB
  • 磁盘预留约 6 GB 以上

显卡与驱动

  • 显卡NVIDIA 独立显卡
  • 显存推荐 8 GB 以上
  • CUDA12.8 或更高驱动
  • 加速FP16 可降低占用

模型与数据

  • 核心模型IndexTTS-2.5
  • 情感模型qwen0.6bemo4-merge
  • 获取方式首次运行自动下载
  • 输出格式WAV · 22 kHz

Tech Stack

技术栈

上游为开源项目 IndexTTS2,本工具在其之上提供 Windows 桌面封装与模型管理。

  • IndexTTS2.5语音合成模型
  • PySide6图形界面
  • PyTorch + CUDAGPU 推理
  • BigVGAN v222 kHz 声码器
  • w2v-bert-2.0说话人特征提取
  • MaskGCT语义编码
  • Qwen 0.6B Emo文本情感描述
  • tiktoken多语言分词
  • NSISWindows 安装向导

FAQ

常见问题

没有 NVIDIA 显卡可以使用吗?

当前版本以 CUDA 推理为主,需要 NVIDIA 独立显卡,推荐 8 GB 以上显存并安装 CUDA 12.8 或更高版本驱动。

需要自己安装 Python 或依赖吗?

不需要。安装包内已包含启动器与环境管理组件,首次启动时由软件自动下载约 3 GB 的 AI 运行环境,无需手动配置 Python。

首次启动为什么要下载这么多内容?

为了控制安装包体积,AI 运行环境与模型文件不随安装包分发。软件会在「模型管理」中按清单下载并校验,完成后即可离线合成。

音频与文本会上传吗?

不会。下载模型需要联网,合成过程在本机显卡上完成,参考音频与文本不经过云端接口。激活状态由授权服务校验。

模型和输出文件放在哪里?

默认写入 %APPDATA%\兔兔薯语音克隆器 Pro,包含 env、checkpoints 与 outputs 三个目录;卸载时可选择一并删除或保留。

直连下载慢或打不开怎么办?

可改用页面上的蓝奏云备用链接下载同一安装包;若两条链接都不可用,请通过用户群反馈。

支持多语言文本吗?

支持中文、日文与粤语混合文本,由多语言分词器统一处理;数字、英文缩写等易读错的混合 token 会在送模型前自动展开。