TTS Studio 是一个开源的文字转语音工具,内建 322 个 AI 音色并支持 75 种语言,用来将字幕文件(SRT / VTT)或者纯文本转成多语音频,适合需要制作多语版配音的内容创作者。用 Docker 部署大约十分钟搞定,自建 VPS、NAS 或者个人电脑都可以运行,免费、无月费、无 API 调用费用。
什么是 TTS Studio?
TTS Studio 是一个开源的字幕转语音(Text-to-Speech)工具,主要用途是将现成的字幕文件(SRT 或者 VTT 格式)或者直接输入的文字,通过 AI 合成做自然语音文件(MP3)。对于制作多语版本的短片和 podcast 的创作者来说,可以节省大量逐句录音的时间。
工具内建 322 个音色,覆盖 75 种语言,包括中文(普通话 / 广东话 / 台湾国语等多种口音)、英文(美式 / 英式 / 澳洲等)、日文、韩文、法文、德文、西班牙文等等。用户可以在 web 界面直接输入文字试听效果,再微调语速和音量,适合直接达到 publish 级别的成品质素。
工具同时支持时间轴自动对齐 — 将字幕时间码直接带入生成的音频,长度与原片匹配,无需手动逐段对位。还内置用户认证、生成历史记录、明暗主题切换等实用功能。
322 个音色 + 75 种语言:哪类内容最适用?
TTS Studio 的 322 个音色库并不是均匀分布 — 主流语言(英、日、韩、法、德、西)每个都有几十个男、女、童声、特殊风格选择,小众语言(例如广东话、阿拉伯语、越南语等)也至少有 3-5 个音色。
实际应用场景包括:
- 多语版教学短片:原本普通话或者英文的教学频道,可以用工具批量生成日文、韩文、泰文版本配音,配合多声轨功能上架
- Podcast 多语版:原本粤语 podcast 想出英文版本给海外听众,可以用英文音色配
- 电子学习内容:学校或者培训机构批量生成多语版教材
- 产品 demo 配音:SaaS 公司要快速生成多语版产品示范配音
- YouTube Shorts 自动化:批量产生短片配音
工具的限制:合成出来的音色虽然自然,但对特定品牌声线(例如想模仿某 KOL 的招牌语气)未必能 100% 还原;商业品牌配音通常还需要人工微调。但对于一般内容创作或者多语初版来说,已经足够。
Docker 部署准备:硬件 + 软件需求
TTS Studio 提供 arm64 和 x86 双架构 Docker 镜像,也就是说 Windows、Mac(Intel 或者 Apple Silicon)、Linux VPS、NAS(Synology / QNAP)等几乎所有可以运行 Docker 的平台都可以部署。
最低系统要求:
- 处理器:1 核心已足够(合成主要是 GPU 或者云端 API 不需要本地计算)
- 内存:建议 1 GB 以上
- 硬盘空间:500 MB(Docker 镜像)
- 网络:初次部署需要下载镜像和 TTS 模型文件,大约 200-500 MB
- 操作系统:Linux / macOS / Windows 10+(支持 Docker Desktop / OrbStack / Rancher Desktop)
如果部署在云端 VPS,选择 1 GB RAM、1 vCPU 的入门规格已经够用。如果想用本地电脑运行,Apple Silicon Mac 会比较省电(arm64 镜像原生支持),而 Intel Mac 或者 Windows 机器就用 x86 镜像。
Docker Compose 一键部署
官方提供的 docker-compose.yml 相当简洁,整个部署只需要一个 service:
“`yaml
version: ‘3’
services:
tts-studio:
image: ywsj/tts-studio:latest
container_name: tts-studio
ports:
– “5100:5100”
environment:
– ADMIN_USERNAME=admin
– ADMIN_PASSWORD=admin123
restart: unless-stopped
“`
重点配置:
- Port 5100:可以改成自己喜欢的 port,记得同步改 host 和 container 两边
- 默认账号 admin / 密码 admin123:部署完成后必须立即改密码(环境变量或者 web 界面 settings)
- restart: unless-stopped:VPS 重启后自动恢复服务
部署步骤(Linux / Mac / WSL):
“`bash
# 1. 创建工作目录
mkdir -p ~/tts-studio && cd ~/tts-studio
# 2. 创建 docker-compose.yml(用上面的 yaml 内容)
# nano 或 vim 都可以
# 3. 启动容器
docker compose up -d
# 4. 查看状态
docker compose ps
“`
成功启动后,在浏览器输入 VPS 的 IP 加上 port(默认 5100)就能看到登录界面。⚠️ **记得在云端控制台开启对应 port 的 firewall 规则**(例如 AWS Security Group、Cloudflare Tunnel、nginx reverse proxy 等),否则外部网络无法访问。
使用教学:第一次生成多语语音
登录后的 web 界面分三个步骤:
**第一步:上传字幕或者输入文字**
工具支持直接上传 SRT 或者 VTT 字幕文件,或者在文本框直接输入纯文本。如果是上传字幕文件,生成出来的语音会自动对齐时间轴长度,方便后续剪辑和配音同步。
**第二步:选择语言和音色**
语言选单列出支持的 75 种语言,每种语言都有几个至几十个不同音色选择。音色标签通常会标明性别、年龄和风格(例如「男声 – 沉稳」、「女声 – 开朗」、「童声」等)。选择后可以即时试听效果,确认音色、语速(slow / normal / fast)、音量都满意后再正式生成。
**第三步:生成并下载 MP3**
点击「开始生成」后,后台会启动 TTS 引擎合成音频。生成时间视乎文本长度和音色复杂程度,通常一段 1-3 分钟的配音大约需要 30 秒至 2 分钟合成时间。完成后可以即时在 web 界面试听和下载 MP3。
上手后的最佳实践:短片多声轨工作流
如果你的最终目标是上传到 YouTube 多声轨功能(Multi-language audio tracks),以下是一个完整工作流:
1. 在 YouTube 短片后台「字幕」分页,原本的字幕默认是主要语言。点击「添加语言」选择目标语言(例如日文、韩文),然后上传对应语言的字幕文件。
2. 在「音讯」分页为每种语言上传对应的配音音档。TTS Studio 生成的 MP3 已经自动对齐时间轴,直接上传即可。
3. 设置「默认音轨」为你的主要语言版本。其余语言会在短片播放器的设置中让观众选择切换。
⚠️ **注意**:YouTube 多声轨功能需要短片本身通过审核后才会启用,通常上架后 24-48 小时内会自动显示。如果不确定自己的短片有没有这个功能,可以在 YouTube 后台「字幕」分页确认「添加语言」按钮有没有出现。
注意事项 + 限制
**TTS 音色自然,但对特定品牌腔调不可能 100% 还原。**如果观众对特定 KOL、品牌或者角色的声线很熟悉,TTS 生成的合成音色虽然自然,但通常都会被认出是 AI 生成。商业品牌配音通常还需要人工微调或者混音。
**字幕翻译需要另外的工具。**TTS Studio 只负责合成语音,不包括翻译。如果你的来源语言是中文,但想生成英文版本的配音,需要先用其他工具(例如 Google Translate、DeepL、ChatGPT、Claude)翻译字幕,再用 TTS Studio 生成英文配音。
**首次部署需要下载 200-500 MB 模型文件。**视乎 VPS 的网络速度,可能需要 5-15 分钟。之后使用就直接用本地模型,无需再下载。
**默认账号 admin / admin123 必须立即更改。**工具的默认登录凭证是公开信息,任何人只要知道 VPS IP 和 port 就可以登录。部署后第一件事就是改密码,或者通过 Cloudflare Access、Tailscale 等在前面加一层认证。
结论:自建多语配音工具,谁最适用?
TTS Studio 用 Docker 部署简单,内建 322 个音色支持 75 种语言,加上字幕自动对齐、用户认证、明暗主题等实用功能,对于想做多语版内容的创作者来说是一个高性价比的选择。
**最适用的用户**:
- YouTube 创作者想做多语版频道
- 教育 / 培训机构要批量制作多语教材
- SaaS 公司要快速制作多语版产品 demo
- Podcast 主持想将单语节目扩展到多语听众
- 中小企业要做多语客服 / 教学短片或 podcast 但预算有限
**未必适合的用户**:
- 需要 100% 模仿特定 KOL / 品牌声线的商业配音
- 需要支持非常规语言(例如少数民族语言、方言等)
- 完全没有 IT 背景的用户(Docker 部署对新手有学习曲线)
如果你的使用情境符合以上任何一项,TTS Studio 都值得花一个小时部署和测试。比起商业 TTS API 的月费(每千字几美元),自建成本只是一笔一次性的 VPS 月费(最便宜 USD $5 左右)。

