文字转语音参数怎么调才自然
用 ChatTTS 生成语音,默认参数能出声,但「自然」二字往往差在几组滑块上。本篇按「想要什么听感」来对号入座:嫌平调哪个、嫌飘调哪个、换嗓子动哪个。还没装上的,先看 安卓手机文字转语音怎么弄.md。
一、先记住三层结构
ChatTTS 界面上的可调项看着多,其实就三层:
- 换嗓子:动 Audio Seed(音调音色)——它是「这个人是谁」;
- 调语气:动 temperature、top_P、top_K——它们是「这个人说话的状态」;
- 改断句:动 Text Seed(文本种子)和 Refine text(符号文本优化)——它们管「这句话怎么断、哪里垫语气词」。
调音先定位问题在这三层里的哪一层,再动对应的组,比挨个滑块试快得多。
二、按听感对号入座
读得太平,像念稿。 把 temperature(背景噪声强度)往上推一点,0.7 是常见起点,可以试到 0.8~0.9;语气起伏会明显变大。还不够就放宽 top_P。
发音忽高忽低,字不稳。 反着来:top_P、top_K 收小(比如 top_P 从 0.9 收到 0.7、top_K 从 50 收到 20),temperature 也回一点。收敛之后声音会更「稳」,但太稳又回到念稿,两头找一个中间值。
想换一副嗓音。 别去动参数,换 Audio Seed。内置音色就是几个调好的种子值,下拉逐个试;听感接近了,再用同一音色去细调语气层。
断句和语气不对味。 同一段文字换一个 Text Seed,断句、垫词会整体重排——点「随机生成」多抽几次,挑最顺耳的一条,比手工改文本快。想让模型自动补停顿和语气标记,保持 Refine text 勾选即可。
三、两个省时间的习惯
- 一次只动一组。 同一轮里同时改 temperature 和换音色,好听不好听都不知道归功谁。改一组、听一遍、留下或还原。
- 好结果记种子。 某次的嗓音和断句特别满意,把当时的 Audio Seed 和 Text Seed 数值记下来——同样的种子组合,下次还能生成出很接近的声音。
各参数在界面上的位置和生成流程,ChatTTS 专题站的参数速览一节有逐项截图对照,边调边看更快。