文字能塑造形象,声音同样可以。在AI语音合成领域,提示词工程早已不局限于文字生成,越来越多的模型(如各类支持语音描述的TTS系统)允许用户用自然语言描述想要的声音特质,模型再据此生成对应音频。问题在于,多数人写出来的描述只有一句男声或女声,结果合成的声音毫无辨识度,角色感接近于零。想把一个江湖老者、一个傲娇少女或一个阴沉反派念得活灵活现,你需要在提示词里精准地描述声音的物理特征和说话习惯。这篇文章就来系统地讲讲怎么写。

声音特征描述的五个核心维度
一段完整的声音人设描述,通常可以从五个维度展开:音高、音色质感、语速节奏、气息状态和共鸣位置。这五个维度互相独立又彼此影响,写提示词时尽量都覆盖到,输出的人物感会明显提升。
音高是最容易上手的维度,但不要只写高和低,可以用更具体的参照来描述。比如写音高略低于普通成年男性,接近低沉的电台主播,模型对这类锚定式描述的响应往往比单纯的高低更准确。音色质感则决定声音的年龄感和质地,常用关键词包括沙哑、清脆、浑厚、鼻音重、气声明显、带杂音感等。一个六十岁的老烟枪角色,加上沙哑、胸腔共鸣强烈这两个词,立刻就有画面了。
语速节奏和气息状态经常被忽略,却是角色区分度的重要来源。急性子角色适合语速快、字与字之间几乎不留间隙、偶尔抢拍的描述;而虚弱病人的声音则适合语速缓慢、句间停顿明显、气息短促、每说几个字就要换气。共鸣位置则影响声音的厚度走向:头腔共鸣偏向明亮清脆,适合少女音;胸腔共鸣偏厚偏低沉,适合中老年男性或威严角色;如果写喉音偏重的闷声,则适合蒙面人或戴面具的反派。
下面是一个组合五个维度的完整示例,描述一个饱经风霜的老船夫:
老年男性,音色沙哑粗糙,带明显的海风侵蚀感; 音高偏低,胸腔共鸣厚重; 语速缓慢,词与词之间有拖长的停顿; 气息不稳,长句中间会有明显的换气和叹气; 尾音常常下沉,偶尔夹杂干咳。
这样一段描述丢给支持声音描述的合成模型,生成结果的人物感远超一句老年男声。核心思路是:与其告诉模型这是谁,不如告诉模型这个声音听起来是什么状态。
声线转变关键词清单与使用技巧
角色扮演中经常需要声音状态的变化,比如从平静转为愤怒、从清醒转为虚弱、从伪装到暴露真面目。这类转变需要用到情绪与状态类关键词,它们是声线转变描述的主力。常用的情绪转变词包括:愤怒时音量陡增、音调抬高、咬字用力;悲伤时气声增多、音量减弱、句尾拖长发颤;恐惧时语速加快、声音发抖、气息紊乱;得意时语调上扬、节奏轻快、带笑音。
使用转变关键词时,位置和触发条件很重要。不要笼统地写这段要生气,更好的写法是把转变锚定在具体文本位置上。例如:前三句保持平静克制的低沉语调,从第四句的你居然骗我开始,音量骤然提高,咬字变得凶狠,句尾出现压抑不住的怒气。把转变点绑定到具体台词,模型对时机的把握会准确得多。
另一个实用技巧是设置基准线再叠加变化。先在提示词开头定义角色的默认声线,比如少女音,音色清亮,轻微鼻音,语速轻快,然后再叠加状态偏移,说到秘密两个字时压低音量,转成气声耳语。这种基准加偏移的结构,比直接描述突变状态更稳定,也不容易让模型丢失角色底色。
以下是一段带转变设计的提示词示例:
角色基准:年轻女性,音色偏冷,干净利落, 语速中等偏快,习惯在句尾轻微下沉,显得漠不关心。 剧情转变:在中箭之后,声音逐渐虚弱, 音量一层层降低,气息变得短促, 最后一句只剩气声,字与字之间有明显停顿。
需要注意的是,转变描述一次不要超过两种。如果同一段里又要愤怒又要哽咽还要大笑,模型往往顾此失彼,输出反而混乱。多层次的情绪切换应该拆分成多个片段分别生成,再在后期剪辑中拼接。
常见角色类型的声音描述模板
不同类型的角色有相对固定的声音关键词组合,掌握几套模板后可以快速套用改写。这里给出四类高频角色的描述模板供参考。
第一类是慈祥长者:老年声线,音色温和浑厚,语速偏慢,偶有温和的笑意浮现在尾音,句间停顿从容,像在慢慢讲故事。第二类是阴沉反派:音色低沉偏冷,胸腔共鸣重,语速不疾不徐却带压迫感,咬字清晰利落,像每个字都经过掂量,长时间停顿里隐约透着危险。
第三类是热血少年:年轻男性声线,音量饱满,语速快且充满冲劲,音调起伏大,句尾常常上扬带着不服输的劲儿,兴奋时语速还会进一步加快。第四类是虚弱伤患:声音缺乏力量,气声占比高,每说几个词就要停顿换气,音量小且逐渐衰减,尾音发虚,偶尔伴随轻微的呻吟或急促呼吸。
拿到模板后,改写比原创容易得多。比如把热血少年模板中的音调起伏大改成音调刻意压平,就得到一个故作冷静的少年角色;把阴沉反派模板里的胸腔共鸣重换成喉部挤压的尖锐音色,就变成了癫狂型反派。模板的价值不在于照抄,而在于提供了一个可控的修改起点。
提示词调优的常见坑与应对方法
实际调优过程中,几个高频问题值得提前规避。第一是描述词之间互相矛盾。比如同时要求音色甜美和沙哑沧桑,模型会在两个方向之间摇摆,输出不稳定。遇到这种情况,要判断哪个特征才是角色的核心,保留核心特征,用弱化表述处理次要特征,例如带一丝沙哑感但整体清亮。
第二是描述过长导致重点稀释。有些提示词写了十几行形容词,结果模型只抓住了其中几个词。经验法则是单个声音的描述控制在五行以内,把最能定义角色的三四个关键词放在最前面。模型对提示词开头部分的权重通常更高,核心特征前置是个简单有效的习惯。
第三是忽略负面描述。有时候说清楚不要什么比说要什么更有用,比如不要机械感、不要明显的电子音、避免字正腔圆的播音腔。不少合成模型支持这类否定式指令,能显著减少出戏感。此外,多轮迭代时建议每次只改一个变量,改动音高就保持语速描述不变,这样才能准确判断哪次修改带来了效果提升,否则改进和退化混在一起,很难定位原因。
最后提醒一点:声音描述提示词的效果与具体模型强相关,同一套描述在不同模型上的表现差异可能很大。建议针对自己常用的模型建立一份关键词效果笔记,记录哪些词响应明显、哪些词基本无效,逐步沉淀出属于自己的描述词库。用文字指挥声音,本质上是一个不断试错、不断逼近的过程,而一份结构化的关键词积累,能让这个过程快上许多。