在AI语音合成工具中,提示词不仅仅是一串文字,而是对目标声音的完整画像。一个只写温柔女声的提示词,模型可能生成十种完全不同的声音;而加上年龄、音色、语速、情感和场景限定后,输出结果会稳定得多。本文将围绕音色年龄性别描述词和说话风格关键词库展开,并给出可以直接复制使用的提示词模板。

音色描述的核心维度:年龄、性别与声学特征
音色本身是一个复合概念,它由基频、共振峰、谐波成分、气息噪声以及发声方式共同决定。在提示词中,我们通常不需要直接写这些声学术语,而是用感知层面的描述词来替代。年龄和性别是影响音色最直接的两个维度:年龄决定了基频和音高的总体范围,性别则影响共振峰分布和发声习惯。比如同样是女声,儿童女声和青年女声在音高和气息感上差异明显,而中年男声和老年男声在沙哑程度、音强稳定性上又有不同。
实际使用时,建议把年龄词和音色词组合起来写。年龄词可以包括童声、少年声、青年声、中年声、老年声,也可以写成4至8岁、20至30岁等区间。音色词则负责描述更细的听感,例如清亮、明亮、圆润、浑厚、低沉、沙哑、磁性、甜美、干净、温柔、冷峻、慵懒、带气声、奶声奶气、沧桑、柔和、有力、单薄、穿透力强等。性别维度除了男声、女声,还可以使用中性声、偏女性化男声、偏男性化女声等更灵活的表述。
下面的表格整理了不同年龄段的常用音色描述词,以及适合搭配的性别表达方式。提示词写得越具体,模型越容易命中你想要的发声位置和音色气质。
| 年龄区间 | 常见音色描述词 | 性别表达建议 |
|---|---|---|
| 儿童声 | 奶声奶气、清脆、稚嫩、音高偏高、气息短促 | 女孩声、男孩声、中性童声 |
| 少年声 | 略带沙哑、明亮、单薄、变声期感、干净 | 少年女声、少年男声 |
| 青年声 | 清亮、圆润、磁性、甜美、有活力、气声自然 | 青年女声、青年男声、中性声 |
| 中年声 | 浑厚、沉稳、沧桑、略带沙哑、气息稳定 | 中年女声、中年男声 |
| 老年声 | 苍老、沙哑、语速偏慢、气息较弱、颤音明显 | 老年女声、老年男声 |
还需要注意,音色描述词之间可能存在冲突,例如同时写清亮和低沉会让模型难以判断。建议每个提示词中只保留1至2个核心音色词,再搭配1至2个附加修饰词。像干净清亮、略带沙哑这种组合是安全的,但清亮又浑厚又沙哑就会互相打架。
说话风格关键词库:从场景到情感表达
说话风格决定的是声音的节奏、语气、情绪和重音习惯。相同的音色在不同风格下会呈现出完全不同的效果:一个青年女声可以用新闻播报的方式说话,也可以用短视频解说的方式说话,前者更正式,后者更口语化。写提示词时如果只描述音色而不描述说话风格,生成结果可能会与你的使用场景脱节。
常见的说话风格可以按场景分成播报类、叙述类、对话类、解说类和角色扮演类。播报类包括新闻播报、应急广播、体育解说等,常用关键词有正式、客观、语速适中、重音清晰、停顿规范、字正腔圆。叙述类包括有声小说、纪录片旁白、散文朗读等,关键词有自然、情感饱满、语气平稳、随情节变化、沉浸感强。对话类包括短视频口播、直播互动、虚拟客服等,关键词有口语化、亲切、轻松、节奏明快、互动感强。解说类包括游戏解说、赛事解说、知识科普等,关键词有活泼、紧凑、重点突出、情绪张弛有度。角色扮演类则更自由,可以使用甜美少女、高冷御姐、热血少年、慈祥老者等带有人设感的描述。
情感词和语气词需要单独写出来,因为它们直接影响模型的韵律和能量分布。例如一句平静的叙述和一个充满悬念的解说,在语调和停顿上差别很大。推荐使用好奇、热情、冷静、悲伤、惊喜、温柔、克制、愤怒、慵懒、坚定、犹豫等情感词。语气词可以用自然、夸张、克制、强调、轻快、缓慢、干脆、柔和等。下面的代码块展示了一个按场景拆分的说话风格提示词写法。
[场景] 短视频知识科普 [说话风格] 口语化、轻松自然、重点突出、句末干净 [情感语气] 好奇、热情但不夸张 [语速节奏] 稍快,每分钟约280字,短句停顿明显 [场景] 自然纪录片旁白 [说话风格] 稳重、缓慢、叙述感强、停顿充分 [情感语气] 克制、深邃、略带敬畏 [语速节奏] 偏慢,句与句之间留0.5秒以上停顿 [场景] 有声小说单人演播 [说话风格] 角色感强、对话自然、旁白清晰 [情感语气] 随情节变化,悲伤时气息加重,激动时语速加快 [语速节奏] 中等,叙事段落平稳,冲突段落紧凑
需要注意的是,不同的语音合成平台对提示词的解析能力不同。有些模型更擅长自然语言描述,有些则对罗列式关键词更敏感。如果平台支持自然语言提示,可以写成一段话;如果只支持标签式输入,就使用方括号加短语的结构。无论哪种方式,场景词、风格词、情感词和节奏词都是优先级最高的信息。
提示词组合公式与实战模板
把前面提到的维度组合起来,就能形成一套稳定的提示词公式:音色特征加年龄性别加说话风格加情感语气加语速节奏加场景限定。这个公式不需要每次都完整写出所有项目,但至少应该包含音色、年龄、风格和场景四个核心维度。只写温柔女声会丢失年龄和场景信息,只写纪录片旁白又缺少音色和性别信息,都会导致输出不稳定。
一个更可靠的写法是使用方括号标签,把不同维度分开,例如音色、年龄、风格、语速、情绪、场景。这样既方便阅读,也便于模型理解。下面的模板可以直接复制到主流TTS系统或语音合成平台中使用。
短视频知识解说模板: [音色] 青年女声,干净明亮,带轻微气声 [年龄] 25岁左右 [风格] 知识科普解说,口语化,自然流畅 [语速] 稍快,每分钟约280字 [情绪] 好奇、热情但不夸张 [场景] 抖音或快手短视频旁白 纪录片旁白模板: [音色] 中年男声,低沉浑厚,磁性,气息稳定 [年龄] 45岁左右 [风格] 自然纪录片旁白,稳重、缓慢、叙述感强 [语速] 偏慢,留足停顿 [情绪] 克制、深邃 [场景] 自然风光纪录片 有声小说女主模板: [音色] 青年女声,清亮柔和,可轻微沙哑 [年龄] 22岁 [风格] 都市言情小说女主,对话感强,情感变化丰富 [语速] 中等,随情节起伏 [情绪] 温柔、倔强,悲伤时气息加重 [场景] 有声书单人演播 智能客服模板: [音色] 青年女声,甜美柔和,不带攻击性 [年龄] 28岁 [风格] 客服应答,礼貌耐心,语速均匀 [语速] 中等偏慢 [情绪] 亲切积极 [场景] 电话客服或在线智能客服
如果平台支持负向提示词,也可以把不希望出现的声音特征写进去,例如机械感、电流声、鼻音过重、语速过快、咬字含糊、情绪平淡等。负向提示词可以帮助排除一些常见问题。以下是一个JSON格式的请求示例,展示了正向和负向提示词的配合方式。
{
"text": "欢迎来到今天的知识分享。",
"voice_prompt": {
"positive": "青年女声,干净明亮,带轻微气声,25岁左右,短视频知识科普风格,口语化,语速稍快,情绪热情自然",
"negative": "机械感,电流声,鼻音过重,语速忽快忽慢,咬字含糊,情绪平淡"
},
"speed": 1.1,
"pitch": 0.0
}
在实际测试中,如果第一次生成的声音不符合预期,不要急着推翻整个提示词,可以先调整其中一个维度。例如音色已经对了但语速太慢,就单独把语速从中等改成稍快;如果情绪太冷淡,就加入热情或亲切等情感词。通过逐项微调,你会逐渐建立自己对这套关键词库的敏感度,最终形成一套适合自己项目的提示词模板。
音色年龄性别描述词与说话风格关键词库并不是死的清单,而是一套可以灵活组合的描述体系。掌握核心维度和组合公式后,无论是制作有声书、短视频配音、游戏角色语音,还是企业客服语音,都能更稳定地控制输出效果。