先有声源,再经过滤波
一个实用的近似是声源—滤波器模型:声带周期振动提供基频与泛音,咽腔、口腔和鼻腔等通道对不同频率进行增强或削弱。被显著增强的频带形成共振峰。改变舌位和口型,即使基频保持不变,也会改变元音和音色。
这解释了为什么“音高较低”不自动等于“声音厚重”,也为什么模仿口型或改变共鸣位置能明显改变听感。
频谱统计在描述什么
| 特征 | 直观含义 | 常见误区 |
|---|---|---|
| 频谱中心 | 频谱能量的“重心”,偏高时常与明亮或锐利相关。 | 它不是某个固定共振峰,也会被噪声推高。 |
| 频谱滚降 | 累计能量达到某比例时对应的频率,反映高频延伸。 | 编码、麦克风频响和齿音都会改变它。 |
| 频谱平坦度 | 频谱更像清晰谐波还是更像均匀噪声。 | 高平坦度不等于“音质差”,气声和环境声本就不同。 |
| 共振峰 | 声道滤波造成的局部谱峰。 | 自动估计会受基频、元音、采样率和参数影响。 |
麦克风也在参与“塑形”
近距离录音可能增加低频,偏轴录音会削弱部分高频,房间反射会制造新的峰谷,手机的降噪和自动增益还会随时间改变频谱。因此算法首先测量的是“说话者 + 内容 + 房间 + 设备 + 处理链”共同产生的文件。
CVoice 用多种频谱统计组成听感维度;Reborn 还会结合瞬态、事件密度和动态范围判断声形。它们都不把单一频谱数字直接翻译成人的身份。
共振提供线索,不提供身份证明
声道结构、发音动作、语言、训练、情绪和设备都能影响共振。群体之间可能存在统计趋势,但单条录音的分布大量重叠。将共振峰用于“这段录音听起来偏明亮”属于描述;用它确认真实性别、年龄或身体结构,则越过了证据能够支持的范围。
阅读标签的方法把“温暖、清亮、厚重”看作当前录音在一组设计维度中的相对位置,而不是说话者不可改变的本质。