共振峰、频谱与“明亮厚重”的来源

同样的音高可以听起来完全不同。关键不只在声带振动多快,还在声音经过怎样的共振与频谱塑形。

先有声源,再经过滤波

一个实用的近似是声源—滤波器模型:声带周期振动提供基频与泛音,咽腔、口腔和鼻腔等通道对不同频率进行增强或削弱。被显著增强的频带形成共振峰。改变舌位和口型,即使基频保持不变,也会改变元音和音色。

这解释了为什么“音高较低”不自动等于“声音厚重”,也为什么模仿口型或改变共鸣位置能明显改变听感。

频谱统计在描述什么

特征直观含义常见误区
频谱中心频谱能量的“重心”,偏高时常与明亮或锐利相关。它不是某个固定共振峰,也会被噪声推高。
频谱滚降累计能量达到某比例时对应的频率,反映高频延伸。编码、麦克风频响和齿音都会改变它。
频谱平坦度频谱更像清晰谐波还是更像均匀噪声。高平坦度不等于“音质差”,气声和环境声本就不同。
共振峰声道滤波造成的局部谱峰。自动估计会受基频、元音、采样率和参数影响。

麦克风也在参与“塑形”

近距离录音可能增加低频,偏轴录音会削弱部分高频,房间反射会制造新的峰谷,手机的降噪和自动增益还会随时间改变频谱。因此算法首先测量的是“说话者 + 内容 + 房间 + 设备 + 处理链”共同产生的文件。

CVoice 用多种频谱统计组成听感维度;Reborn 还会结合瞬态、事件密度和动态范围判断声形。它们都不把单一频谱数字直接翻译成人的身份。

共振提供线索,不提供身份证明

声道结构、发音动作、语言、训练、情绪和设备都能影响共振。群体之间可能存在统计趋势,但单条录音的分布大量重叠。将共振峰用于“这段录音听起来偏明亮”属于描述;用它确认真实性别、年龄或身体结构,则越过了证据能够支持的范围。

阅读标签的方法把“温暖、清亮、厚重”看作当前录音在一组设计维度中的相对位置,而不是说话者不可改变的本质。

参考资料