先有聲源,再經過濾波
一個實用的近似方法是聲源—濾波器模型:聲帶的週期振動提供基頻與泛音,咽腔、口腔與鼻腔等通道則對不同頻率進行增強或削弱。明顯被增強的頻帶會形成共振峰。即使基頻不變,只要改變舌位與口型,也會改變母音與音色。
這也解釋了為什麼「音高較低」不會自動等於「聲音厚重」,以及為什麼改變口型或共鳴位置,會明顯改變聽感。
頻譜統計在描述什麼
| 特徵 | 直觀意義 | 常見誤解 |
|---|---|---|
| 頻譜中心 | 頻譜能量的「重心」,偏高時通常與較明亮或銳利的聽感有關。 | 它不是某個固定的共振峰,也可能被噪音拉高。 |
| 頻譜滾降 | 累積能量達到某個比例時所對應的頻率,可反映高頻延伸程度。 | 編碼、麥克風頻率響應與齒音都會改變它。 |
| 頻譜平坦度 | 頻譜更像清楚的諧波,還是更像均勻的噪音。 | 高平坦度不等於「音質差」,氣聲與環境聲本來就具有不同的頻譜特性。 |
| 共振峰 | 由聲道濾波形成的局部頻譜峰值。 | 自動估算會受到基頻、母音、取樣率與參數設定影響。 |
麥克風也參與了「塑形」
近距離錄音可能增加低頻,偏離麥克風軸線會削弱部分高頻,房間反射會產生新的峰谷,手機的降噪與自動增益還可能隨時間改變頻譜。因此演算法首先測量到的,是「說話者 + 內容 + 房間 + 裝置 + 處理鏈」共同產生的檔案。
CVoice 會用多種頻譜統計組成聽感維度;Reborn 還會結合瞬態、事件密度與動態範圍來判斷聲音型態。兩者都不會把單一頻譜數值直接翻譯成人的身分。
共振能提供線索,但不能提供身分證明
聲道結構、發音動作、語言、訓練、情緒與裝置都會影響共振。不同群體之間可能存在統計趨勢,但單一錄音的分布大量重疊。用共振峰描述「這段錄音聽起來偏明亮」屬於合理描述;若用來確認真實性別、年齡或身體結構,就超出了證據能支援的範圍。
如何閱讀標籤把「溫暖、清亮、厚重」看成目前這段錄音在一組設計維度中的相對位置,而不是說話者不可改變的本質。