共振峰、頻譜與「明亮厚重」的來源

相同的音高,聽起來也可以完全不同。關鍵不只在聲帶振動有多快,也在聲音經歷了什麼樣的共振與頻譜塑形。

先有聲源,再經過濾波

一個實用的近似方法是聲源—濾波器模型:聲帶的週期振動提供基頻與泛音,咽腔、口腔與鼻腔等通道則對不同頻率進行增強或削弱。明顯被增強的頻帶會形成共振峰。即使基頻不變,只要改變舌位與口型,也會改變母音與音色。

這也解釋了為什麼「音高較低」不會自動等於「聲音厚重」,以及為什麼改變口型或共鳴位置,會明顯改變聽感。

頻譜統計在描述什麼

特徵直觀意義常見誤解
頻譜中心頻譜能量的「重心」,偏高時通常與較明亮或銳利的聽感有關。它不是某個固定的共振峰,也可能被噪音拉高。
頻譜滾降累積能量達到某個比例時所對應的頻率,可反映高頻延伸程度。編碼、麥克風頻率響應與齒音都會改變它。
頻譜平坦度頻譜更像清楚的諧波,還是更像均勻的噪音。高平坦度不等於「音質差」,氣聲與環境聲本來就具有不同的頻譜特性。
共振峰由聲道濾波形成的局部頻譜峰值。自動估算會受到基頻、母音、取樣率與參數設定影響。

麥克風也參與了「塑形」

近距離錄音可能增加低頻,偏離麥克風軸線會削弱部分高頻,房間反射會產生新的峰谷,手機的降噪與自動增益還可能隨時間改變頻譜。因此演算法首先測量到的,是「說話者 + 內容 + 房間 + 裝置 + 處理鏈」共同產生的檔案。

CVoice 會用多種頻譜統計組成聽感維度;Reborn 還會結合瞬態、事件密度與動態範圍來判斷聲音型態。兩者都不會把單一頻譜數值直接翻譯成人的身分。

共振能提供線索,但不能提供身分證明

聲道結構、發音動作、語言、訓練、情緒與裝置都會影響共振。不同群體之間可能存在統計趨勢,但單一錄音的分布大量重疊。用共振峰描述「這段錄音聽起來偏明亮」屬於合理描述;若用來確認真實性別、年齡或身體結構,就超出了證據能支援的範圍。

如何閱讀標籤把「溫暖、清亮、厚重」看成目前這段錄音在一組設計維度中的相對位置,而不是說話者不可改變的本質。

參考資料