測量、印象與身分:三層結論不能混用

聲音確實帶有資訊,但「測得到差異」不等於「能確認一個人是誰」。負責任的報告必須標明每一步推論的證據強度。

三層結論分別是什麼

層級範例可以怎麼說
聲學測量這段錄音的 F0 中位數、能量範圍、頻譜中心、停頓比例。在品質合格且方法明確時,可以報告數值與不確定性。
聽感印象偏明亮、柔和、緊張、活躍,或偏男性化/女性化的表達感。應寫成目前錄音在特定面向上的相對印象。
身分與狀態事實真實年齡、性別認同、人格、疾病、誠信、能力。單段一般錄音通常無法可靠確認,不應偽裝成檢測結果。

為什麼群體趨勢不能直接套用到個人

即使某項聲學特徵在兩個群體的平均值不同,分布仍可能大量重疊。個人還會受到語言、口音、訓練、荷爾蒙、身體狀態、情境、設備與主動表達方式影響。只憑一段短錄音把統計相關性升級成個人事實,會同時放大誤差與偏見。

「年齡感」與「性別感」更適合作為聽覺風格座標:它描述當下的表達如何被感知,而不是確認證件或身體屬性。使用者可以主動改變這些表達,這種變化本身也不需要被視為欺騙。

情緒、壓力與疲勞尤其需要謹慎

語速、停頓、音高變化與發聲品質可能與狀態有關,但同一種信號可能有許多原因:低能量可能來自疲勞、平靜、麥克風太遠或刻意輕聲;停頓可能來自思考、不熟悉語言或文字安排。

因此 Insight 只能寫「與緊張相關的聲音線索較多」或「目前表達較平緩」,不能診斷焦慮、憂鬱或嗓音疾病。Arcana 的聲音狀態也只能輔助提問,不能讀心。

一份負責任的報告該怎麼措辭

較合適

「在這段錄音中」「可能與……有關」「目前樣本呈現」「錄音品質限制了可信度」。

應避免

「你就是……」「演算法證明了……」「百分之百準確」「聲音暴露了你的真實人格」。

演算法透明不只是列出特徵名稱,還包括說明訓練或規則來源、適用輸入、失敗條件、保留時間,以及結論不應用於哪些決策。

身為使用者,如何保護自己與他人

  • 不要上傳他人的私密錄音來推測身分、健康或人格。
  • 不要根據娛樂標籤進行招募、教育、保險、醫療或關係中的重大決定。
  • 把不同時間的結果視為狀態快照,先檢查錄音條件,再解讀變化。
  • 公開分享前,請確認音訊著作權、隱私與當事人同意。
CVoice Family 的原則可以把聲音變成遊戲、報告、星星、音樂或敘事,但不能藉由技術外觀,把有限證據包裝成對一個人的最終定義。

方法參考