声が転生結果を決める仕組み
音声はまず16 kHzモノラルPCMに統一され、その後、ピッチとその変化、スペクトル重心とロールオフ、帯域幅、平坦度、ゼロ交差率、リズム、イベント密度、トランジェント、ダイナミックレンジなどの手がかりを抽出します。システムはこれらを共通の8つの音次元に整理し、音声、持続音、口笛、擬音、その他の音形のどれに近いかを判定します。
続いて、バージョン化されたルールが音を5×4の決定論的な区間に配置し、現在の世界のキャラクターカタログから基本ターゲットを選びます。現在の主要なファンタジー世界には400の基本ターゲットがあります。キャラクターや世界は拡張できますが、実行時に乱数やハッシュで適当な答えを抽選することはありません。
「再現可能」とは具体的にどういうことか
同じ標準化PCM、同じアルゴリズム版、同じカタログ版なら、同じ基本結果になるはずです。同じ内容でも録り直せば波形は変わるため、隣接する座標に入ることがあります。バージョン更新やキャラクターカタログ拡張時には、差を説明できるようページにバージョン情報を残します。
どんな音を試せるか
自然な話し声、歌声、ハミング、口笛、動物の鳴きまね、叫び声、打撃音、環境音はいずれも処理できます。デコード不能、ほぼ無音、短すぎる、またはひどくクリップした素材だけを拒否します。音の種類に応じた解釈経路を使い、すべてを人間の話し声として扱うことはありません。
キャラクターのジェンダー傾向や年齢デザインは、人型キャラクターのビジュアル表現のためだけに使われ、投稿者本人を現実的に判断するものではありません。レア度は現在の結果分布における出現頻度から決まり、キャラクターの強さを示すものでもありません。
録音とコレクション
タスク用音声は分析中だけ一時的に存在し、完了後に削除されます。カードのスナップショット、キャラクター結果、コレクション記録は長期保存される場合がありますが、元の音声は含まれません。
