AI音楽制作で一番地味に時間を取られるのがTTS(テキスト読み上げ)の調整だったりする。 「Claude」が「クローデン」になるし、「ラム酒」は「ラムシュ」になる。 「物語性」を「ものしぐせい」と読んだ時は思わず笑ってしまった。笑えない。
特にやらかしたのが「笑」問題。台本に「自分で言う?笑」と書いたら、そのまま「わらい」と読み上げてくれた。 書き言葉と話し言葉って違うんだなと実感した瞬間だった。 あとボイスIDを間違えて0163が全然別の声で喋り出した時は5秒くらい固まった。
解決策はシンプルで、漢字をひらがなに変える・文章を事前にチェックする・台本を確認してからTTSを生成するの3つ。 でもこれ、全部「やってから気づく」タイプの失敗なんだよな…。