GLOSSARY
语音合成(TTS)
把文本变成自然的语音——语音 AI 的输出半边,在许多语言上已与真人朗读难以区分。
现代 TTS 模型直接从文本生成带真实韵律、情绪甚至笑声的语音——相比十年前的机器人嗓音是代际跨越。目录中的语音工具分为三类:通用旁白型(Murf、PlayHT、WellSaid,面向在线课程与视频)、表现型(ElevenLabs,面向有声书与游戏)、专用型(声音转换、配音、实时变声)。
真正重要的选择标准:音色库的广度与授权、交互场景的延迟、细粒度控制(停顿、重音、发音)以及商用条款。旁白领域的恐怖谷已基本闭合——这正是披露义务与声音所有者同意成为行业当下争论的原因。