GLOSSARY
语音识别(ASR)
把语音转成文本——会议转写、语音助手与字幕工具的底层能力,清晰语音的准确率已接近人类。
现代自动语音识别是一条深度学习管线:音频编码器(多属 Whisper 一脉的 Transformer 结构)把声音映射为表征,解码器再转成词,并附标点、大小写甚至说话人标签。噪声、口音、重叠说话人与领域术语仍是准确率的杀手。
在本目录中,ASR 是一整个产品家族的隐形引擎:会议记录(Otter、Fireflies)、播客编辑(Descript)、字幕生成(VEED、Captions)与语音界面。在它们之间选择,主要看转写之外的工作流——摘要、行动项、编辑——因为原始准确率的差距已急剧缩小。