跳到索引

GLOSSARY

语音识别(ASR)

把语音转成文本——会议转写、语音助手与字幕工具的底层能力,清晰语音的准确率已接近人类。

现代自动语音识别是一条深度学习管线:音频编码器(多属 Whisper 一脉的 Transformer 结构)把声音映射为表征,解码器再转成词,并附标点、大小写甚至说话人标签。噪声、口音、重叠说话人与领域术语仍是准确率的杀手。

在本目录中,ASR 是一整个产品家族的隐形引擎:会议记录(Otter、Fireflies)、播客编辑(Descript)、字幕生成(VEED、Captions)与语音界面。在它们之间选择,主要看转写之外的工作流——摘要、行动项、编辑——因为原始准确率的差距已急剧缩小。

相关术语

使用该技术的工具

相关分类