GLOSSARY
音声認識(ASR)
話し声をテキストへ変換する技術。会議の文字起こし、音声アシスタント、字幕ツールの基盤で、明瞭な音声では人間に近い精度に達しています。
現代の自動音声認識は深層学習のパイプラインです。(多くは Whisper 系の)音声エンコーダが音を表現へ写像し、デコーダが句読点・大文字・話者ラベル付きの単語へ変換します。ノイズ、アクセント、話者の重なり、専門用語がまだ精度の敵です。
このディレクトリでは、ASR は一つの製品ファミリーの見えないエンジンです。会議メモ(Otter、Fireflies)、ポッドキャスト編集(Descript)、字幕生成(VEED、Captions)、音声インターフェース。選ぶ基準は文字起こしを取り巻くワークフロー — 要約・アクション項目・編集 — です。生の精度の差は劇的に縮まったためです。