インデックスへスキップ

GLOSSARY

音声認識(ASR)

話し声をテキストへ変換する技術。会議の文字起こし、音声アシスタント、字幕ツールの基盤で、明瞭な音声では人間に近い精度に達しています。

現代の自動音声認識は深層学習のパイプラインです。(多くは Whisper 系の)音声エンコーダが音を表現へ写像し、デコーダが句読点・大文字・話者ラベル付きの単語へ変換します。ノイズ、アクセント、話者の重なり、専門用語がまだ精度の敵です。

このディレクトリでは、ASR は一つの製品ファミリーの見えないエンジンです。会議メモ(Otter、Fireflies)、ポッドキャスト編集(Descript)、字幕生成(VEED、Captions)、音声インターフェース。選ぶ基準は文字起こしを取り巻くワークフロー — 要約・アクション項目・編集 — です。生の精度の差は劇的に縮まったためです。

関連する用語

この技術を使うツール

関連カテゴリー