音声認識(ASR)とは?
おんせいにんしき
音声認識(ASR)とは、人間の話し声をコンピューターが解析してテキストデータに変換する技術です。
音声認識(ASR:Automatic Speech Recognition)は、マイクなどから入力された音声信号を自動的に解析し、対応するテキスト(文字列)へ変換する技術です。「音声テキスト変換(STT:Speech-to-Text)」とも呼ばれます。
- 音響処理:マイクで収録した音声波形をスペクトル特徴量(MFCCなど)に変換する
- 音響モデル:音の特徴を音素・単語に対応させる(従来はHMM、近年はディープラーニング)
- 言語モデル:単語の並びの確率を予測し、文として自然な候補を絞り込む
- デコーダー:音響スコアと言語スコアを組み合わせて最終テキストを出力する
近年はTransformerを使ったエンドツーエンドモデル(Whisper、wav2vecなど)が普及し、認識精度が飛躍的に向上しました。騒音環境への対応・方言・アクセント認識など従来の課題も改善されつつあります。
ASRの主な応用分野は次のとおりです。
- スマートスピーカー・音声アシスタント(Siri、Alexa、Google アシスタント)
- 議事録・字幕の自動生成
- コールセンターの自動応答・品質管理
- 医療・法律分野での音声入力
日本語では同音異義語が多く、文脈を踏まえた言語モデルの品質が認識精度に直結するため、高度な自然言語処理との組み合わせが重要です。
使い方・例文
会議の録音ファイルをASRシステムに入力すると、数分で議事録の下書きテキストが自動生成されるため、記録業務の効率化に活用されています。
この用語をシェア
最終更新: