音声認識とは?
おんせいにんしき
音声認識とは、人間の話し言葉をコンピューターが解析してテキストや命令として処理する技術で、スマートスピーカーや音声入力システムに幅広く活用されています。
音声認識(おんせいにんしき)とは、マイクなどで入力された人間の音声をコンピューターがリアルタイムで解析し、テキストデータや操作コマンドへと変換する技術です。英語ではSpeech Recognition、またはAutomatic Speech Recognition(ASR)とも呼ばれます。
仕組みの基本は、音声信号を音響特徴量(フォルマントや音素など)に変換し、統計的モデルや深層学習モデルによって最も確率の高い文字列・単語列に変換するというものです。近年はディープニューラルネットワーク(DNN)・リカレントニューラルネットワーク(RNN)・Transformerアーキテクチャの活用により認識精度が飛躍的に向上しています。
主な応用分野は以下の通りです。
- スマートスピーカー(Amazon Alexa、Google Nestなど)での音声操作
- スマートフォンの音声入力・音声アシスタント(Siriなど)
- 医療現場での診療録音声入力
- コールセンターの自動応答・通話内容のテキスト化
- 字幕・議事録の自動生成
課題としては方言・訛り・雑音環境での認識精度の低下や、文脈に依存する同音異義語の判別などが挙げられます。研究と実用化は引き続き進んでおり、多言語対応や話者識別の精度向上も進んでいます。
使い方・例文
「スマートフォンに「明日の天気は?」と話しかけると、音声認識技術によって音声がテキストに変換され、検索や回答が実行されます。」
この用語をシェア
最終更新: