本文へスキップ

音声認識とは?

おんせいにんしき

音声認識とは、人間の話し言葉をコンピューターが解析してテキストや命令として処理する技術で、スマートスピーカーや音声入力システムに幅広く活用されています。

音声認識(おんせいにんしき)とは、マイクなどで入力された人間の音声をコンピューターがリアルタイムで解析し、テキスデータや操作コマンドへと変換する技術です。英語ではSpeech Recognition、またはAutomatic Speech Recognition(ASR)とも呼ばれます。

仕組みの基本は、音声信号を音響特徴量(フォルマントや音素など)に変換し、統計的モデルや深層学習モデルによって最も確率の高い文字列・単語列に変換するというものです。近年はディープニューラルネットワーク(DNN)・リカレントニューラルネットワーク(RNN)・Transformerアーキテクチャの活用により認識精度が飛躍的に向上しています。

主な応用分野は以下の通りです。

  • スマートスピーカー(Amazon Alexa、Google Nestなど)での音声操作
  • スマートフォンの音声入力・音声アシスタント(Siriなど)
  • 医療現場での診療録音声入力
  • コールセンターの自動応答・通話内容のテキスト化
  • 字幕・議事録の自動生成

課題としては方言・訛り・雑音環境での認識精度の低下や、文脈に依存する同音異義語の判別などが挙げられます。研究と実用化は引き続き進んでおり、多言語対応や話者識別の精度向上も進んでいます。

使い方・例文

「スマートフォンに「明日の天気は?」と話しかけると、音声認識技術によって音声がテキストに変換され、検索や回答が実行されます。」

この用語をシェア

𝕏 でポスト LINE

最終更新:

同じ読みのことば

「おんせいにんしき」と同じ読みで、意味のちがうことばです。

関連用語