本文へスキップ

マルチモーダル学習とは?

まるちもーだるがくしゅう

キスト・画像・音声など複数種類のデータを組み合わせてAIモデルを学習・推論させる機械学習の手法です。

マルチモーダル学習(multimodal learning)とは、テキスト・画像・音声・動画センサーデータなど、異なる種類(モダリティ)の情報を同時に扱い、AIモデルの学習や推論に活用する機械学習の手法です。

従来の機械学習モデルはテキストのみ、あるいは画像のみといった単一モダリティを扱うことが一般的でした。しかし人間は視覚・聴覚・言語など複数の感覚を統合して世界を理解します。マルチモーダル学習はこの仕組みを模倣し、複数の情報源を相互補完的に活用することで、より豊かな表現と高い理解能力を実現しようとします。

代表的なアーキテクチャとして、テキストと画像を共通のベクトル空間に埋め込むCLIP(OpenAI)や、画像の説明文を自動生成するVision-Language Modelなどがあります。大規模言語モデル(LLM)にビジョン機能を加えたマルチモーダルLLMは近年急速に普及し、画像を入力として質問に答えたり、グラフを読み解いたりすることが可能になっています。

応用分野は広く、医療画像診断と電子カルテの統合分析、自動運転における画像・LiDAR・地図データの融合、工場の音響データと画像を組み合わせた異常検知などがあります。

一方で、モダリティ間の位置合わせ(アライメント)の難しさや、学習データの収集・注釈付けのコストが主な課題として挙げられます。

使い方・例文

スマートフォンのAIアシスタントに写真を見せながら「この料理のカロリーを教えて」と話しかける際、画像と音声の両方を処理するマルチモーダル学習の技術が使われています。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語