インデックスへスキップ

GLOSSARY

マルチモーダル

テキストだけでなく、画像の理解・音声の生成・動画の視聴など、複数のメディアを同時に扱えるモデルです。

マルチモーダルモデルは複数種類のデータを扱えます。テキストに加えて画像・音声・動画です。ChatGPT に写真を見せて質問したり、音声でプロンプトを口述したり、動画を Gemini に分析させたり — すべて同じインターフェースからです。

マルチモーダルはこのディレクトリの全カテゴリーを静かに変えています。アシスタントはスクリーンショットを理解し、動画生成器は静止画を解釈し、音声モデルはサンプルから声をクローンします。テキストだけのシステムにはできなかった、視覚障害者への画像説明や音声の文字起こしなどのアクセシビリティ用途も開きました。

関連する用語

この技術を使うツール

関連カテゴリー