GLOSSARY
視覚言語モデル(VLM)
画像もテキストと同様に読めるモデル。スクリーンショット・グラフ・写真・図を送り、自然言語で質問できます。
VLM は言語モデルにビジョンエンコーダを追加し、画像をテキスト側と同種のトークンへ変換します。結果は 1 つのモデルで、画像の説明、スクリーンショット内の文字の読取り、グラフの解釈、請求書からの項目抽出、「この UI のどこが問題?」への回答までこなします — 別パイプライン不要のマルチモーダル入力です。
この能力は既に実製品を支えます。アップロードされたスクリーンショットを読むサポートツール、今見ているページを理解するアシスタント、スキャン文書からのデータ抽出。弱点も残ります — 細かな文字、正確な計数、空間推論、密な軸のグラフはまだ模型をつまずかせるため、それらの出力は他の抽出と同じく検証が必要です。