マルチモーダルとは

マルチモーダルMultimodal
文章だけでなく、画像・音声・動画など複数の種類の情報をまとめて扱えるAIの性質。写真を見せて質問したり、音声で指示したりできます。

もう少し詳しく

初期のチャットAIは文章しか扱えませんでしたが、現在の主要なモデルは、画像を見て内容を説明したり、手書きのメモの写真から文字を読み取ったり、音声で会話したりできます。これを「マルチモーダル」と呼びます。

業務では、「商品の写真を見せて説明文を作る」「ホワイトボードの写真から議事録を起こす」「請求書の画像から金額を読み取る」といった使い方ができます。紙や画像のまま残っている情報を、AIで扱える形にする入り口になります。

業務でのポイント

  • 写真・画像をそのまま渡して質問できる
  • 手書きや画像の読み取りは、人の名前や数字を必ず確かめる
  • 音声での指示は、移動中や手がふさがっている場面で便利

関連する用語

AI用語集の一覧に戻る