マルチモーダルMultimodal
文章だけでなく、画像・音声・動画など複数の種類の情報をまとめて扱えるAIの性質。写真を見せて質問したり、音声で指示したりできます。
もう少し詳しく
初期のチャットAIは文章しか扱えませんでしたが、現在の主要なモデルは、画像を見て内容を説明したり、手書きのメモの写真から文字を読み取ったり、音声で会話したりできます。これを「マルチモーダル」と呼びます。
業務では、「商品の写真を見せて説明文を作る」「ホワイトボードの写真から議事録を起こす」「請求書の画像から金額を読み取る」といった使い方ができます。紙や画像のまま残っている情報を、AIで扱える形にする入り口になります。
業務でのポイント
- 写真・画像をそのまま渡して質問できる
- 手書きや画像の読み取りは、人の名前や数字を必ず確かめる
- 音声での指示は、移動中や手がふさがっている場面で便利
