多模態Multimodal
也常被稱為:Multimodal、多模式、跨模態
一句話解釋
能同時理解與處理文字、圖像、聲音等多種型態資料的模型能力。
「模態」指的是什麼
模態就是資料的型態:文字是一種,圖像是一種,聲音、影片各是一種。
單模態模型只處理一種——純文字模型只讀得懂文字。多模態模型則能同時接收多種型態,並且在它們之間建立關聯。
關鍵在最後那句。真正的多模態不是「分別處理再拼起來」,而是把不同型態放進同一個表示空間,讓模型能理解「這段文字描述的正是圖裡的那個部分」。
實際能做什麼
- 看懂截圖。貼一張錯誤訊息的截圖問「這是什麼問題」,不用手打內容。
- 讀圖表。上傳一張趨勢圖,請它說明走勢或抓出異常。
- 處理手寫與掃描件。把紙本筆記或掃描的表格轉成結構化資料。
- 看著設計稿寫程式。給它一張介面草圖,產生對應的前端程式碼。
- 描述影像內容。為圖片生成替代文字,或整理影片內容。
目前的限制
細節仍會出錯。 讀圖表時,把數字看錯、把兩條線搞混都還會發生。重要數字要自己核對。
空間關係較弱。 「左上角那個按鈕」「第三欄第二列」這類需要精確定位的描述,準確率明顯低於一般內容辨識。
小字和低解析度。 圖片模糊或字太小,辨識品質會明顯下降。
成本較高。 圖片消耗的 token 遠多於等量文字,批次處理前先估算。
常見問題
- 多模態和「能上傳圖片」是同一件事嗎?
- 表面看起來一樣,底層可能差很多。真正的多模態模型是把圖像和文字放進同一個表示空間一起處理;有些產品則是先用另一個模型把圖片轉成文字描述,再交給語言模型。後者能回答大概內容,但問到細節(版面位置、細微差異)就會失準。
- 圖片會消耗 token 嗎?
- 會。圖片會被轉換成一定數量的 token 計費,數量通常隨解析度增加。一張高解析度的圖可能相當於數百到上千個 token,所以大量處理圖片時,成本會比預期高不少。
相關術語
更新於 .全部術語