大型語言模型LLM (Large Language Model)
也常被稱為:LLM、語言模型、大語言模型
一句話解釋
用大量文字訓練、透過預測下一個 token 來生成內容的 AI 模型。
核心機制:預測下一個字
LLM 做的事情,本質上只有一件:看著前面的文字,預測下一個 token 最可能是什麼。
「今天天氣真」後面接「好」的機率很高,接「香蕉」的機率極低。模型從海量文字中學到這些機率關係,然後一個 token 接一個 token 地往下生成。
聽起來過於簡單,但規模夠大之後,會產生一些意料之外的能力——為了把「下一個字」預測得夠準,模型被迫學會語法、事實、邏輯關係,甚至基本的推理模式。這種「規模變大之後冒出新能力」的現象,是過去十年最重要的發現之一。
訓練分成兩個階段
預訓練(pre-training):讀進大量文字,反覆練習預測下一個 token。這階段學到的是語言結構和世界知識,但這時候的模型只會接話,不會照你的話做事。
後訓練(post-training):透過人類回饋等方式,教它遵循指示、保持有用、拒絕不該做的請求。你在 ChatGPT 或 Claude 裡對話的那個「助理人格」,是這個階段調出來的。
三個必須知道的限制
知識有截止日期。 訓練資料收集到某個時間點就停了,之後發生的事模型不知道。除非它能連網搜尋,否則問它最新消息只會得到過期答案,或是憑空編造。
它會編。 模型的目標是生成「看起來合理」的下一個字,不是「正確」的下一個字。當它不知道答案時,不會沉默,而是生成一個聽起來很像真的答案。這叫幻覺,是機制本身的產物,不是偶發的 bug。
一次能看的內容有限。 受限於 context window,超過的部分模型看不到。
常見問題
- LLM 真的理解它在說什麼嗎?
- 這是目前還沒有共識的問題。可以確定的是,它的運作機制是統計性的預測,而不是像人一樣建立概念再表達。但它在許多需要推理的任務上表現得相當好,所以「只是統計,沒有理解」這種說法也失之簡化。實務上重要的是:它會流暢地說出錯誤的內容,這點必須預設。
- 為什麼同一個問題問兩次,答案會不一樣?
- 因為生成過程帶有隨機性。模型每一步是在一個機率分布上挑下一個 token,而不是永遠挑機率最高的那個。這個隨機程度由 temperature 之類的參數控制,調到最低才會趨近每次都相同。
相關術語
更新於 .全部術語