跳到主要內容
Foxyko

大型語言模型LLM (Large Language Model)

也常被稱為:LLM、語言模型、大語言模型

一句話解釋

用大量文字訓練、透過預測下一個 token 來生成內容的 AI 模型。

核心機制:預測下一個字

LLM 做的事情,本質上只有一件:看著前面的文字,預測下一個 token 最可能是什麼

「今天天氣真」後面接「好」的機率很高,接「香蕉」的機率極低。模型從海量文字中學到這些機率關係,然後一個 token 接一個 token 地往下生成。

聽起來過於簡單,但規模夠大之後,會產生一些意料之外的能力——為了把「下一個字」預測得夠準,模型被迫學會語法、事實、邏輯關係,甚至基本的推理模式。這種「規模變大之後冒出新能力」的現象,是過去十年最重要的發現之一。

訓練分成兩個階段

預訓練(pre-training):讀進大量文字,反覆練習預測下一個 token。這階段學到的是語言結構和世界知識,但這時候的模型只會接話,不會照你的話做事。

後訓練(post-training):透過人類回饋等方式,教它遵循指示、保持有用、拒絕不該做的請求。你在 ChatGPT 或 Claude 裡對話的那個「助理人格」,是這個階段調出來的。

三個必須知道的限制

知識有截止日期。 訓練資料收集到某個時間點就停了,之後發生的事模型不知道。除非它能連網搜尋,否則問它最新消息只會得到過期答案,或是憑空編造。

它會編。 模型的目標是生成「看起來合理」的下一個字,不是「正確」的下一個字。當它不知道答案時,不會沉默,而是生成一個聽起來很像真的答案。這叫幻覺,是機制本身的產物,不是偶發的 bug。

一次能看的內容有限。 受限於 context window,超過的部分模型看不到。

常見問題

LLM 真的理解它在說什麼嗎?
這是目前還沒有共識的問題。可以確定的是,它的運作機制是統計性的預測,而不是像人一樣建立概念再表達。但它在許多需要推理的任務上表現得相當好,所以「只是統計,沒有理解」這種說法也失之簡化。實務上重要的是:它會流暢地說出錯誤的內容,這點必須預設。
為什麼同一個問題問兩次,答案會不一樣?
因為生成過程帶有隨機性。模型每一步是在一個機率分布上挑下一個 token,而不是永遠挑機率最高的那個。這個隨機程度由 temperature 之類的參數控制,調到最低才會趨近每次都相同。
主題標籤LLM基礎概念

更新於 全部術語