模型參數Parameters
也常被稱為:Parameters、參數量、模型大小
一句話解釋
模型內部可調整的數值總數,常用來粗略衡量模型規模。
參數究竟是什麼
神經網路由大量互相連接的節點組成,節點之間的連接強度用一個數字表示,這些數字就是參數。訓練的過程,本質上就是不斷調整這些數字,讓模型的輸出越來越接近正確答案。
一個模型說「有 700 億參數」,指的就是這個網路裡總共有 700 億個這樣的可調數值。
為什麼常被拿來當規模指標
參數量之所以常被提起,是因為它是少數容易比較、也和訓練與運算成本直接相關的數字:
- 和硬體需求直接掛鉤。 參數量越大,需要的記憶體與運算資源越多,這直接決定了模型能不能在一般裝置上跑。
- 和訓練成本相關。 參數量越大,訓練所需的運算量和資料量通常也越大。
- 早期確實和能力大致成正比。 在資料量固定的年代,參數量增加確實能穩定提升表現,這也是「越大越好」印象的來源。
但這個關聯近年在明顯減弱。
參數量不是全部
| 因素 | 影響 |
|---|---|
| 參數量 | 決定模型的理論容量上限,但不保證實際表現 |
| 訓練資料品質與數量 | 資料乾淨、多樣、量足,往往比參數量更能決定表現 |
| 訓練方法 | 同樣參數量,訓練方式不同,成品差異可能很大 |
| 後續調校 | 像 fine-tuning、人類回饋強化學習,能顯著改善特定任務的表現 |
近年出現不少參數量遠小於旗艦模型、但在特定任務上表現接近甚至超越的模型,靠的正是更好的訓練資料與方法,而不是堆更多參數。
對一般使用者的實際意義
多數人不需要記住任何模型的確切參數量,但知道這個數字大致代表什麼,能幫助理解幾件事:
同一家廠商的「大版本」和「小版本」差在哪。 通常小版本參數量較少,回應速度快、成本低,適合簡單任務;大版本參數量較多,處理複雜推理的能力通常更好。
為什麼有些模型能在手機上跑,有些不行。 能在裝置端執行的模型,參數量通常經過刻意壓縮(量化等技術),才能塞進手機有限的記憶體裡。
選模型不能只看參數量這一個數字。 實際任務表現、回應速度、費用,往往比參數量本身更值得參考。
延伸閱讀:LLM 是什麼、Fine-tuning 是什麼、開源模型是什麼。
常見問題
- 參數量越大,模型就一定越聰明嗎?
- 不一定。參數量只代表模型的容量上限,實際表現同樣取決於訓練資料的品質與數量、訓練方法、以及是否經過良好的後續調校。近年不少參數量較小的模型,靠更好的訓練資料表現超越參數量大上好幾倍的舊模型。
- 為什麼參數量會影響執行模型需要的硬體?
- 每個參數都要占用記憶體空間,參數量越大,載入模型所需的顯示記憶體(VRAM)就越多。這也是為什麼大模型通常只能在雲端伺服器執行,而參數量較小的模型才能在一般電腦或手機上跑。
- 「70B」裡的 B 是什麼意思?
- B 是 Billion(十億)的縮寫,「70B」代表這個模型有約 700 億個參數。常見的還有 M(Million,百萬)用在較小的模型上,以及 T(Trillion,兆)用在極大型模型上。
相關術語
更新於 .全部術語