NLPNatural Language Processing
也常被稱為:自然語言處理、自然語言處理技術
一句話解釋
讓電腦理解、處理、生成人類語言的技術領域,翻譯、語音辨識、聊天機器人都屬於這個範疇。
它涵蓋的範圍
NLP(Natural Language Processing,自然語言處理)是讓電腦理解、處理、生成人類語言的技術領域。這是一個很寬的傘狀分類,底下包含許多具體任務:
- 機器翻譯:把一種語言轉成另一種語言
- 語音辨識:把聲音轉成文字
- 情感分析:判斷一段文字是正面、負面還是中性
- 命名實體辨識:從文字裡抓出人名、地名、機構名
- 文字摘要:把長文壓縮成短摘要
- 問答系統:根據問題找出或生成答案
- 聊天機器人:進行多輪對話
這些任務的共通點是:輸入或輸出至少有一端是人類使用的自然語言,而不是程式語言或結構化資料。
和 LLM 的關係
在LLM(大型語言模型)出現以前,NLP 領域的做法是每個任務各自訓練一個專用模型。做翻譯的模型和做情感分析的模型是兩個完全不同的系統,各自需要標註資料、各自訓練、各自調整。
LLM 改變了這個局面。一個夠大、訓練夠廣的語言模型,往往能同時把翻譯、摘要、問答、情感分析這些任務都處理得不錯,不需要為每個任務單獨訓練。
為什麼會有這種轉變
專用模型的問題在於規模不經濟。一間公司如果要同時做翻譯、客服問答、內容審核,過去等於要維護三套獨立系統,各自的資料標註、訓練、維運成本都要重複付一次。
LLM 用一個模型涵蓋多數任務,把這個成本結構整個打破了。這也是為什麼近幾年 NLP 領域的新專案,起點幾乎都變成「直接用 LLM 能不能做到」,而不是「該訓練一個什麼樣的專用模型」。
傳統做法還有存在空間嗎
有,但角色變了。在幾種情境下,針對單一任務訓練的小型專用模型仍然有優勢:
- 反應速度要求極高:專用模型通常比呼叫大型模型快得多
- 運算成本敏感:處理量極大、但任務本身很簡單的場景(例如篩選垃圾訊息),用一整個大型模型處理成本過高
- 資料無法外流:某些場景下自己訓練並部署的小模型,比呼叫外部 API 更符合資料治理要求
實務上常見的做法是混合使用:簡單、高頻的任務交給輕量專用模型過濾,複雜或需要理解脈絡的任務再交給 LLM 處理。
常見誤解
「NLP 是舊技術,已經被 LLM 取代」——不準確。NLP 是領域名稱,LLM 是這個領域裡的一種技術路線。說「LLM 取代了 NLP」就像說「汽車取代了交通」一樣,混淆了目標和手段的層次。
「做 NLP 一定要很懂語言學」——早期是這樣,現在門檻已經大幅降低。深度學習方法讓模型自己從大量資料裡學出語言規律,不再高度依賴人工設計的語言學規則。
延伸閱讀:LLM 是什麼、Embedding 是什麼、生成式 AI 是什麼。
常見問題
- NLP 和 LLM 是同一個東西嗎?
- 不是,是包含關係。NLP 是整個「讓電腦處理語言」的技術領域,範圍涵蓋翻譯、語音辨識、情感分析等各種任務。LLM 是目前處理 NLP 任務最主流的技術路線之一——用一個大型模型,同時把多數 NLP 任務都處理得很好。在 LLM 出現以前,NLP 領域是由許多各自獨立、針對單一任務設計的模型組成的。
- 現在還有人在做「傳統 NLP」嗎?
- 有,但比例大幅下降。特定場景下,針對單一任務訓練的小型專用模型仍然有優勢——反應速度快、運算成本低、不需要動用一整個大型模型處理簡單任務。但多數新專案的起點已經變成「直接用 LLM 能不能做到」,做不到或成本太高才考慮專用模型。
- 學 NLP 需要懂語言學嗎?
- 早期的 NLP 研究確實高度仰賴語言學知識——詞性標註、句法分析這些技術背後都是語言學規則。但隨著深度學習與 LLM 成為主流,這個門檻大幅降低。現在做 NLP 應用,更多需要的是機器學習與資料處理的能力,語言學知識是加分項,不是必要條件。
相關術語
更新於 .全部術語