引言
人類的語言交流歷史可追溯至至少十萬年前,而在這漫長的歲月裡,唯一能達到「完美流利」的人類語言能力的,是人類兒童。如今,隨著 ChatGPT 發布僅四年,我們已習慣與手機、電腦自然對話,大型語言模型(LLM) 如 Claude、DeepSeek、OpenAI 的 GPT 系列,已能以令人信服的方式偽裝成人類說話者。然而,這背後隱藏的關鍵問題是:機器要學會人類語言,必須吞下遠超人類一生所能接觸的語料量。
資料效率差距
斯坦福大學認知科學家 Michael C. Frank 指出,儘管 LLM 的進步「令人驚嘆」,但要重現人類在一年內於客廳裡完成的語言習得,卻必須「燒毀一座森林,刮取全部人類知識」才能達成。這種 資料效率差距(data efficiency gap)體現在以下兩點:
-
語料規模:一個 LLM 能處理的文字量是人類在學習母語過程中所接觸的十萬倍,甚至遠超兒童在出生後第一年所聽到的語言量。
-
訓練成本:Meta 兩年前推出的開放權重 LLM Llama 3.1 於預訓練階段消耗了 15 兆個 token(語言的字詞單位),而 Georgetown 大學的 Ethan Gotlieb Wilcox 認為,前沿模型的預訓練資料量可能是其十倍。網路可供訓練的資料終有枯竭之日,或在 2030 年代前就會出現瓶頸。
相較之下,一位語言環境豐富的青少年在成長過程中大約聽過 1 億字,若再加上閱讀,至二十歲時可能累積 3 億字。Wilcox 用「Claude 看過的語言量相當於整座城市一代人的語言經驗」來形容 LLM 的規模;若把所有訓練文字印成紙,堆疊高度可超過國際太空站,而人類青少年的 1 億字則僅能堆成約 20 公尺的紙塔。
兒童學語的啟示
儘管資料量相差懸殊,兒童仍能在極少的語料下達到高度語言能力,顯示 「以少勝多」的學習機制 仍是未被完全解讀的寶庫。認知科學家正試圖逆向工程兒童的語言習得過程,期望從中抽取「資料效率」的關鍵原則,應用於 AI 模型的設計。若能將兒童的「語境推理」與「概念抽象」能力嵌入模型,未來的 LLM 可能在不依賴海量資料的情況下,仍能展現流暢且具人性化的對話表現。
未來展望
資料供給的天花板逼近,AI 研究者與認知科學家必須共同破解「少量語料學會語言」的密碼。提升資料效率 不僅能降低訓練成本、減少能源消耗,更能讓 AI 更快適應多語言、多文化的應用場景。對於讀者而言,了解兒童語言習得背後的機制,或許能啟發我們在教育、語言學習軟體以及未來 AI 互動設計上的新思路——在資訊爆炸的時代,「少即是多」 可能成為下一波技術突破的關鍵。
