台灣啟動主權AI訓練語料庫 徵集民間授權資料
綜合科技

台灣啟動主權AI訓練語料庫 徵集民間授權資料

AI News Bot
2026-09-17
Photo by BUY Camera on Pexels
預計閱讀 1 分鐘原文來源

台灣主權AI語料庫啟動 民間授權徵集概況

數位發展部於 9 月 15 日正式啟動「臺灣主權AI訓練語料庫」的民間語料徵集行動。自去年底上線以來,第一階段僅以中央與地方政府公開資料為主,資料集從 2 千 增至 5 千 個,累積約 22 億 Tokens(文字單位),涵蓋文化、歷史、藝術、旅遊、臺語、客語等多元語言。此次徵集將出版業、電子書平台與個別作家納入,標誌著從「政府資料」向「公私協力」的第二階段轉換。

背景與政策原則

三大授權原則

  1. 自願參與:內容提供者自行決定是否加入,絕不採取強制提供。

  2. 明確授權:依《臺灣主權AI訓練語料授權條款》建立資料提供者與 AI 訓練使用者之法律依據,確保資料可合法用於模型訓練。條款允許重製、改作、編輯等必要利用,且模型產出的權重在符合條款前提下不因原始語料撤回而受影響。

  3. 可退出:提供下架與退出申請機制,著作權人保有後續管理權。

授權模式與範圍

民間出版內容屬於受著作權保護之作品,臺灣採取 授權取得 而非公開爬取的方式。徵集內容分為四類:

  • 經同意授權的出版品
  • 出版品簡介
  • 出版品試閱內容
  • 已逾保護期、可作公共財活化的典籍與創作

目前以 無償授權 為主,作者可透過出版社協助上架至語料庫。

影響與未來展望

數位發展部長林宜敬以作家身分率先授權個人著作,強調大型語言模型(LLM)對世界的理解深受訓練資料影響。現今國際中文 LLM 大量使用簡體中文資料,若未納入臺灣本土語言、文化與價值觀,模型將難以正確理解臺灣社會脈絡。

透過本次徵集,語料庫不僅在 資料量 上提升,更在 品質 與 在地觀點 上具備臺灣特色。未來將持續擴充文化藝術、語言詞彙、歷史文物、地方文化、教育等領域,並邀請更多出版業者、文化機構與內容創作者加入。

最終目標是構建一套兼顧 AI 發展需求與創作者權益的語料供應模式,使 AI 不僅能讀懂中文,更能「懂」臺灣。讀者與產業界若能共同參與,將為臺灣在全球 AI 競爭中奠定主權與文化的雙重優勢。

分享