藝術家抗爭:Cara 影像平台遭大規模 AI 抓取
自 2023 年初以來,攝影師 張靜娜(Jingna Zhang)與一小群志工不眠不休,維護一個名為 Cara 的影像分享與作品集應用程式。平台已聚集約 150 萬創作者,核心訴求是反對未經授權的 AI 訓練,同時提供藝術家一個不被大型科技公司剝削的曝光舞台。
然而,Cara 雖能過濾 AI 產生的圖像,卻難以阻止資料抓取(scraping)。本月 8 月 13 日起,平台接連遭遇三次大規模抓取,導致伺服器費用飆升,讓從 Instagram(其內容全數授權給 Meta 作為訓練資料)遷移而來的創作者感到震驚。
首次大規模抓取曝光
一名使用 Reddit 子版 r/DefendingAIArt 的用戶(帳號 MandarinDawnPoppy994)宣稱取得了 12 TB、1200 萬張 公開圖像的完整檔案,約等於 Cara 全部可見作品。貼文已被刪除,作者自稱「只花不到 10 美元」完成此「有趣的專案」。張靜娜在接受《WIRED》採訪時說,平台是透過使用者標註才發現此事,因為抓取者在 Reddit 上炫耀並招募同好,引發 AI 社群激烈的倫理爭論。她指出,法律尚未跟上,對此類資料收割缺乏明確保護,讓抓取者常以「技術上合法」自我辯解。張同時參與兩起由視覺藝術家發起的集體訴訟,分別針對 Stability AI、Midjourney 等公司以及 Google,指控其圖像生成工具以未授權的版權作品為訓練素材。
令人意外的是,該抓取者後來表示懊悔,願意與張靜娜合作開發開源防護工具,協助藝術家自行抵禦未授權的資料擷取。
續發的「模仿」攻擊
在首波事件之後,其他抓取者仍利用 Cara 的資安弱點持續行動。第二位抓取者下載約 850 萬筆 連結、使用者名稱、標題與標籤等中繼資料(metadata),並上傳至 AI 開發平台 Hugging Face。面對大量下架請求,Hugging Face 回應稱會通知使用者 CaptiveDreamer 移除個人中繼資料,但因網址本身並未儲存圖像,平台無法刪除這些指向 Cara 上作品的連結。
影響與未來展望
這連串事件凸顯了小型創作者平台在 AI 產業鏈中的脆弱位置。即使平台提供基本的防護機制,仍難以抵禦成本低廉、技術門檻不高的資料抓取。對於依賴平台曝光的藝術家而言,若無更完善的法律框架與技術防護,未授權的 AI 訓練將持續侵蝕其創作收益。
未來,業界可能朝向以下方向發展:
-
開源防護工具:如張靜娜與前抓取者合作的計畫,讓藝術家自行部署防抓取機制。
-
平台聯盟:小型影像平台可組成聯盟,共享資安資源與法律支援。
-
立法完善:迫使各國立法機構針對 AI 訓練資料的授權使用制定明確規範。
對於關心創作權利的讀者而言,關注平台的資安政策、支持開源防護專案,並在社群中推廣資料主權的概念,將是抵禦 AI 大規模抓取的第一步。
