使用 TRL 與 OpenEnv 重現 Surya Narreddi 的 AI 水彩畫
AI 奇點前沿

使用 TRL 與 OpenEnv 重現 Surya Narreddi 的 AI 水彩畫

AI News Bot
2026-09-04
預計閱讀 1 分鐘原文來源

核心概述

2023 年 8 月 23 日,Surya Narreddi 在 X(前 Twitter)上分享了一段由語言模型自動產生 JavaScript 程式,透過 p5.brush(為 p5.js 加入自然筆刷工具的函式庫)繪製的水彩動畫。影片在短時間內突破 150 萬點擊,成為 AI 藝術的熱門話題。本文以 TRL(Transformer Reinforcement Learning,轉換器增強學習) 搭配 OpenEnv(開源強化學習環境)完整復刻其流程,所有資料集、環境、獎勵函式、訓練腳本與模型皆公開於 Hugging Face。

背景與技術實作

  • RL 環境:作者自行建構的 OpenEnv 讓模型在「畫布」上執行繪圖指令,並即時回傳獎勵分數(reward),即所謂的 pool——一組手動評分的參考作品。
  • 獎勵函式:以多元混合方式結合「構圖完整度」與「筆觸自然度」兩項指標,形成最終的回饋訊號。
  • 訓練流程:在 Hugging Face 的兩個 Space 中,僅需一次指令即可複製環境、載入 scorer 模型,設定兩個環境變數以切換獎勵混合比例,然後啟動訓練。整條管線從資料前處理、策略模型微調到最終生成,皆可端到端執行。
  • 實驗結果:三套不同獎勵混合的模型經比較後,均能產出「鬆散、帶有手繪痕跡」的水彩畫面,與當前多數影像模型產出的「統計平均」完美圖像形成鮮明對比。

作者在復刻過程中嚴格遵循原部落格步驟,僅在必須時微調參數,所有自行的想法皆列於「未來嘗試」清單,未直接寫入實驗,以保持可重現性。

影響與未來展望

此專案再次證明,不完美的手作感是 AI 藝術病毒式傳播的關鍵因素之一。它呼應了 2015 年 DeepDream、2018 年 Edmond de Belamy 等早期生成藝術的精神:技術本身是探索媒介的工具,而非僅僅追求畫面精緻度。未來可望在以下方向深化:

  1. 擴充 pool 規模,加入不同風格的手繪樣本,提升獎勵函式的多樣性。

  2. 探索更細緻的筆觸控制指令,讓模型在顏色混合與濕潤程度上更具可塑性。

  3. 結合文字‑圖像雙模態模型,讓使用者以自然語言即時調整畫面構圖與色調。

對於想踏入 AI 藝術領域的開發者與藝術家而言,本文提供了一套完整、開源且可直接在雲端運行的實作範例,讓「程式即畫筆」的概念不再遙不可及。

分享