核心發現
在 2026 年阿布達比 ISMIR 會議上,研究團隊展示了一個能「如大師般」演奏爵士鋼琴的 AI 系統。透過對 Aria(一個已在鋼琴 MIDI 上預訓練的 16 層 Transformer)進行微調,並加入 門控跨注意力層(gated cross‑attention)以讀取每位鋼琴家的專屬嵌入向量,模型能在同一段旋律上產生十二位爵士鋼琴大師的風格化續寫。實驗顯示,條件化後的生成作品有 70% 的機率被分類器正確歸屬到目標鋼琴家,未條件化時僅為 37%;另一個僅訓練於生成音樂的分類器,對真實錄音的辨識準確率高達 95%。
背景與技術細節
1994 年,Dick Hyman 以「模仿大師」的方式創作了十五首爵士鋼琴練習曲,從 Scott Joplin 到 Bill Evans,各自捕捉了每位大師的演奏特徵(如 Tatum 的雙手快速琶音、Garner 的左手吉他式撥弦、Peterson 的顫音與滑奏)。本研究正是以此概念為靈感,探討 AI 能否不僅辨識演奏者,還能以其風格演奏。
研究使用的 PiJAMA 資料集收錄了十二位爵士鋼琴家的獨奏錄音,包括 Erroll Garner、Cedar Walton、Bill Evans、以及 Hyman 本人。微調時,模型在每位鋼琴家的演奏上學習一個獨特的嵌入向量,跨注意力層負責在生成過程中「注入」該向量,使音符的密度、節奏起伏與和聲選擇都呈現對應的大師特徵。例如,同樣的開頭旋律「Ain’t Misbehavin’」在 Garner 的條件下僅用 1 分 26 秒完成,而在 Walton 的條件下則拉長至 2 分 45 秒,密度差異本身即是風格標誌。
為驗證風格傳遞,研究人員設計了「盲測」介面:聽眾可在同一段即興上切換不同鋼琴家的版本,並觀察分類器在約 300 音符的滑動視窗中給出的金色(正確)或紫色(錯誤)標記。結果顯示,模型在大多數窗口內能明確指向目標鋼琴家,且在真實錄音上幾乎全程給出高度置信度。
影響與未來展望
此項成果證明了 風格化生成(style‑conditioned generation)在音樂領域的可行性,為音樂教育、創作輔助與數位保存提供新工具。教師可利用模型示範不同大師的即興手法,學生則能即時比較自己演奏與 AI 模擬的差異;同時,對於已失傳的演奏風格,亦可透過類似方法進行「復活」式的聲音重建。
未來研究可擴展至更廣的樂器類型與跨流派的風格混合,或結合視覺資訊(如樂譜影像)提升模型的結構感知能力。此外,如何在保持創意自由度的同時避免過度模仿、確保版權與藝術家人格權,也將是業界與學術界需要共同探討的課題。
結語:AI 已不僅是辨識工具,它正逐步學會以「大師之聲」創作,為爵士鋼琴的傳承與創新開啟全新篇章。
