麻省理工研究團隊的一項最新研究表明「AI 生成的圖片無法追溯其訓練資料」,白話文就是當你使用 AI 產圖時,AI 真的像在進行創作,而不是從現有的海量資料中複製某個片段然後貼上,產生新圖。
我很困惑,如果 AI 真的完全沒看過周杰倫、沒看過《蒙娜麗莎》,怎麼可能憑空產出一模一樣的圖?沒看過的東西就是產不出來才對。
原來這項研究的重點是在討論創作者的困境,當資料庫龐大到一定程度時,你從幾百萬張圖片裡抽出「某一位創作者的圖片」,AI 依然能生成出相似的結果,這在科學上叫做「歸因衰減」。
舉例來說,假設訓練資料集內有 10,000 張周杰倫的照片,這時某攝影師提告說:「AI 可以生成周杰倫照片,就是因為使用了我拍攝的照片。」但模型商可以把該攝影師的照片徹底抽離,結果 AI 依然能靠剩下的 9,999 張畫出完全一樣的周杰倫,也就是證明無法歸因是使用了原創作品才造將了 AI 生成相似結果。
所以雖然沒看過 AI 就是產不出來,但在擁有全世界網際網路資料的巨型模型下,還有什麼東西是他「完全」沒看過的?
目前著作權相關訴訟也認知告 AI 抄襲極難成立,轉而主打 AI 訓練時使用未經同意的內容,近期報導 Anthropic 與作家們達成 15 億美元的版權集體訴訟和解就是著名案例之一。