【1055】 20260821
液壓切紙機壓板壓實,刀片切下,書脊被俐落地削掉。原本連接在一起的書頁變成整齊的一叠紙張﹐逐頁送進掃描器紀錄書頁內容﹐再存儲成數碼形式。然後將書頁送到碎紙機﹑廢紙回收商甚或焚毀。這樣切碎﹑焚毁﹑棄置的書籍﹐在過兩年裡也許超過數千萬本。這些被切的書也許是冷門古籍或絕版孤本。但…不用担心﹐內容已經被紀錄﹐甚至被「永久」存儲。方便日後由LLM大語言模型機器閱讀整理重編成新的內容﹐供應給世界各個人工智慧系統/公司﹐成為它們所需的訓練資料和原始養料。
人工智慧機器因而也就愈加聰明﹐無所不知﹐無所不懂。普通人通過互聯網﹐也可以輕易獲取相關的資訊。尤其是2022年以前出版的書冊刊物﹐因為多數經過編輯審訂校對﹐更沒有混入AI生成的內容,也沒有經過現代資料投毒工具處理,資料或許比較翔實﹐成了難得的「乾淨」的「善本」。
然而﹐還有幾個爭議點:
一﹑這樣切書掃描學習損害書本不道德。
二﹑這等輸入AI機器蒐集並學習的養料﹐可能包括公開的互聯網、盜版電子書甚至未經審訂﹑品質良莠不齊的資訊。
三﹑值得關注的問題是:AI公司把整個互聯網抓去訓練模型,到底算不算侵犯作者的權益?作者的書進了訓練體系,應否經過作者本人同意﹑AI公司應否向作者支付版權費?
2024年8月就有三名作家把Anthropic 告上法庭﹐控告AI公司侵權。希望法庭阻止AI公司用他們的作品訓練Claude。代表Anthropic的律師則爭辯:我們從市場用市價買書回來﹐我們用個真人或機器人去閱讀和學習﹐認為是在合理使用的範圍內而不侵權。
這是新科技環境下的新課題。爭議方興未艾呢。
沒有留言:
發佈留言