網上書商起家的亞馬遜(Amazon)近日被揭發購入大量珍稀舊書後,切斷書脊並掃描內容,用作訓練人工智能(AI)模型。據404 Media報道,該媒體在書本內放置追蹤裝置,最終發現書本被送往亞馬遜位於拉斯維加斯的VGT3倉庫,該設施以一隻恐龍爪持書本的圖案作為標誌。
亞馬遜在聲明中回應指出,公司「透過商業渠道購買書籍,以改善客戶使用的產品和服務」。據報道,亞馬遜團隊以一隻準備吞食書本的暴龍作為標誌。
訓練大型語言模型(LLM)需要極大量文字數據,互聯網上的資料幾乎已被企業消化殆盡,甚至有企業非法盜版書籍。珍稀書籍,尤其是絕版或網上難以找到的文本,因而成為備受追捧的訓練數據來源。
這些文本尤其珍貴,因為2022年之前出版的內容,不可能由AI生成。若LLM以AI生成的文本訓練,可能導致「模型崩潰」,即模型輸出品質在吸收過量AI生成文本後下降。

留言