台灣主權 AI 訓練語料庫規模成長三倍,並向民間開放
台灣正在擴大自有的 AI 訓練資料庫,現在更希望納入出版業者的書籍與原創作品,對於需要真正理解台灣文化的模型的本地 AI 開發者而言,這是正面的一步。
- 由政府營運的台灣主權 AI 語料庫自去年 12 月以來已成長超過三倍,從約 2,000 筆資料集增加到超過 5,000 筆。
- 數位發展部建置此語料庫,是為了讓 AI 模型直接從完整作品中學習台灣文化與觀點,而非透過二手的摘要內容。
- 涵蓋範圍現已橫跨民俗、語言、法律、藝術、經濟、醫學、歷史、交通與本土語言。
- 下一階段瞄準民間內容——電子書、完整書籍與出版社書目——採自願加入制,並提供明確的授權條款與日後退出的權利。
- 出版業者自行審核其內容品質;平台僅檢查格式與結構,不檢視素材的實質內容。
展望:隨著愈來愈多出版業者加入,預期語料庫將持續成長,為教育、公共服務與客戶支援領域所使用的本地模型訓練、微調與檢索工具提供養分。