台湾主权AI训练语料库规模增至三倍,向私营部门开放
台湾正在扩大自有的AI训练数据池,如今还希望从出版商处获取图书和原创作品。对于需要真正理解台湾文化的模型的本地AI开发者而言,这是积极的一步。
- 由政府运营的台湾主权AI语料库自去年12月以来规模增长逾三倍,从约2,000个数据集增至5,000多个。
- 数字发展部建立该语料库,是为了让AI模型直接从完整作品中学习台湾文化与观点,而非依赖二手摘要。
- 目前覆盖范围涵盖民间传说、语言、法律、艺术、经济、医学、历史、交通及本地语言。
- 下一阶段的目标是私营内容——电子书、完整图书和出版商书目——采取自愿加入、明确授权,并保留日后退出的权利。
- 出版商自行审核其内容质量;平台只检查格式和结构,不审查材料的实质内容。
展望:随着更多出版商加入,该语料库预计将持续扩充,为教育、公共服务和客户支持领域所用的本地模型训练、微调及检索工具提供支撑。