Statista:Llama AI 的训练数据中约四分之一来自书籍
Meta
根据 Statista 的分析,Meta 的 Llama 语言模型在训练时使用的数据中,约有 25% 来自书籍。这一比例与来自互联网(包括新闻、社交媒体及其他文本)的数据占比相当。
分析公司Statista发布了关于Meta的Llama语言模型训练数据来源的评估。根据Statista的数据,所有使用的文本材料中约有四分之一(约25%)来自书籍。这一比例与从互联网(包括新闻、社交媒体及其他在线资源)提取的数据量相当。该评估基于对Meta公布的训练数据集公开数据的分析。书籍所占的比例凸显了印刷出版物作为现代大型语言模型知识来源的重要性。
来源: Meta AI (GNews) —
原文
