●在ScalingLaw的规则体系下,Al芯片和算法具备强大的学习和表达能力,但需要大规模的高质量数据集来驱动模型训练。
●数据的规模和质量会直接影响大模型的学习精确度和
泛化能力,决定最终人工智能应用效果。
●据欧盟AI研究机构《EURAI》分析(2023),全球排名前20
的大模型累计消耗数据量超过50万亿token.麦肯锡预测生成式AI数据需求年增长率约60%,2025年全球AI大模型数据
消耗规模约为130万亿-220万亿token.;
高质量数据集建设成为AI发展的重要支点
积极推动高质量数据集建设,赋能行业高质量发展
2025年2月19日,国家数据局在北京召开
原创力文档

文档评论(0)