我国已建设高质量数据集超过3.5万个
中国青年报客户端北京8月14日电(中青报·中青网记者 贾骥业)高质量、大规模数据是推动“人工智能+”深度落地的核心支撑。国家数据局局长刘烈宏今天在国新办举行的“高质量完成‘十四五’规划”系列主题新闻发布会上介绍,截至今年6月底,我国已经建设高质量数据集超过3.5万个,总体量超过了400PB(记者注:1PB可存储约5亿张2MB大小的高清照片),相当于中国国家图书馆数字资源总量的140倍左右。
数据显示,截至今年6月底,各地高质量数据集累计交易额近40亿元,数据交易机构挂牌的高质量数据集总规模达到了246PB。上海、天津、安徽等地正在试点“数据语料作价入股”等新模式,引导企业将高质量数据集折算为股权投入到相关企业。此外,我国还布局了成都、沈阳、合肥等7个数据标注基地,助力高质量数据集的建设。
中文数据在国内大模型的训练性能提升方面也发挥着重要作用。刘烈宏介绍,经过一段时间的努力,国内多数模型训练使用的中文数据占比已超过60%,有的模型已达到80%。
“‘人工智能+’行动到哪里,高质量数据集的建设和推广就要到哪里。”
刘烈宏表示,我国是第一个把数据作为生产要素的国家,近年来,我国大力推动高质量数据的供给,出台了高质量数据集建设相关文件,多部门联合推动相关工作,人工智能实现快速发展。
下一步,国家数据局将通过体系化布局持续推进高质量数据集建设,加快打造具身智能、低空经济、生物制造等重点领域数据高地。
来源:中国青年报客户端