从卷算法算力转向卷数据,刘烈宏:进一步构建服务人工智能的高质量数据供给体系

建设高质量数据集,正成为赋能人工智能发展的核心抓手。7月18日,在2026世界人工智能大会“语料筑基、智生时代”语料创新论坛上,国家数据局局长刘烈宏表示,随着人工智能从通用基础大模型向行业大模型纵深拓展、从数字模拟向物理交互跃迁、从感知认知向自主决策执行演进,高质量数据集越来越成为驱动人工智能发展的关键变量。
据刘烈宏介绍,截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB;七个数据标注先行先试城市标注规模超119PB,服务425个大模型研发。下一步,国家数据局将深入实施强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大行动,进一步构建服务人工智能的高质量数据供给体系。
希望上海继续发挥排头兵作用,积极推进“模数共振”,为人工智能高质量数据集建设提供示范。上海市信息投资股份有限公司副总裁、上海库帕思科技有限公司董事长山栋明指出,AI 2.0时代的模型正在发生深刻变革。
虽然大参数、多模态模型依然是行业竞争的焦点,但模型的发展也在向细分赛道延伸,面向行业落地的小参数生产力模型成为重要方向。山栋明认为,无论是模型持续攀高还是应用落地,都在明显的从卷算法、卷算力,向卷数据转变,而这一转变的核心在于数据必须紧扣AI-Ready标准。
在应用层面,AI正从简单的“你问我答”向复杂的“任务执行”演进,这也重塑了底层的工程方法论。会上,语料运营公共服务平台2.0正式发布,首创了“筛选-转换-合成”三层十级数据进化路线,并集成Kupas Camp语料FDE工程平台、老师傅语料工程化平台和“语匠”专家众包网络,形成从规划咨询、产品设计到数据工程实施的体系化能力,推动行业专家潜知识向可用、可调用、可评测的显知识转化,重新定义数据新基建。
同时,大会新增发布了15项团体标准和两项行业标准,针对高端装备、消防、医疗专病、艺术人才培养、国际物流供应链、文物、钢铁、合成数据和大模型数据集开发管理等方向,覆盖语料采集、清洗、标注、评测、应用和运营管理全流程,持续坚持“一业一方法、一业一指引”。
面向AI4S发展,科学数据服务AI4S可持续发展倡议正式发起。倡议提出,高置信、过程型、全样本科学数据是AI重塑科学计算和科学发现的重要基石,将围绕流程重塑、标准引领、价值对齐和平台创新四个方面协同发力,推动科学数据采集、预处理、标注、对齐、流通和使用全流程贯通,促进科学智能数据向AI-Ready迈进、向Agent-Ready演化。
大会还同步进行了CICC语料数据智能创意大赛和语料风云榜的颁奖仪式,并正式启动了“DARE GO达·高”跨领域高价值语料数据征集计划。
AI 解读 · 为什么重要
让 AI 拆解这条资讯的核心要点、影响与你该关注什么。
追问 AI
内容聚合自澎湃新闻,AI 解读由「认知」生成,仅供参考。