2025年7月29日,发布国家标准《高质量数据集分类指南(征求意见稿)》。
本文件规定了高质量数据集的类型划分,给出了类型要素、类型特征、分类方法。本文件可为开展高质量数据集分类活动提供指导。
本指南旨在为我国高质量数据集的分类提供统一规范,以填补当前领域标准空白,更好支撑人工智能模型的开发与训练。本指南将高质量数据集划分为通识数据集、行业通识数据集与行业专识数据集三大类,并围绕知识内容、来源类型、时效性、标注人员类型、敏感程度、模型类型及主题范围七个类型要素,系统界定了各类数据集的核心特征。在分类方法上,本指南提出优先按行业专识、行业通识、通识的顺序进行逐级判定,帮助建设方与使用方根据数据集所承载知识的深度与业务属性准确界定其类型,从而促进数据集供需精准匹配与高效流通。
本指南明确通识数据集承载面向社会公众的常识性知识,侧重基础概念与通用原理,无需专业背景即可理解。行业通识数据集承载行业领域内的共性知识,涵盖基础理论与通用技术,要求使用者具备一定的行业背景。行业专识数据集则聚焦组织机构内部研发、生产、管理等业务环节产生的经验性知识,需要深厚的行业经验与业务洞察才能运用,是三类型中知识深度与专属性最强的。
本指南从七个维度构建分类特征体系。知识内容决定知识的普适性或专业性;来源类型涵盖网络资源、文献、业务系统等不同渠道;时效性反映数据变更频率;标注人员类型区分了普通标注员与资深专家;敏感程度明确数据安全限制强度;模型类型指明了所支撑的通用、行业或场景模型目标;主题范围则界定数据涉及领域的宽窄。
本指南推荐采用“先专后通”的判定逻辑,即通过检验数据集是否满足行业专识数据集在知识深度、来源内部性及安全敏感度等方面的特征,再从是否符合行业通识数据集特征,至最后归入通识数据集,逐步完成类型界定。该路径为企事业单位在数据集的分类建设和管理中提供了可操作的标准化实践方案。