安徽省《交通管理大数据中心数据模型建设规范》DB34/T4641-2023,自2024年01月18日起实施。
本文件确立了交通管理大数据中心数据模型建设流程,并规定了交通管理大数据中心数据模型建设的数据处理、特征选择、数据建模、模型评估、模型发布。本文件适用于交通管理大数据中心数据模型建设。
本规范确立了安徽省交通管理大数据中心数据模型建设的标准化流程,覆盖从原始数据提取、治理、特征工程到模型构建、评估与发布的全生命周期。本规范以公安交通管理领域的驾驶人、机动车、违法、事故、过车、道路、卡口设备及气象等多源异构数据为基础,系统规定了非空核验、去重、错误删除及类型规范等治理要求,并引入衍生特征构造、二值化、哑变量、标准化及分箱等处理手段。在此基础上,本规范将模型划分为业务规则类、预测预警类和异常检测类三大场景,分别明确了适用场景、数据输入、算法选择、训练策略及输出要求,并设定了上线部署的量化评估阈值,旨在为交通管理大数据中心提供一套可操作、可验证的模型建设技术支撑。
本规范详细规定了数据处理的硬性约束,要求对驾驶人身份证明号码、机动车号牌号码及违法编号等核心字段实施非空核验与重复数据去重,同时删除准驾车型代码不存在、违法记分数值异常等错误记录,并将日期类字段统一为规范类型。在特征选择环节,本规范明确通过计算驾龄、车辆违法次数、是否强制报废等衍生特征来丰富数据维度,并采用二值化法处理性别等二分类变量、哑变量法转换车辆类型等多类别特征,以及标准化和分箱法对连续型特征进行离散化处理,最后利用随机森林或决策树算法剔除重要性最低的10%特征以精简模型输入。
本规范定义了三种核心模型的建设路径。业务规则类模型针对假牌车、套牌车、逾期未检验及报废车上路等场景,直接通过规则计算输出标签值。预测预警类模型聚焦驾驶人、机动车及道路的安全风险分级,首选XGBoost算法,按75%、15%、10%的比例划分训练集、验证集与测试集,输出重大、较大、一般及低四级风险。异常检测类模型覆盖设备异常、非法营运识别及流量激增预警,非现场违法取证设备异常检测宜采用Prophet算法,机动车非法营运识别宜用iForest算法,两者分别以时间序列维度和异常标签值判定异常结果。
本规范针对不同模型设置了明确的量化评估方法与上线门槛。业务规则类模型通过数据源验证、实际业务流程比对进行综合判断,统计准确率大于0.95方可上线。预测预警类模型采用F1值作为核心评估指标,要求F1值大于0.9才可部署。异常检测类模型中,时间序列类的均方根误差需小于0.1,非时间序列类的AUC值需大于0.9,评估方法则分别规定了K折交叉验证或留一法等。模型达到预定效果后,应通过交通管理大数据中心开放平台完成发布。
下载本地,更方便阅读