FEATURED · 精选文章

中国城市 PM2.5较高浓度风险识别

发布时间 / 2026/9/2 22:08:23
来源 / 创域科博编辑部
栏目 / 资讯中心
中国城市 PM2.5较高浓度风险识别 1 研究背景与分析目标空气质量监测数据通常同时包含颗粒物和多种气态污染物。不同污染物之间既存在共同排放来源也会受到气象扩散、化学转化和地理位置影响。通过机器学习识别PM2.5较高浓度风险可以展示环境数据的清洗、长宽表转换、类别不平衡处理和模型解释方法。本案例的目标不是替代环境监管标准而是建立一个可在Jupyter Notebook中完整复现的分类流程。分析重点包括数据质量识别、污染物分布和相关性、站点分组划分、多模型比较、阈值权衡以及错误样本解释。2 数据来源与适用范围使用公开世界空气质量快照中的中国记录制作可直接运行的CSV文件。原始记录来自多个空气质量数据源数据字段包括国家代码、城市、监测点、坐标、污染物、单位、数值和更新时间。需要特别说明的是不同监测源的更新时间并不一致。虽然记录时间覆盖至2024年但样本主要集中在2021年因此本报告只分析污染物横截面关系与风险识别不进行全国年度趋势推断。3 数据字段与分析流程字段含义国家代码国家或地区代码城市城市或区域名称监测点监测站点名称坐标纬度和经度污染物PM2.5、PM10、NO2、SO2、CO或O3数据源监测数据提供来源单位污染物浓度单位数值监测浓度更新时间该条记录的更新时间4 数据质量与探索性分析4.1 中国空气质量记录的年份分布数据现象记录年份覆盖 2018—2024 年但样本明显集中在2021年2024年仅代表部分来源的最新快照。4.2 各类污染物监测记录数量六类主要污染物记录数量接近说明多数站点同步提供颗粒物和气态污染物指标。4.3 清洗前主要数据质量问题数据现象共发现 2 条负值或哨兵异常站点和时间字段整体完整。原因分析监测系统可能用-9999等特殊数值表示设备故障、无上传值或无效观测。4.4 PM2.5浓度分布数据现象PM2.5中位数为 18.0 µg/m³、均值为 21.5 µg/m³分布具有明显右长尾。原因分析污染事件通常低频但强度较高使环境浓度数据呈现多数低值、少量极高值的偏态结构。4.5 PM2.5风险标签分布4.6 各污染物浓度的对数分布比较数据现象各污染物数量级和离散程度差异明显CO原始尺度远高于其他指标。原因分析污染物物理浓度、排放来源及监测尺度不同不能直接使用同一原始纵轴比较。4.7 污染物与地理变量相关性热力图4.8 PM10与PM2.5的关系数据现象PM10升高时PM2.5整体同步上升较高浓度样本集中在右上方但散点仍存在离散。原因分析颗粒物共享来源但细颗粒占比受燃烧类型、扬尘、湿度和化学转化影响。4.9 不同纬度区间的较高浓度样本比例5 特征工程与建模设计5.1 标签与特征目标变量为“较高浓度风险”PM2.5大于35 µg/m³记为1否则记为0。该阈值用于构造教学型二分类问题不对应法定空气质量等级。模型输入不包含PM2.5本身使用PM10、NO2、SO2、CO、O3、纬度、经度、月份和小时。5.2 数据划分采用GroupShuffleSplit按站点划分训练集1,197条、验证集241条、测试集248条。这样可避免同一站点的地理和命名特征同时出现在训练和测试阶段。\5.3 模型设置模型保持简洁多数类基线用于识别虚高准确率逻辑回归作为线性可解释模型决策树用于表达简单非线性随机森林通过多棵决策树集成提高稳定性。逻辑回归、决策树和随机森林均使用类别权重平衡少数类。未使用XGBoost、LightGBM、深度学习或复杂参数搜索。5.4 验证集模型指标模型准确率精确率召回率F1值ROC-AUCPR-AUC随机森林0.88800.53330.80000.64000.93870.6685逻辑回归0.88380.52170.80000.63160.91580.6429决策树0.85890.46150.80000.58540.87800.5299多数类基线0.87550.00000.00000.00000.50000.12456 模型评价与结果解释6.1 验证集模型指标对比多数类基线无法识别较高浓度样本随机森林在ROC-AUC、PR-AUC和F1上综合领先。6.2 随机森林测试集混淆矩阵模型识别 28 条较高浓度样本漏判 11 条并误报 11 条一般浓度样本。错误主要来自阈值附近样本不同类别在特征空间存在重叠。6.3 测试集ROC曲线6.4 测试集PR曲线6.5 分类阈值对识别结果的影响6.6 随机森林特征重要性6.7 不同实际类别的预测概率分布7 主要结论•数据包含11,115条中国空气质量长表记录六类污染物记录数量相对均衡但年份集中适合横截面关联分析而非长期趋势推断。•完整建模样本为1,686条较高浓度样本占14.2%类别不平衡使多数类基线产生表面准确率但无法识别风险。•PM10与PM2.5相关系数约为0.85是最主要的模型特征NO2、CO、O3和空间位置提供补充信息。8 局限性与改进建议具体细节见原文创造不易谢谢各位多多点赞收藏
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻