Key points are not available for this paper at this time.
准确预测河流水质对环境可持续性和公共健康至关重要,尤其是在淡水资源日益短缺的情况下。本研究开发了一个强大的机器学习(ML)框架,以利用来自台湾环保署的全面36年国家数据集预测河流污染指数(RPI),覆盖超过500个监测站。我们对集成方法(CatBoost、XGBoost、NGBoost)和非集成基准(SVM、ElasticNet和1D CNN)进行了系统比较。超参数通过贝叶斯优化进行优化,通过在30个独立实验中评估一系列互补指标(RMSE、MAE、R²、A10指数)确保统计显著性。结果表明,集成模型相较于非集成模型具有一致的优势。其中,CatBoost达到了最高的准确性和稳定性(RMSE ≈ 0.85,MAE ≈ 0.61,R² = 0.78),相较于SVM和ElasticNet将预测误差减少了约20%。这些发现突显了集成学习技术捕捉水质数据中复杂非线性交互的能力。本研究提出两个主要贡献:(1)在长期国家数据集上系统地实施、优化和比较集成与非集成ML模型用于河流污染预测;(2)识别基于集成的方法,特别是CatBoost,作为增强RPI预测和支持可持续水资源管理中知情决策的强大数据驱动工具。• 在来自台湾的36年全国河流污染数据集上评估ML模型。• 比较集成(CatBoost/XGBoost/NGBoost)与非集成方法(SVM/CNN)。• CatBoost实现了超越稳定性和准确性(RMSE ≈ 0.85,R² = 0.78)。• 集成模型相较于非集成基准减少了约20%的预测误差。• 贝叶斯优化和30次实验验证了模型的稳健性和可靠性。
Nogueira等人(周三)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: