国内刊号:41-1128/TV
国际刊号:1000-1379
发布日期:
作者:晋磊, 徐鹏, 黎杰, 蔡迎春, 杨海波
单位:1.郑州大学 水利与交通学院,河南 郑州 450001;2.中国电建集团 贵阳勘测设计研究院有限公司,贵州 贵阳 550081;3.国家隧道掘进机与智能运维重点实验室,河南 郑州 450001
关键词:泥石流灾害;知识抽取;质量评估;知识融合;Word2Vec
基金:<p class=\MsoNormal\>\r\n\t<span>国家重点研发计划项目(</span>2022YFC3004402<span>);河南省重点研发专项(</span><span>221111321100</span><span>)</span>\r\n</p>
在大数据、物联网与人工智能技术快速发展的背景下,泥石流灾害数据正日益呈现出海量、多源、异构的特点。主要采用jieba、NLPIR和LTP等分词工具抽取模型库,对非结构化存储的泥石流灾害数据进行解析与抽取,并汇聚至数据库,实现数据融合。通过Word2Vec模型将词语映射到高维空间中,实现文本中的词汇转换为实数向量;采用t-SNE算法和Kernel PCA算法将高维词向量转换为低维度的向量,使用K-means算法对其进行聚类可视化。研究结果表明:在数据抽取评估方面,一致性、完整性、准确性的评估均值在0.800以上,均方差小于0.050。对比PCA和t-SNE两种降维方法,通过轮廓系数(Silhouette Score,SS)评估聚类效果,PCA的SS指标值为0.359,t-SNE的SS指标值为0.336,结果显示PCA表现更优。Bert模型具有较强的上下文理解能力,更加适合泥石流灾害数据抽取,依托Word2Vec模型的CBOW架构获取词向量,结果显示PCA在评价指标上整体表现优于t-SNE。针对泥石流灾害数据多源和语义一致性问题,涵盖从数据抽取、降维到聚类的全过程,为实现泥石流灾害数据的语义融合与统一管理提供了有效支持。
来源:2025年第7期
《人民黄河》期刊编辑部