政策文本挖掘是将人工智能和自然语言处理技术应用于政策文件分析的重要手段,其核心目标是把海量、非结构化的政策文本转化为结构化、可比且定量的证据,从而超越简单的政策有无判断,实现对政策强度、法律框架稳定性和资金流向的规模化、可重复系统评估 【1】 。
在具体应用中,政策文本挖掘会综合多种方法,涵盖基本统计描述、探索性分析和推论分析等阶段 【3】 。例如,有研究通过ERNIE3.0小样本学习技术,构建了包括数据收集、文本分类、量化评分的全流程评估范式,用于评估中国国家、省、市三级自2007年以来的政策强度,为政策演进分析提供了细化支持 【1】 。
在数据来源方面,政策文件全文文本主要通过系统检索权威数据库(如威科先行法律信息库、北大法宝法律法规数据库)和相关部委官方网站获取,经文本提取后生成分析数据集 【3】 。而在技术实现上,除了专业模型,也会使用Microsoft Excel、R和Python等工具完成文本挖掘工作 【4】 【7】 。
此外,还有研究通过提示词工程让AI执行重复性工作,逐期梳理提炼原文,构建时间维度与政策维度相结合的二维政策库,并应用“感-标-锚”三步法进行定性分析,以把握政策语境、语义脉络及强度边界 【9】 。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803