智能问答技术正从PC端向移动端发展,旨在构建无处不在的问答引擎。其核心解决方案包括基于社区的问题回答、基于知识图谱的问题回答和阅读理解三种方式。
基于社区的问题回答主要依赖语义匹配技术,通过模型对问题进行编码和交互,实现答案的精准匹配。然而,现有方法存在Query-问题匹配精度损失和召回损失、答案质量问题(如非所问、权威性、时效性)等挑战。为解决这些问题,需优化语料库构建,并采用CNN-DSSM、QRNN和注意力机制等方法增强文本表示。
基于知识图谱的问题回答通过整合外部知识,提升答案抽取的精度和置信度。但该方法面临文本长度差异大、常识性错误、数据噪声等问题。为应对这些挑战,可加入答案存在性判断,融入长距离信息传递机制,并引入基于Bootstrapping的数据增强机制。
阅读理解技术则需应对复杂互联网文档带来的挑战,如长文本处理、数据噪声等。通过更新LossFunction、引入数据增强机制等方法可提升模型性能。此外,基于隐含答案信息的问题生成方法(如QuestionGenerationàCQA)可有效解决所生成问题是否可回答的问题。
智能问答技术仍面临利用知识常识、推理能力、领域切换和置信度机制等挑战。未来需进一步优化算法,提升技术成熟度。