中国人工智能学会系列白皮书—语言智能
语言智能发展历程
语言智能的发展经历了五个主要阶段:
- 早期探索阶段(1950s-1990s):以规则驱动和符号主义为核心,通过预设的语法和语义规则系统来处理语言符号,代表成果包括聊天机器人Eliza和SHRDLU系统。
- 理论奠基与初步尝试(1950s-1970s):图灵测试的提出和乔姆斯基生成语法理论的兴起,为机器语言解析奠定了基础,代表成果包括Eliza和SHRDLU系统。
- 统计方法的初步渗透(1980s-1990s):统计方法逐渐取代纯规则方法,IBM布朗语料库和隐马尔可夫模型的开发标志着统计自然语言处理的开端,代表成果包括IBM Model 1-5系列模型和谷歌搜索引擎。
- 神经网络崛起阶段(2013-2017):词向量技术和循环神经网络的广泛应用,实现了从“词汇数字化”向“语义理解”的范式跨越,代表成果包括Word2Vec和GloVe模型,以及Seq2Seq架构和注意力机制。
- Transformer 革命阶段(2017-2022):Transformer架构的提出和预训练语言模型的建立,推动技术性能实现跨越式提升,代表成果包括BERT和GPT系列模型,以及预训练范式的确立。
语言智能学科
- 概念提出:2013年,周建设教授首次提出“语言智能”概念,将其定义为运用计算机技术模拟人类智能处理语言信息的过程。
- 概念内涵:狭义上,语言智能指机器理解、生成和处理人类语言的能力;广义上,语言智能包括“语言自然智能”和“语言人工智能”。
- 学科框架:语言智能学科以语言智能为研究对象,系统研究语言智能的学科内涵、基础理论、关键核心技术及其在不同场景中的创新应用。
- 学科建设现状:国内多所高校已设立语言智能专业或研究方向,并取得了一定的成果,但仍面临跨学科深度融合不足、核心技术原始创新能力有待提升、应用场景实际落地面临多重现实壁垒等挑战。
语言智能技术
- 基础支撑技术:包括自然语言理解、语音信号处理、图像视觉处理、词向量技术、预训练语言模型和大语言模型等。
- 语言智能应用技术:包括机器翻译、智能问答、对话系统、文本分类、主题建模、阅读理解和多模态理解与生成等。
语言智能应用
- 语言能力评价:包括作文批改和儿童语言能力评价,通过自然语言处理技术实现从结果判定到过程干预的跃升。
- 东南亚低资源语言机器翻译技术:针对东南亚低资源语言,突破语料与文化瓶颈,构建“神经机器翻译→知识增强→大模型优化”技术梯队。
- 负面情感分析技术:攻克反讽识别与隐式情绪挖掘,筑牢公共安全与金融风控决策基座。
- 面向多模态语义关联的语言智能:以多模态知识图谱为枢纽驱动跨模态语义对齐及多跳推理,助推工业质检、医疗诊断等场景智能升级。
语言智能未来
- 高效训练与推理技术:新型架构和训练方法将突破Transformer限制,降低数据依赖和隐私风险。
- 可信AI与可解释性技术:可解释性成为大模型核心属性,可信AI体系逐步完善。
- 多模态融合与通用智能:多模态知识图谱将推动语言智能从符号认知向跨模态具身认知跃迁。
- 垂直领域的深度适配:大模型将向专业化、精细化演进,形成“大模型 + 行业平台”范式。