大模型认知与ChatGPT的能力分析
语言模型预训练与标注数据需求
- 语言模型预训练完成后,仍需大量标注数据进行微调。
- OpenAI为提升AI模型能力,招聘约1000名合同工进行数据标注,其中60%在过去六个月内入职。
- 标注数据需求高,例如OpenAI要求开发者完成编码问题并解释解决方案,甚至要求详细描述并修复bug。
大模型能力涌现的讨论
- 所谓能力涌现可能仅是评价指标的问题。
- LLM涌现能力的两个决定性属性:敏锐性(从“不存在”到“存在”的瞬间过渡)和不可预测性。
- 若使用线性/连续的度量标准,模型性能提升呈现平滑、连续和可预测的趋势。
大模型推理能力的局限性
- 大模型在逻辑推理阅读理解基准上表现优异,但在分布外数据集上表现不佳。
- 自然语言推理任务上的逻辑推理能力仍有待提高。
大模型并非适用于所有场景
- 语言学任务:词性、句法、组块语义。
- 世界知识任务:指代消解。
- 小模型在特定任务上更高效,例如低成本的模型开发和维护。
ChatGPT的能力与作用
- ChatGPT的核心功能是文字接龙,展现了超强的文本建模能力。
- 多任务统一学习范式,将所有NLP任务统一到生成式多任务学习框架。
- 任务泛化能力,数千种任务统一框架学习后,部分无标注数据任务效果良好。
大模型时代的机遇与挑战
- 小模型时代的难点:任务开发成本高、模型开发和维护成本高、高水平算法研究员稀缺。
- 大模型时代的优势:少量算法研究员即可快速训练新任务,低成本产品化。
- 银行应用方式:通过自然语言输入进行情感分析、实体识别等任务。
大模型时代的NLP研究变化
- 从单个小任务研究转向一类问题统一框架研究。
- 挑战:赢者通吃,代差效应明显,用户数据获取困难。
- 机遇:NLP从手工作坊转向蒸汽机时代,面向B端私有化部署的“小”模型。
大模型时代的NLP研究重点
- 领域大模型:对话、摘要、改写、NLP任务集成等1B-50B模型族。
- 大模型可控文本生成、隐私保护、鲁棒性评测与提升。
- 超小规模任务模型构建(1M-50M),探索是否可脱离深度神经网络。
- 大模型推理能力构建、可解释性、因果机制与大模型融合。
- 中文开源大模型族(1-20B)。
大模型构建方法
- 基础语言模型选择:中英文能力、Code能力、模型大小、任务相关文本增强。
- 任务数据构造:任务种类、指令构造、数据构造。
- 类人回答:Award函数选择、Award函数训练。
大模型应用案例
- InstructUIE:多任务指令微调用于统一信息抽取。
- 任务示例:命名实体识别(NER),输出格式为(word, type)。
总结
大模型依然是统计机器学习范畴,不应被神话和拟人化。