大模型认知
语言模型预训练完成后,仍需大量标注数据进行微调。例如,OpenAI在过去六个月中雇佣了约1000名合同工,其中60%从事数据标注工作。标注数据对提升模型能力至关重要,如GPT-NeoXT-Chat-Base-20B-v0.16模型通过超过4000万条指令在100%碳负计算上进行微调。
能力涌现与评价指标
所谓的能力涌现可能仅是评价指标的问题。LLM涌现能力的两个决定性属性是敏锐性和不可预测性,超过92%的涌现能力在这两个度量下出现。若将度量从非线性/不连续改为线性/连续,性能提升将平滑、连续且可预测。
大模型推理能力
大模型是否具备真正的推理能力仍有待讨论。ChatGPT和GPT-4在逻辑推理基准测试中表现优异,但在处理分布外数据集时仍存在困难,自然语言推理任务上的性能仍有待提高。
大模型应用场景
并非所有场景都需要千亿大模型。语言学任务(词性、句法等)、组块语义任务(语义匹配、关系抽取等)和世界知识任务(指代消解等)可通过更小模型高效完成。
ChatGPT的核心能力
ChatGPT真正做的事情是文字接龙,展现了超强的文本建模能力(25K英文单词的理解和生成能力)、多任务统一学习范式和任务泛化能力。
小模型时代的难点
小模型时代面临任务开发成本高、时间周期长、模型开发和维护成本高以及高水平算法研究员稀缺等问题。
大模型时代的变革
未来任务范式将发生巨大变化,使用自然语言对模型进行训练和使用,如“【句子输入】,上述文字表达了褒义和贬义倾向?”。
大模型优势
大模型优势在于少量算法研究员即可快速训练新任务,无需重新部署,且可低成本产品化。银行等场景可应用大模型进行情感分析和实体识别。
大模型时代的NLP研究变化
大模型时代从单个小任务研究转向一类问题统一框架研究,挑战在于赢者通吃,但机遇在于NLP从手工作坊转向蒸汽机时代。面向B端私有化部署的“小”模型成为重点。
大模型研究重点
领域大模型(对话、摘要、改写等)、1B-50B模型族、可控文本生成、隐私大模型、鲁棒性评测与提升、超小规模任务模型构建、大模型推理能力构建、大模型可解释性、因果机制与大模型融合、中文开源大模型族(1-20B)。
大模型构建方法
Megatron-DeepSpeed和NVIDIA/Megatron-LM等框架被用于构建大模型。大模型需要好的基础语言模型、足够且合适的任务训练数据和训练方法。
具体实施步骤
- 基础语言模型选择(中英文能力、Code能力、模型大小;任务相关文本增强)
- 任务数据构造(任务种类、指令构造、数据构造)
- 类人回答(Award函数选择、Award函数训练)
结论
大模型依然是统计机器学习范畴,不应被神话和拟人化。C端应用大模型,B端可使用“小”模型。