大模型“人情味”实验总结
主要发现:
1. ****GPT-4的人情味最初较低,但在经过特定prompt调整后,其人情味得分迅速提升,超越了其他模型。
2. ****国内大模型在老年人相关问题上的回答更具有人情味,而国外大模型在职场压力和焦虑问题上的回答更贴合人情味。
3. 在处理发展相关问题时,国外大模型表现出更高的人情味得分。
4. 国内大模型在人际关系领域展现出更强的人情味特质。
**5. **在“教原理”与“喂作业”两种prompt策略中,“教原理”策略对提升大模型的人情味更为有效。
**6. **国内大模型与人类撰写答案相比,在人情味的各维度上均表现较好。
**7. **公众科技力的概念被提出,强调普通人对科技创新的参与和贡献。
实验过程与方法:
- 实验设计:设计了人情味量表,包含拟人、共情、表达三个维度。
- 实验对象:选取了5款国内外大模型,包括GPT-4、Vicuna、以及3款国产模型。
- 实验步骤:通过特定prompt调整,评估模型人情味变化,识别最佳组合方式。
- 结果分析:对比未调整和调整后的模型表现,发现“教原理”策略在某些模型上更有效。
- 结果应用:通过实验,提出“公众科技力”的概念,鼓励更多普通人参与到科技创新中。
结论:
通过实验,我们发现不同大模型在处理不同类型问题时,其“人情味”表现存在差异。通过精心设计的prompt,可以显著提升大模型的人情味表现。同时,强调了公众科技力的重要性,鼓励更多普通人参与科技创新,共同推动技术发展与社会福祉的融合。