互联网数据资源正在被AI训练所消耗,预计到2028年,用于训练AI模型的数据集规模将达到公共在线文本总量的估计规模,数据耗尽问题日益严峻。主要问题包括:1)互联网文本数据增长缓慢,年增长率不到10%,而AI训练数据集规模每年增长一倍以上;2)内容提供商收紧数据使用规则,阻止网络爬虫抓取数据,导致数据获取难度增加。数据来源的法律诉讼也对AI开发构成挑战,如《纽约时报》起诉OpenAI等案件可能影响数据获取。应对策略包括:1)获取非公共数据,如WhatsApp消息或YouTube视频转录内容;2)使用合成数据,OpenAI每日可生成1000亿个单词;3)再利用现有数据,提高数据利用率;4)转向小而高效的LLM,专注于特定任务,减少对大规模数据的依赖。研究结论表明,AI发展可能不再依赖更大数据,而是通过“更聪明的算法”提升性能,如OpenAI的o1模型强调“推理训练”和反馈依赖。AI可能只需“坐下来思考”,因为其“基础知识库”已足够丰富。