核心观点与关键数据
公开语料趋于枯竭,价值范式转移
- 公开人类文本存量约300万亿token,预计2028年耗尽,迫使行业从「数据规模」转向「质量、专业度与多模态扩容」。
- 数据需求指数级膨胀:训练计算量每5个月翻倍,数据集规模每8个月翻倍。
市场规模与增长
- 广义口径:2024年约60-90亿美元,2025年约100-160亿美元(毛口径买方支出)。
- 狭义口径失真:真实支出多在标注与RLHF/专家数据服务,而非打包数据集。
- 细分赛道高速增长:
- 合成数据(最快):CAGR 35.3%,2025年32亿美元,2030年171亿美元。
- 标注工具:CAGR 28.4%,2025年32亿美元,2030年343.8亿美元。
- 采集与标注:CAGR 28.1%,2025年2.18亿美元,2030年17.88亿美元。
价值链与资本
- 八层结构:越靠近「专家级、多模态、可验证」的一端,单位价值越高。
- 估值狂飙:ScaleAI被Meta投资143亿美元估值290亿,SurgeAI估值超250亿美元。
- 内容授权走向规模化:早期34笔交易总承诺约29.2亿美元。
合规与监管
- 版权诉讼频发:截至2025年10月达51-166起,合规数据获显著溢价。
- 欧盟AI法案:要求训练数据透明度,将「合规」从自愿变为法定义务。
- 中国AIGC版权裁决:首例AI生成图片版权案(迪士尼案)、GenAI输出侵权裁决(奥特曼案)。
全球格局与中美双核
- 美国前沿数据公司估值达软件级,中国玩家多为「盈利但体量小」的上市/挂牌企业。
- 中国进展:合成灵巧抓取数据集达10亿规模,头部具身公司部署百台机器人。
- 中美数据市场驱动逻辑不同:
- 美国:前沿实验室拉动+专家数据溢价+VC催化。
- 中国:「数据要素」国家战略+垂类模型驱动。
未来趋势
- 合成数据走向主导:预计2030年占比全面超越真实数据。
- 专家/前沿人类数据崛起:5具身AI与世界模型成增长极。
- 数据飞轮成护城河:美国前沿实验室+专家数据溢价,中国数据要素战略+垂类落地。
研究结论
胜负手正从「更多算力」转向「更优质、更合规的数据」;公开语料枯竭非终点,而是价值化的起点。