AI医疗对数据量的需求可不小,不同模型和应用场景的“胃口”还不太一样:
- 医学图像模型:比如卷积神经网络(CNN),通常在有约 10,000 张标注图像 时表现就比较良好了。像MIMIC-CXR这样的数据集有377,000张影像,CheXpert Plus有约226,000张正位放射图像,这些都是重要的医学影像数据资源。不过,它们和通用图像数据集ImageNet的约1,400万张图像比起来,规模还是小了不少 【1】 。
- 医学语言模型:对数据量的要求就更高了。例如,面向电子健康档案信息提取的GatorTron模型,其训练语料包含 820 亿个词元 【1】 。
- 更广泛的医疗数据增长:从整个医疗保健体系来看,数据体量非常庞大。预计到2025年,医疗保健数据量将达到 10k个艾字节,这为AI和机器学习应用提供了前所未有的信息库 【3】 。
简单说,AI医疗的数据需求从几万张图像到百亿词元,再到未来海量的艾字节级别,跨度很大,而且整体趋势是数据量越来越大。