Nature重磅曝光:超百个医疗AI模型训练数据大规模造假,虚假预测模型已入侵医院
导语:医疗AI本应是救命的辅助,但《自然》近日揭露了一桩触目惊心的数据造假案:数百个预测脑卒中和糖尿病的AI模型,竟基于数学上不可能存在的虚假训练数据。更可怕的是,这些“中毒”模型已闯入真实医院,开始左右患者的诊疗决策。
《自然》(Nature)杂志近日揭开一起令人不安的医疗AI数据丑闻:超过一百个用于预测脑卒中和糖尿病的AI模型,其训练数据涉嫌系统性伪造,而这些不可靠的模型已经在多国医院中悄然投入使用,直接用于指导真实的临床诊疗决策。
医疗AI的理想路径是通过分析海量患者健康数据,提前预判疾病风险,辅助医生实现精准筛查。但澳大利亚昆士兰科技大学的研究团队发现,这些AI模型的根基——训练数据——却充满了违背医学常识的异常。例如,一个包含五千多名患者的脑卒中数据集,除了BMI指标有极少量缺失外,其余所有变量竟毫无空缺。在真实的临床环境中,患者失访、退出或记录不全是常态,这种近乎科幻的“完美完整性”在生物学和医学上几乎不可能出现。
另一个声称采集自十万人的糖尿病数据集同样疑点重重。正常人群的血糖值应呈现平滑的连续分布,但该数据集中的血糖值却只有18个离散数值,仿佛来自精心编造的模板。更匪夷所思的是,医学上密切相关的BMI与血糖水平在该数据中竟然完全没有统计学关联。面对质疑,数据上传者均以“机密来源”或“保密原因”为由拒绝披露数据出处。
这些“有毒数据”如病毒般迅速扩散。据统计,已有124篇经同行评审的论文使用了这些数据集来训练AI模型,总下载量突破40万次。基于虚假数据得出的研究结论堂而皇之地发表在各大权威期刊上,并被后续研究者层层引用。受影响最严重的国家包括印度、印度尼西亚和中国,其中中国作者发表的涉假论文数量位居第三。
后果远不止于学术诚信的沦丧。调查证实,基于造假数据训练的脑卒中预测AI已正式部署在印度尼西亚的一家医院,另有迹象表明美国某心脏诊所也在使用类似的模型。更令人担忧的是,已有基于此类技术的医疗设备申请专利,且网络上出现了面向公众的自测工具。这意味着无数患者和普通大众可能在毫不知情的情况下,接受了由“脏数据”推导出的健康风险评估。
“垃圾进,垃圾出”——用虚假数据喂养的AI,其预测输出注定谬误百出。这可能导致医生对患者风险产生严重误判:轻则过度治疗,浪费医疗资源并折磨患者;重则延误救治时机,将生命直接推向险境。虽然部分涉事论文已被撤稿,但伤害已经铸成。研究者紧急呼吁,必须强制要求披露训练数据的真实来源,学术期刊应建立严格的数据审查机制,绝不能再让来源不明的AI成为医疗决策中的“黑箱”。在关乎生命的医疗领域,数据的底线就是生命的防线。

