一款强大的新型人工智能工具揭示了可能是现代科学领域最大的诚信问题之一。在分析了1999年至2024年间发表的260万篇癌症研究论文后,研究人员识别出超过25万项研究的写作模式类似于被怀疑由欺诈性“论文工厂”产出的论文。
这项发表在《英国医学杂志》(The BMJ)上的研究,分析了1999年至2024年间发表的260万篇癌症研究论文。该研究由昆士兰科技大学(QUT)公共卫生与社会工作学院及澳大利亚卫生服务与创新中心的研究员Adrian Barnett教授领导,并与一个国际合作团队共同完成。
研究人员发现,超过25万篇论文的写作模式,与那些因涉嫌伪造而被撤稿的研究相似。
“论文工厂是出售虚假或低质量科学研究的公司。它们正在以工业化规模生产‘研究’,我们的发现表明,癌症研究中的这一问题比大多数人意识到的要严重得多,”Barnett教授说。
论文工厂如何制造虚假研究
论文工厂出售署名位置,在某些情况下,甚至出售完全现成的科学论文。这些研究可能包含重复使用的文本、不寻常或生硬的语言,以及伪造的数据或图像。
“最有可能的是,它们依赖于样板模板,这可以通过分析文本模式的大型语言模型检测出来,”Barnett教授说。
为了搜寻这些模式,Barnett和他的同事训练了一个名为BERT的语言模型。该系统旨在识别那些在已知论文工厂产品中反复出现的细微文本“指纹”。
在使用经过验证的样本进行评估时,该模型检测可疑论文的准确率达到91%。
“我们本质上建立了一个科学界的垃圾邮件过滤器,”Barnett教授说。
“就像你的电子邮件系统能识别垃圾信息一样,我们的工具会标记那些写作风格和结构与被撤稿的欺诈性研究相匹配的论文。”
可疑癌症论文激增
大规模分析揭示了几个主要趋势:
被标记的论文在过去二十年中急剧增加,从21世纪初的约1%上升到2022年超过16%的峰值。
这一涉嫌存在的问题遍布主要出版公司发行的数千种期刊,其中包括享有盛誉的高影响力期刊。
可疑论文在分子癌症生物学和早期实验室研究等领域尤为常见。
某些癌症类型,包括胃癌、肝癌、骨癌和肺癌,其被标记研究的比率特别高。
期刊开始测试AI工具
已有三家科学期刊将测试该系统作为其编辑审查流程的一部分。其目的是帮助编辑在将潜在伪造的手稿送交外部专家进行同行评审之前将其识别出来。
研究人员还计划将该工具调整适用于其他科学领域。他们预计,随着更多经证实的论文工厂活动案例可供参考,该工具的准确性将进一步提高。
然而,该团队强调,被系统识别出的论文不应自动被视为欺诈。这些结果只是预警信号,而非经证实的学术不端发现,每个案例仍需由人类专家进行审查。
虚假研究为何会伤害患者
“癌症研究影响着临床试验、药物开发和患者护理,”Barnett教授说。
“如果伪造的研究混入证据库,它们可能会误导真正的科学家,最终阻碍患者的治疗进展。这就是为什么我们必须抢在问题前面采取行动至关重要。”