最早引起我警觉的是一篇时空异常检测方向的投稿:作者采用某城市路网流量数据开展研究,所得结果的曲线平滑度接近教科书示例。但业内皆知,真实交通流量序列必然存在波动,传感器误差、时钟偏差、交通管制、天气变化等各类因素均会改变路网特征。我要求作者提供原始采样频率与缺失值处理方式,对方未作出正面回应。
传统数据不端行为以篡改真实数据为主,往往会留下痕迹;当前更为常见的情形,是真实数据经AI“重建”——经过去噪、补全缺失、平滑跳变处理后,单个数据点看似合理,整体分布却已无法反映真实状况。
如果说第一类是数据层面的“化妆”,第二类则出现在实验设计层面,且更为普遍:部分投稿中的异常检测模型F1指标(一种性能评估指标,取值范围为0~1,越接近1表示模型越好)高达0.99,在多个公开基准数据集上全面超越现有方法。我在核查时重点关注三点:训练集与测试集如何划分、是否报告多次随机运行结果、是否完成消融实验。一些投稿经不住追问。此类问题未必出自主观恶意,多因研究者对研究规范认知不足,但AI工具客观上降低了“无意识违规”的门槛,也使审稿人更难区分疏忽与蓄意造假。
前两类尚且属于方法失范,第三类则直接动摇研究的合法性,也是最令我忧心的问题。AIGC检测模型的训练需要大量真实人类创作内容作为负样本。我曾审阅一篇投稿,作者声称采集了某平台真实用户内容,但文本风格、标点习惯、错别字分布高度一致,符合AI批量生成的典型特征。退回修改后作者承认,为扩充数据集,其使用大模型合成了部分样本,且未在文章说明中标注。其中荒诞之处在于:该研究的目标是识别AI生成内容,训练数据却来自AI,指标再高也不过是自循环验证。
我的博士生导师管晓宏院士常说,研究要从物理世界来、回物理世界去,模型的可用性取决于真实工况下的运行稳定性。在电力系统中,一个被平滑处理掉的异常点,便可能对应一起未被发现的安全事故。共事多年的沈超教授也提出,AI的安全边界依靠标注失效场景来划定,敢于写明方法适用局限的论文,价值远高于五篇只报告正面结果的文章。
但如今,AI已将数据“美化”的成本降至近乎为零——一句提示词即可完成数据整理、结果重建、配套解释生成,连“局限性讨论”都可以一并由AI代笔。学术不端的风险由此成倍放大:一次随意的数据优化足以令整篇论文的结论不成立;若此类模型流入工程现场,误报、漏报造成的损失,最终将由一线运维人员乃至社会公众承担。
科研最珍贵的不是算力,也不是模型架构,而是保留原始数据偏差的勇气、承认工况不符的诚实。AI可以美化论述,却不能代替研究者为数据真实性负责。
讲述人:清华大学机械工程系副研究员 周梦然
过去需要花费数周甚至数月反复实验、试错的工作,现在AI几分钟就能得到一套看上去“相当完整”的答案。那真实实验是不是可以少做一些,或者完全用模拟预测替代实验?
有一次,我组里的一名博士研究生利用已有实验数据和文献数据,建立了一个镁锂合金搅拌摩擦加工后力学与耐腐蚀性能预测的模型。基于对搅拌头转速、加工速度等参数和材料最终性能进行建模与预测,模型很快给出了一个较为清晰的“最优工艺窗口”:某一组参数组合得分最高,强度预测最好,材料腐蚀速率也最低。一次课题讨论中,这名博士研究生兴奋地向我建议:“老师,既然预测结果已经这么明确清晰了,后续只做两三组‘最优参数’验证即可,其余实验可以省掉。这样既节省材料和机时,也能让论文推进得更快。”
我从事的是利用搅拌摩擦开展铝/镁等轻合金材料焊接及其增材制造研究。物理过程看起来很简单:一个搅拌工具头旋转、插入材料、沿着焊缝前进,最终使材料在“不熔化”的条件下实现连接,但事实上这个过程中材料内部情况远比想象的复杂得多,温度变化、应变梯度、应变速率、材料流动、动态再结晶、织构演变以及界面状态彼此耦合,任何一个局部变化,都可能影响最终所获得材料的性能。
正因如此,我向全组人员解释:我并不排斥AI。相反,我认为它会成为未来科研不可缺少的工具。它可以帮助我们缩小实验范围、优化方案、提出假设,甚至告诉我们哪些地方最值得重点验证。但目前“基于大语言模型”的AI,能给出的只能是“基于理论与他人结果最可能发生什么”,实验要回答的却是“事实上发生了什么,怎么发生的”。如果科研只去验证模型最有把握的答案,看似效率提高了,实际上也把最可能产生新发现的地方删掉了。
