ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

医学科研论文中“数据水分”的识别:审稿人实操与自查指南

医学科研论文中“数据水分”的识别:审稿人实操与自查指南 我平均每年要看四五十篇医学相关投稿其中临床研究、基础实验、荟萃分析什么类型都有。做审稿人这些年有个感受越来越强烈现在很少有人会“大张旗鼓地造假”——这种说法本身就是反讽。现实里的问题往往是另一种形态数据看着合理但稍微一推敲就发现全是“水分”。可能是统计上钻了空子可能是图片被顺手处理过也可能只是原始记录里藏了太多没写出来的筛选和排除。标题里“造假”加了引号其实是咱们这个圈子里心照不宣的默契。这篇博文不是教你当科研警察而是从审稿人的实际操作出发把常用的找水分方法、判断依据、常用工具以及我自己踩过的坑整理出来。适合刚起步的年轻审稿人也适合想提前自查的作者——投稿前自己先当一次审稿人比返修时到处补材料划算得多。1. 先看数字本身数据分布和统计特征的“整容痕迹”1.1 太整齐的数据反而不可信均值、标准差里的异常规律我拿到稿件的第一习惯不是看结论而是直接翻表格里的描述性统计。很多水分数据在这一步就会露馅因为伪造者往往把数据“整理”得过于干净。最典型的是均数和标准差不正常的“整齐”。真实生物医学数据里的标准差通常参差不齐比如收缩压的SD可能是15到25之间波动血红蛋白的SD可能是1到2之间波动。如果一组研究对象的标准差全部精确到小数点后两位而且各组之间几乎一样我一般会提高警惕。正常抽样得到的数据两组SD完全相等不是不可能但概率不高多组SD完全一致那基本可以断定有人工修饰的痕迹。另一个信号是均数的小数点位数。体外细胞实验的抑制剂浓度、蛋白表达量的相对值真实测量值的均值通常不会在每个组都保持相同的小数位数。如果表格里所有均值都恰好是小数点后两位且各个分组之间数值排列得非常规律比如12.35、12.40、12.44、12.50这种等差数列式分布那不太符合随机误差的规律。真实数据应该是“乱七八糟但整体有趋势”而不是“异常工整”。关于Benford定律我再多说一句。不少人听说过“首位数定律”可以检测财务造假就想着直接套到医学数据上。这个方向本身是合理的但必须谨慎Benford定律适用于跨数量级、自然产生的计数数据比如医院月门急诊量、药品不良事件上报数量、细菌菌落计数。它不太适用于实验室里人为控制范围的检测指标比如pH值、ELISA读到的OD值。所以这个方法不是万能钥匙但在审阅流行病学调查、医院管理类稿件时我确实会用频率表快速扫一眼首位数字分布如果0到9的首位分布极其均匀反而是反常的——自然数据里首位为1的数字应明显偏多。1.2 P值拥挤效应0.049和0.041扎堆意味着什么如果说分布特征是第一道关卡那P值的分布就是第二道。很多有“水分”的稿件其实没有伪造数据而是做了一系列分析后只挑了“好看”的往外报这就是所谓的p-hacking。具体怎么看我通常会把一篇论文里所有报告的P值列出来。如果次要结局、亚组分析、事后分析这些位置P值大量集中在0.03到0.049之间而主要结局却贡献了一大堆0.5以上的值那筛选报告的嫌疑就很大。真正事先设计好的研究各项检验的P值应当是宽谱的——有显著的、有不显著的边缘值有但不会形成在0.05线下“排队”的盛况。还有一种更隐蔽的情况作者报告P0.049声明“有显著差异”但置信区间里包含了无效值。比如效应量为2.095%CI是-0.1到4.1。这类结果本身就是边缘显著但论文结论里却直接写成“两组差异显著治疗有效”。遇到这种情况我一般不会断定作者造假但会在审稿意见里明确要求弱化结论并要求补充效应量和置信区间的解读。如果条件允许直接把自己从表格里提取的均值、标准差、样本量代到统计软件里反推检验统计量。很多“精心整理”过的数据会在这一关出错——报告的P值与自己计算出来的结果对不上。我自己在R里加一个简单的反算函数十分钟就能完成见1.3节。如果发现大量报告的P值与重算值不一致那问题就不是统计表达错误能解释的了得往数据真实性方向考虑。1.3 用五分钟手动验算把报道数字“重新算一遍”审稿人不一定都精通统计软件但至少要会验算最基本的t检验和卡方检验。不需要会跑模型直接拿论文里报告的基本数据反推即可。这是发现水分最便宜的方法成本几乎为零。实际操作如下从论文表格里读出两组的例数n、均值m和标准差s用常见的双样本t检验公式重算一遍P值。公式大概是t (m1 - m2) / sqrt(s1²/n1 s2²/n2)然后再查t分布表或直接用软件计算对应的P值。如果论文报告P0.03你重算出来是0.25且样本量不大那问题就很明显了。当然有时候论文用的是ANOVA、非参数检验t检验重算会有偏差所以这个做法主要用于筛选可疑线索而不是做最终裁判。我用R时通常就几行# 从论文表格读入两组样本量、均值、标准差 n1 - 32; n2 - 31 m1 - 18.3; m2 - 15.1 s1 - 3.2; s2 - 3.5 sem1 - s1 / sqrt(n1) sem2 - s2 / sqrt(n2) t_value - (m1 - m2) / sqrt(sem1^2 sem2^2) p_value - 2 * pt(-abs(t_value), df n1 n2 - 2) t_value p_value用Excel也能做函数是T.TEST但需要原始数据数组。审稿阶段拿不到原始数据所以反推公式反而更实用。实操时优先找那些P值恰好小于0.05、又刚好跨过临界线的数据来验算这类数据最容易露出马脚。2. 看图说话图像层面的重复、裁剪与修饰识别2.1 Western blot条带背景、轮廓与跨图重复生物医学图片是造假水分的高发区尤其是Western blot条带图。不是所有问题都到了“图片造假取证”那么严重的程度更多是处理过度或图与图之间“共享”了内容审稿人应当具备基本的图像取证思维。先说我最常怀疑的几类第一同一张图上相邻泳道的条带轮廓完全一致。哪怕是同批次上样蛋白条带的宽窄、边缘灰度、拖尾形态都会有自然的细微差别。如果几个泳道的条带形态看起来像是同一个模子刻出来的就该高度怀疑是复制粘贴后再旋转、翻转处理。第二内参条带之间“过分同步”。正常操作下β-actin或GAPDH条带虽然不同样本间灰度有差异但条带本身的形状应该各不相同。如果所有内参条带连晕染的不规则边缘都完全一致那肯定是复制过了。第三跨图复用。也就是传说中的“同一个条带出现在不同实验条件下”。这个最好判断的方法是把两张图叠在一起对比。很多时候作者会把同一条带稍作缩放、旋转后用到另一张图里防不胜防但仔细观察背景噪点的相对位置就能发现端倪。比如条带周围的某个污点、膜上的折痕、曝光不均匀形成的暗区这些“背景纹理”如果出现在两张应该完全独立的图上那就是铁证。具体操作上用ImageJ就能做基础比对。把两张图拖进同一个窗口调节透明度后叠加如果条带能严丝合缝地重合基本就实锤了。也可以用Photoshop把疑似重复的区域框选出来复制到新图层再旋转180度或翻转后观察边缘像素是否匹配。这些操作不需要高深算法有手就行关键是得先产生怀疑。2.2 细胞与组织学图像旋转、缩放与重复区域识别细胞图、HE染色图、免疫组化图相比Western blot更难判断因为同一批样本里细胞形态高度相似重复区域不容易被肉眼锁定。但也正因如此有点机械化成分的“重复”更加可疑。我先凭肉眼筛查如果一张载玻片全景图里某个细胞团块、某个血管断面、某个间质区切片分别在两张不同视野的图中“出现”了场景虽已缩放或旋转但核心形态高度雷同我一般会标记为可疑。观察的重点是细胞间相对位置、图内特定的组织结构分支模式这些随机性很强重复极难巧合。有个更效率的办法裁剪、旋转、缩放后的复制图在被拉伸后会产生不自然的边缘模糊或像素拉伸痕迹。如果一张400倍镜下的细胞图周边区域出现了过度的锯齿感、分辨率明显不匹配就要怀疑它是从别的图里抠出来的。对于审稿人来说即使没有专业取证工具也可以借助“图像相似度搜索”思路来辅助判断。把论文里可疑的图片切成小块找一个简单的开源工具做局部感知哈希比对能批量快速筛查两张图的重复区域。具体脚本见2.3节。我要提醒的是这个操作永远只是辅助最终判断还是需要人工确认因为正常的组织切片里确实可能存在结构相似的区域。2.3 不带玄学的实操用ImageJ和Python做基础图像取证图像层面的水分检测工具门槛其实不高。商用工具不在讨论范围内基层审稿人用得比较多的是ImageJ和能跑Python的OpenCV环境。ImageJ适合做“手工叠加比对”操作路径大致是File Open打开两张图片把它们设为不同颜色通道后合并叠加。比如把一张图设为红通道另一张设为绿通道如果两张图存在相同的内容叠加区域会呈现黄色或橙色这个视觉效果比单纯看透明度更直观。如果需要批量比对OpenCV里有一个模板匹配的思路import cv2 import numpy as np # 读入两张大图转为灰度 img1 cv2.imread(figure_A.png, cv2.IMREAD_GRAYSCALE) img2 cv2.imread(figure_B.png, cv2.IMREAD_GRAYSCALE) # 将第一张图里的可疑区域作为模板 template img1[120:220, 300:400] # 在第二张图里做模板匹配 res cv2.matchTemplate(img2, template, cv2.TM_CCOEFF_NORMED) min_val, max_val, min_loc, max_loc cv2.minMaxLoc(res) # 输出最高匹配度越接近1越可疑 print(max_val)这只是最基础的模板匹配。实际使用时重复图像往往还经过了缩放、旋转和亮度调整所以匹配相似度不会特别高。我的经验是如果max_val超过0.7就要人工复核一下超过0.85那基本可以认定存在复制区域。当然前提是模板本身特征足够如果是纯白色背景上的条带匹配度天然偏高这个需要结合内容判断。另外可以用OpenCV的cv2.resize和cv2.rotate做翻转旋转后的比对。很多复制粘贴的图经过翻转后人工肉眼容易漏看但算法对比能直接给出匹配位置。这些都是辅助工具不会代替人的判断——脚本只负责把“疑似重复区域”挑出来最终定性由人完成。2.4 图像审查的边界压缩伪影与正常生物学重复的区别图像审查有时容易走向另一个极端把正常的图像处理误判为造假。这里我吃过大亏所以专门提醒几条边界第一论文图片经过出版社排版后DPI降低、JPEG压缩是很正常的。像素级的细节丢失、轻微模糊都不能作为造假的依据。我会看的是“结构性不一致”而不是简单的不清晰。第二同一批实验里细胞形态相似、背景色调一致是完全正常的。因为是在同一天、同一台显微镜下拍摄的同种细胞。仅凭“细胞长得像”就认定图像重复是外行做法本可直接用Blob检测去量化随机分布特征。第三Western blot条带的背景细微差异属于正常显影波动。只有当条带本身的形状、边缘、轮廓高度一致或者背景中的特异物点重复出现才值得怀疑。简单来说色差不如形差可靠边缘轮廓是最能定性的特征。我给自己的规则是图像只用于提出“疑问”不用于直接定性“造假”。发现了疑似重复就要求作者提供原始未裁剪图像、带曝光参数的原图或重复实验的原始照片。作者能提供合理的解释和证据就继续审下去如果提供不出来或者解释牵强再结合全文其他线索综合判断。3. 从实验设计和逻辑链条上找破绽3.1 样本量、效应量与统计功效之间的“不可能三角”有经验的数据伪造者会把数字整理得看起来正常但往往会在实验设计的底层逻辑上翻车。最容易暴露的是样本量、效应量与统计功效之间的关系我称之为“不可能三角”。举个例子一篇论文报告某干预组与对照组之间的主要终点差异很大P值非常显著但一看样本量每组只有12个人。这表面上看没有问题因为我们平时也听说过“小样本也能做出显著结果”。但要分析一下具体数值假设主要终点是定量指标研究者期望检测到“临床上重要的”差异事先计算所需的样本量至少要每组五六十个人。如今每组只有12人却出现了高度显著的结果那意味着实际检测到的效应量非常巨大。这种效应量在临床实际里通常是不太可能的。审稿人应该问一句“这个效应量是否在文献中有过其他报道如果前所未有请提供先验依据或验证数据。”还有一种情况是相反的方向样本量很大比如每组300人但论文只报告了P值没报告效应量或置信区间。如果样本量足够大很微小的差异也能P0.05但那不一定有临床意义。审稿人应当要求补充效应量指标比如Cohens d、均值差及95%CI以判断这种“统计学显著”是否靠谱。如果论文里只强调P值且刻意回避置信区间我会直接质疑。另外随机化分组后的基线特征表也可能有水分。真实随机化会把某些指标分得不均衡这是正常的抽样子。如果一篇RCT论文的基线特征表里所有关键指标的p值都在0.7以上看起来“完美均衡”反而有可能是做出来的。严谨的做法是看随机化方法是否描述清楚、是否进行盲法分配、是否说明分配隐藏如果这些信息缺失基线表再漂亮也只能打八折。3.2 分组、时间线与表格内部的数字打架逻辑矛盾类型的水分其实最容易被发现只要耐心把表格内的数字全部核对一遍不需要任何专业知识。常见的矛盾包括第一同一篇论文里不同表格的样本例数不一致。比如表1总人群N120表3里某亚组的例数却是98例而分组标准明明写的是“所有受试者均纳入亚组分析”。这种不一致通常暗示实际操作与文本描述有出入。第二随访时间线对不上。摘要里写“随访12个月”方法学里写“平均随访10个月”结果部分却出现了“第15个月复发两例”那要么是随访时间的表述有问题要么就是数据记录不清。第三百分比合计不是100%或某个结局发生率与对应样本量相乘得不到报告中的例数。比如报告某个并发症发生率是6.7%对应总例数却只有13例0.87例显然不可能说明原始数据经过“四舍五入”处理但用错了基准。我建议把表格里所有“频数”、“百分比”、“总例数”三个字段拉出来重新算一遍。很多Excel公式能直接完成。这步骤不复杂但极有效因为数据一旦有水分伪造者往往不太会去把全篇所有表格联动起来统一计算必然在某个角落露出口径不一致。审稿人如果发现这类矛盾不需要直接下“造假”结论正常情况下应该先作为Major Revision提出“请解释表2与表3中同一队列样本量不一致的原因并提供每项分析实际纳入的例数及排除原因。”大部分时候这能刺探出数据的真实面貌。3.3 生理极限与常识边界超出物理可能的变化医学数据再怎么膨胀也逃不开人体的生理极限。审稿人不需要是临床专家但至少要能感知“数值是否符合常识”。在实验数据中发现超越正常人身体极限的变化基本可以判断数据存在严重问题。我举几个真实场景一是体重或器官体积变化。某项干预研究声称受试者在4周内平均减重18公斤且无严重不良反应。这除非是在极端饥饿干预下否则不符合常规的减重速率。正常成人每周安全减重上限约为0.5到1公斤4周减18公斤属于医学上不太可能的事件。一旦遇到我就要核查体重测量的时间点、测量条件是否晨起空腹、是否同一台设备并对照日记身体变化曲线是否连续。二是实验室指标的极端波动。比如声称某种中药在体外实验中把癌细胞增殖抑制率做到了98%但所用药物的浓度如0.1μg/ml远低于文献报道的有效范围这很可能就是数据编造或方法描述不清。检验的方法非常直接把作者使用的药物浓度、孵育时间、细胞系名称与既往文献中同类药材/化合物的常规用量做对比如果存在数量级上的鸿沟作者必须给足解释。三是患者人群的预期死亡率。曾有一篇随访研究声称某个中危组患者在5年随访期内零死亡。如果这是针对一种5年生存率只有70%的恶性肿瘤那要么是筛选条件极为特殊要么就是随访数据遗漏了大量“去向不明”的患者。这类异常值可以通过查阅公开的流行病学数据库如SEER、GLOBOCAN获得一个粗略基准审稿意见中直接引用基准数据提问即可。我不需要逐项罗列所有生理指标的正常范围审稿人也不可能做到。重要的是数据异常往往是“成套出现”的——如果某一项指标突破极限那周围其他指标也会有不合理的地方比如SCr变化与GFR估算不一致、血小板计数与出血事件描述对不上。抓住其中一个点深入追问经常能带出一连串数据问题。3.4 伦理审批和试验登记查一查比什么都快还有一种水分不发生在数据本身而发生在“合规性”层面。数据再漂亮如果基础的伦理信披、研究注册信息不全可信度就要大打折扣。这一块不能跳过。拿到一篇临床研究稿件我第一时间会寻找两个号码伦理审批号以及临床试验注册号。如果作者连这两个号码都没有报告基本就可以要求补充完整再谈其他。如果报告了号码也建议花几十秒到国际临床试验注册平台如clinicaltrials.gov或者WHO ICTRP上查询注册号是否存在注册日期是否早于第一位受试者入组日期注册时的主要终点和当前投稿稿件是否一致注册的研究类型、盲法设计、样本量与稿件是否吻合。如果注册时间晚于入组时间或主要终点在注册后再被修改属于非常典型的“选择性报告”行为。比如注册信息里写“主要终点为总生存期”但到最终发表时却换成了“无进展生存期”这大多说明真实结果可能未达预期。审稿时遇到这种情况可以直接要求作者说明变更依据并提交伦理委员会对方案变更的批准文件。还有一个容易忽略的检查点作者单位与伦理审批委员会的一致性。有时候作者投来的伦理审批号来自A单位论文中所有实验却都在B单位完成并且B单位没有在同一批伦理批件中出现。这类明细问题通常代表研究过程记录不规范不管出于何种原因都会让我对结果可信度的评价下降。审稿人应把伦理与注册信息作为一条硬性检查项而不是可选项。4. 把“水分”定量化可复现性核查与审稿意见模板4.1 统计复核实操一条命令重算显著性前文提到了R语言反算P值这里我展开讲一下完整的统计复核流程。并不是要审稿人把整篇论文的所有统计全部跑一遍快准狠的做法是抽查3到5个“关键结果”集中在主要结局、核心亚组、以及P值逼近0.05的结果。第一步从正文和表格中提取每个关键结果的统计量。优先选择报告中自带n、mean、SD或n、事件数、百分比的数据这些可以直接代入检验公式。第二步用R或Python或Excel重算一遍。R最方便因为t.test、prop.test、chisq.test都是一行命令的事不再赘述。如果作者报告中位数和四分位数对应使用Wilcoxon秩和检验的重算会稍有难度这时候可以只比对结论定性不强行重算精确P值。第三步检查置信区间和效应量是否一致。一个很常见的坑论文正文报告HR1.5295%CI为1.12-2.06但如果你从事件发生率粗糙地算相对危险度却得到RR1.9。HR和RR虽然不同但两者通常不会差太多差距过大的时候需要核查事件密度、随访时间是否真的正确。如果方法学没有解释特殊处理这项结果就不可靠。第四步如果条件允许给作者发邮件索取原始数据表做远程复核。很多期刊现在都要求数据共享声明原始数据先行放在公共数据仓库里如开放科学框架OSF、figshare、Dryad审稿人可以直接下载核对。如果作者声称“数据无法共享”在当今环境下这本身就是个红旗我会在审稿意见里明确说明这一点。其实多数有小水分的论文不用走到第四步。因为它们往往会在重算阶段就暴露出P值、置信区间、统计量之间互相矛盾的问题。用户担心的所谓“审稿人护短”很多时候并非护短而是没有做这步最基础的验证。强烈建议把统计抽查列入审稿流程的固定动作。4.2 图像相似性检测的Python工作流图像检测不要求审美能力而要求结构和算法思维。我之前分享了模板匹配的参考代码这里给出一套完整的“纸面图像查重”流程第一步从PDF里导出需要比对的高清图片优先用300dpi以上分辨率防止压缩导致特征丢失。第二步如果是Western blot图把每个条带区域单独裁剪出来存为独立小图。注意保留周围背景背景噪点其实是很好的“指纹”。第三步将所有小图放在同一个文件夹中用Python脚本计算两两感知哈希相似度。感受判断时选用dHash算法它对缩放、微小的亮度变化比较鲁棒from PIL import Image import imagehash hash1 imagehash.dhash(Image.open(band1.png)) hash2 imagehash.dhash(Image.open(band2.png)) # 汉明距离越小说明图像越相似通常小于5属于高度疑似 print(hash1 - hash2)第四步把得分最高的几对图像再做人工复核看内容本身的形态是否能够构成“复制”的证据。脚本判断只是筛选机器真正的“同一条带”或者“同一细胞簇”最终由人眼决定但脚本可以确保你不会漏掉几十张图里的可疑对。这套流程不依赖任何商用量化软件但需要注意一点整个过程一定要保留截图、原始PDF页面标记和脚本运行的哈希结果以备在给编辑部的审稿意见里引用。审稿是为了让作者做出合理解释不是为了当众处刑所以证据清晰即可不需要形成“学术不端报告书”。4.3 数据可用性声明的审稿检查清单数据可用性声明Data Availability Statement如今被越来越多期刊列为投稿必需项但审稿人真正去核验的却不多。实际上这个声明是筛掉水分的关键防线因为真实的数据经得起复核水分数据最怕被调出原始记录。我建议按以下清单核对声明是否提供了数据仓库名称和访问链接而不仅仅是“如有需要可联系作者”链接是否真实可打开访问是否要求登录、付费或额外权限下载的数据集是否与论文描述的分析人群、样本量、变量名一致数据集的时间戳是否早于投稿时间或与实验时间一致是否提供了分析脚本或代码以支持统计方法部分的复现。在审稿意见里如果发现声明缺失或内容含糊直接要求修改。我的标准措辞是“请将所有支持结论的匿名化原始数据及分析代码上传至公共数据仓库并在数据可用性声明中提供访问路径。仅凭作者自行保留的原始记录无法完成独立核验。”这类要求很多作者都会答应少数推三阻四的基本等于自动承认数据不完整后续结果的可信度需要大打折扣。这不是我较真是学术发表的公共信任成本决定的——数据不透明结论就不能被独立复现审稿人的职责就是不放过这一点。4.4 审稿意见措辞从“可疑”到“要求原始数据”很多审稿人发现异常之后卡在了措辞环节怕误伤作者、怕措辞过重、怕被编辑驳回。我结合自己的经验给出一个分级模板可以根据证据强度套用。轻量级发现小瑕疵可能是无心之失先问一下 “表2与表3的样本量存在出入请核实各分析实际纳入的受试者数量并说明数据排除的标准和流程。”中量级统计、图像出现结构性疑点需要作者提供原始证据才能继续 “图3中箭头标注的Western blot条带与其他泳道条带的背景纹理存在高度一致性请提供该实验的原始未裁剪膜图像和重复曝光照片以确认图像处理过程的完整性。”重量级多项指标齐遭异常指向要求整体排查并重做关键实验 “核心结果所依赖的原始数据尚未提供且所报告的统计检验结果与从原文表格重建的数据存在明显矛盾。为保证可复现性建议补充可下载的匿名化原始数据。在作者提供可独立核验的证据之前本稿的核心结论不能被认为是可靠的。”我自己倾向于从轻到重递进但这不意味着模糊。因为审稿人不是裁决机关我们的责任是“提出质疑、要求证据、让编辑部据此决策”。措辞太软容易被作者敷衍过去太硬又可能引起不必要的争端。心里要有尺度证据关联性不强的信息用轻量级疑似有复制粘贴图的第一轮就给中量级统计验证对不上的直接上重量级因为你已经不需要对方继续拉扯了。5. 审稿人防误伤与边界意识有怀疑就求证不把问号当句号5.1 容易被当成“水分”的正常偏差我前面讲的都是“找破绽”但最后必须来聊“别误伤”。做了十几年审稿人我也有过走眼的时候——把正常数据误判为可疑然后弄得很尴尬。最常见的误伤集中在以下三种情况第一种是生化指标的大幅日间波动。有些指标比如皮质醇、血糖、C反应蛋白本身受昼夜节律、应激状态影响巨大。个体间的标准差高是正常的不考虑临床背景就质疑“SD为什么这么大”不仅不严谨还会让自己在给编辑部的报告中显得没有经验。标准做法是查阅参考范围或者文献报道的正常波动范围确认波动在合理区间而不是凭空质疑。第二种是细胞图像背景里的“伪重复”。同一批细胞在同一个培养条件下形态均匀是常态。如果两张不同视野的细胞图片里都出现了数个圆形细胞就怀疑是复制的那基本审不了细胞生物学的稿件。真正的重复必须满足“组群结构高度一致”和“背景特异点一致”两个条件之一否则不足以构成任何证据。第三种是数据缺失或离群点剔除。作者可能出于正当、记录在案的标准剔除了一部分离群点使得最终表格的样本量变小。如果方法部分写清楚了剔除标准我们权当合规。只有那种“没有任何说明样本量却莫名减少”的情况才值得追问。有怀疑就求证不把问号当句号。这句话是我做审稿人最重要的一条原则找水分是为了让学术记录尽可能真实而不是为了满足自己的推理快感。一个专业矩阵拼图里我们缺的始终不是怀疑而是平衡。5.2 证据分级同图复用、异常分布、灰色地带的处理策略审稿意见的强度应当与证据等级严格匹配不能把印象分当实锤。我自己习惯把审稿中发现的疑点分成三级第一级确凿型证据。比如两张图在叠加比对后等同于同一内容的复制或者原始像素经缩放后与另一张图完全相同。这种证据可以直接列为“必须解释”项。即便作者死不承认编辑部也需要明确处理。第二级强提示型证据。比如统计重算的P值与报告不符、样本量与统计功效明显不匹配、基线数据过于完美。这类问题不能直接定性为学术不端但必须要求作者提供解释或补充信息解答不了就只能暂缓处理。第三级灰色地带。比如P值边缘显著偏多、图像中某些区域形态接近但背景不一致、某种筛选标准没有写在方法部分。这些我一般会作为一般性提问提醒作者补充信息或调整表述不会当作“瞒报”来处理。审稿人容易犯的错误是对着“灰色地带”大做文章而对“确凿型证据”反而含糊带过。前者的风险是产生大量无效返修后者的风险是让异常结果带病发表。把握好前述三个等级你的审稿意见会兼具说服力和建设性。5.3 审稿人要养成的三个习惯流程化建议不多就三条都是我亲测有效的习惯第一建立个人“水分清单”。把看过的所有可疑稿件、可疑点、处理结果整理一个表格。时间长了你会形成一种直觉哪些疾病领域、哪些实验模式、哪些指标最容易出现水分。这种直觉帮我在刚开始接触一篇新稿件时就能选准着力点。第二每篇稿件至少做一次“数字交叉核对”。快速抽取表格中某一个变量沿全篇追踪它出现的所有位置摘要、正文、表格、图注看数值是否始终一致。不一致的地方就是值得追问的地方。这一步大概半小时却能解决一半以上逻辑矛盾。第三遇到可疑数据时先写审稿意见不先下结论。我见过太多审稿人发现异常后情绪上头在意见里写着“作者的实验数据完全是造出来的”。这种表述即使是想表达愤怒也不适合放在正式评审意见中因为它没有给作者留下解释的余地也容易让编辑部承担不必要的法律或名誉风险。正确的写法是把问题讲清楚把请求的证据列明白剩下的由编辑部和作者单位依规处理。审稿人不需要当“终审法官”我个人的体会是审稿人真正该做的从来不是扮演“学术警察”的角色而是在同行评审里守住一条专业底线——遇到水分数据能发现、能指出、能要求完整证据。尤其在目前大量数据分析和图像处理高度便利的情况下审稿人如果没有基本的数据源核查习惯很容易被表面上的“规范格式”迷惑。最后再分享一个小技巧如果怀疑一篇稿件的数据有问题不必一次性把所有疑问全部抛给作者。留一点“底牌”放到第二轮因为有些作者会在回复第一轮意见时提供一套全新的解释或附加图表而如果你在初审阶段把全部疑点都排在明面上后续就很难追着新增材料核对。这个操作需要拿捏分寸但作为审稿手段我实际用下来很稳。带水分的稿件往往在第二轮回复中会自动补出更多细节矛盾——到那时判断就比第一轮清晰多了。
返回列表