写SCI论文这件事,从选题到实验到写作,哪个环节都不轻松。但很多人熬了几个月把稿子写出来,最后栽在一个意想不到的地方——查重。
不是他抄了谁,也不是数据有问题。就是期刊编辑打开系统一查,重复率22%,直接desk reject。连审稿人的面都没见到。
这种亏,吃过的人不少。
iThenticate查重系统入口
https://www.58sci.com/ithenticate/index.html
投稿前到底要不要自己先查重
先说结论:要查,而且最好用和期刊同一个系统查。
为什么?因为期刊一定会查。
Elsevier、Springer Nature、Wiley、IEEE、Taylor & Francis这些大出版商,旗下期刊基本都用iThenticate做稿件筛查。你在投稿须知里经常能看到这么一句话——所有投稿将接受相似性检测(similarity check)。这不是走流程,是硬门槛。
期刊查出来超标,轻则退回让你改,重则直接拒稿。有些编辑甚至不给你解释,一封模板邮件就完事了。
问题是,你等了三个月才收到回复,结果发现栽在一个自己花十分钟就能避免的问题上。
与其赌编辑心情好,不如自己提前查一遍。
用什么系统查
这个问题很多人搞混了。
Turnitin、CrossCheck、知网、万方……市面上查重系统一大把,但不是每个都适合SCI投稿。
投SCI论文,预查重首选iThenticate。
原因很简单:期刊编辑用的就是它。全球95%以上的SCI期刊使用iThenticate(或其前身CrossCheck/现在叫Similarity Check)作为官方查重工具。你用同一个系统查出来的结果,和期刊那边看到的数字基本一致。
为什么不能用别的?
Turnitin: 面向高校,数据库里有大量学生论文。你拿Turnitin的报告去投SCI,编辑大概率不认。两个系统的比对库不一样,结果也不一样。而且Turnitin的学校账号默认收录论文——你查一次,你的论文就被存进学生论文库了,下次期刊再查就显示100%重复。这个坑后面详细说。
知网/万方: 中文数据库,对英文SCI论文的覆盖远不如iThenticate。你投的是英文期刊,用中文系统查重没什么意义。
Crossref Similarity Check(原CrossCheck): 这个和iThenticate底层用的是同一个引擎,数据库也高度重合(Crossref本身就是iThenticate的核心数据源之一)。用它查出来的结果和iThenticate基本一致。有些期刊官网链接的就是Crossref的查重入口,选哪个都行。
免费查重网站: 坚决不要用。数据库和算法跟期刊完全不在一个量级,查出来的数字没有任何参考价值。更关键的是,你把未发表的论文上传到一个你不知道底细的网站,论文安全谁来保障?
什么时候查
查重不是一次性动作,最好分三个阶段推进。
第一阶段:初稿完成后,做诊断性检测。
这时候论文刚写完,核心内容定了但还有修改空间。用iThenticate跑一遍,目的是定位问题——哪些段落和已发表文献重合度高,哪些引用标注不规范,哪些地方需要重写。
初稿阶段不用追求完美数字,重点是搞清楚哪些章节是重灾区。根据报告逐个修改,给后续润色留出时间。
第二阶段:润色修改后,验证修改效果。
论文经过内容修改和语言润色后,文字表述已经大幅变化。这时候再查一次,看看修改有没有真正降低重复率。如果某段还是标红,说明改得不够彻底,需要继续调整。
第三阶段:定稿后、投稿前1-2天,做最终检测。
这是最关键的一步。查重对象必须是你的最终投稿版本——完整版,不删内容,不加减东西。期刊编辑收到的是什么,你提交查重时就是什么。
很多人在这一步犯低级错误:把参考文献、致谢、作者信息删掉再去查,觉得这样重复率会低。但期刊查的时候用的是你提交的完整版。你自查时删了这些,查出来10%,期刊一查可能18%。
图片可以删。iThenticate对图片中的文字识别能力有限,删掉图片不影响查重结果,还能提高检测效率。
期刊到底在看什么
拿到查重报告,很多人只盯着一个数字——总相似度。觉得低于15%或20%就万事大吉。
没这么简单。
期刊编辑看查重报告,至少看三个维度:
总相似度(Overall Similarity Index)。 这是初筛指标,大多数期刊画的红线在15%-20%之间。顶刊更严,Nature、Cell这类要求10%以内,有的甚至卡5%。
单源相似度。 你的论文跟某一篇文章的重合比例。这个指标被很多人忽略,但它往往才是真正触发退稿的原因。总相似度12%看着还行,但如果其中8%来自同一篇文献,编辑会认为你大概率是"复制粘贴"了别人的东西。有些期刊明确把单源警戒线设在3%-5%。
重合发生的位置。 方法部分和标准术语有重合,编辑一般比较宽容——毕竟实验流程的描述方式就那几种。但讨论和结论部分出现大面积重合,哪怕比例不高,也很容易被判定为学术不端。
所以拿到报告后,别光看顶上的总数字。翻到来源列表,看排第一的匹配了多少;逐段查看被标记的内容,区分哪些是合理重复,哪些需要改写。
不同学科的容忍度不一样
一个容易被忽略的事实:不同学科对查重率的接受标准差别很大。
生命科学和医学: 基因名称、蛋白名称、标准实验流程这些术语没法改,总相似度容忍度相对高,15%-20%通常安全。但单源相似度更受关注,超过5%就要警惕。
化学和材料: 合成步骤、表征方法的描述容易与前人重合,15%-20%问题不大。但要注意自我重合——连续发表相关课题时,新论文的方法部分和之前发的文章高度相似,即使总相似度不高也可能被认定为自我抄袭。
数学和物理: 公式、定理描述高度标准化,总相似度容忍度更宽松,20%-25%可能被接受。但编辑会重点看讨论和结论是否有新意。
社科和人文: 文字独创性要求最高,总相似度一般要求压到15%以内。单源匹配尤其敏感——大段引用某一篇文献,即使加了引用标注,也可能被判定为过度依赖。
几个容易踩的坑
坑一:不看报告,只追数字。
总相似度低于期刊要求不代表安全。前面说了,编辑还要看单源和位置。我见过总相似度8%但因为单源过高被退稿的案例,也见过22%顺利通过的。区别就在重复内容的性质。
坑二:拿到报告就猛改标红内容。
iThenticate连规范引用也会标红——因为它只做文本比对,不分你是合理引用还是抄袭。看到标红就同义词替换、句式重写,最后改出来的东西读都读不通。
正确做法:逐条检查被标红的内容。标准术语、正确引用的段落,保留没问题。没有标引用的大段照搬,才需要重点修改。
坑三:忽略自我抄袭。
这是我之前发的论文,用自己的内容还不行?
不行。
iThenticate的数据库收录了所有已发表文献,包括你自己的。大段复制之前发表的内容而不加引用,系统照样标红。期刊管这叫"自我剽窃",违反发表伦理。
会议论文扩展成期刊文章、学位论文拆分成多篇稿件,都是自我抄袭的高发场景。想用自己之前的内容,要么重新改写,要么加引用说明。
坑四:用学校Turnitin账号查SCI论文。
学校Turnitin默认把论文收录进学生论文库。你用学校账号查一次,你的SCI论文就被永久存进去了。等你正式投给期刊时,期刊的iThenticate一比对,发现这篇论文和库里的学生论文100%重复——撞的就是你自己。
坑五:相信"低于XX%就绝对安全"。
不同期刊标准不同,同一期刊不同编辑的尺度也可能不同。没有哪个数字能保证你100%通过。把目标设在比期刊要求再低3-5个百分点比较稳妥——因为你自查时的数据库不可能比期刊的更全面。
投稿前查重流程总结
查重不是目的。让论文在原创性上经得起检验才是目的。但既然期刊把这当成硬门槛,你就得认真对待。花十分钟查一次,比花三个月等退稿通知划算得多。