这个问题折磨过不少人。你精心写完一篇稿件,预查重一看——重复率18%。仔细一看报告,参考文献占了3%,致谢占1%,图表说明又贡献了2%,公式和代码片段零零散散标红了一大片。
心里不免犯嘀咕:这些东西真的算"抄袭"吗?
iThenticate查重系统入口
https://www.58sci.com/ithenticate/index.html
答案是:都会被检测,但不一定都被计入最终重复率。关键在于你(或者编辑)有没有开启排除选项。
下面逐个拆解。
参考文献:默认计入,但一键可以排除
iThenticate的默认设置是——参考文献参与检测。也就是说,你不做任何设置就提交,参考文献列表里的每一条都会和数据库比对,匹配上了就计入重复率。
一篇稿件如果有四五十条参考文献,每条都是标准化格式(作者、标题、期刊、年份、卷期页码),这些格式在成千上万篇论文里反复出现,自然会产生大量匹配。
不过iThenticate提供了"Exclude Bibliography"功能。开启后,系统会识别参考文献部分并把它排除在重复率计算之外。
据iThenticate/CrossCheck中文官网的FAQ说明,"删除Reference检测和排除Reference报告是不同的"。也就是说,你在提交前手动删掉参考文献再提交,和提交完整稿件然后在报告里开启排除参考文献,这两种做法的结果可能不一样。
原因在于iThenticate识别参考文献是靠关键词触发。据TopEditSci的官方FAQ,系统会识别以下关键词来定位参考文献区域的起始位置:
当系统在这些词后面发现内容时,就知道"这是参考文献了",然后在开启排除功能的情况下跳过这部分。
但这里有个坑:如果在参考文献和正文之间夹了附录(appendix),系统遇到"appendix"会重新开启检测。也就是说,参考文献里如果混了非标准内容,或者格式不规范导致系统没识别出来,那些内容照样会被计入。
实操建议很简单:提交时保留完整的参考文献(和投稿版本一致),然后在报告里开启Exclude Bibliography。不要在提交前手动删参考文献——那样系统识别的上下文变了,正文部分的检测结果可能也会跟着变。
致谢:会被检测,而且容易重复
致谢部分的处境比较尴尬。
iThenticate在检测过程中遇到"acknowledgement"或"acknowledgements"关键词时,会重启相似度检查(TopEditSci FAQ)。这意味着致谢内容不会被自动排除——它被当作正文的一部分来检测。
而致谢恰好是最容易重复的段落之一。"This work was supported by the National Natural Science Foundation of China (Grant No. XXXXX)"——这种表述在几十万篇论文里几乎一模一样。感谢基金项目编号的格式是固定的,感谢导师的措辞高度雷同,感谢实验室的句式也大同小异。
据德国癌症研究中心(DKFZ)图书馆的iThenticate使用指南(dkfz.de),他们建议作者在提交检测时删除致谢部分("without front page, acknowledgement etc."),因为这些固定表述会人为抬高重复率。
但矛盾在于:你投稿时稿件里是有致谢的,编辑拿你的稿件跑iThenticate时也会检测致谢部分。如果你预查重删了致谢,结果和编辑部跑出来的就对不上了。
比较务实的做法是:预查重时保留致谢,看报告时单独看一下致谢部分贡献了多少匹配。如果致谢让总重复率高了2-3个百分点,心里有数就行。多数编辑看到致谢部分的匹配不会当回事——他们也知道致谢的表述就是那些话。但如果你实在介意,可以在报告里手动排除致谢对应的那些匹配源(Exclude Source功能)。
图表说明:会被检测,而且没有排除选项
图表说明(figure captions)和表格标题(table titles)是纯文本内容。iThenticate会把它们当作正文的一部分来检测,没有专门的排除选项。
iThenticate的章节排除(Exclude Sections)功能只能排除摘要(Abstract)和方法部分(Methods and Materials)。没有"排除图表说明"这个选项。
MDPI出版的作者服务指南(mdpi-res.com)明确指出:"Copied figures, although copied text in captions can be detected."图片本身不会被比对,但图片说明文字中的重复内容会被检测到。
TopEditSci的FAQ也提到:"如果图片中包含文字或者数字,那这些内容也会被查重。
问题在于,图表说明往往是标准化表述:
这些短语在你的领域里可能出现在几百上千篇论文中,iThenticate会把它们标记为匹配。
美国海军研究生院的iThenticate FAQ(nps.edu)提到:"In a document formatted with a template, standard or form text may account for 5% or more of the content. Numerous footnotes with common or lengthy source titles or URLs can contribute sizably to the composite percentage.
对于图表说明的应对策略:
1. 用自己的语言重写图表说明。 不要用领域里最常见的模板句式。"Schematic diagram of..."可以改成"Overview of the experimental configuration showing...",意思一样但表述不同。
2. 控制图表说明的长度。 简洁的说明既符合写作规范,也能减少匹配面积。
3. 如果图表是从已发表文献中复制的,说明文字里需要标注来源。 标注本身可能产生匹配,但不标注是抄袭。
公式:iThenticate的已知短板
公式和方程是iThenticate最被诟病的地方。
2022年,俄罗斯数学家Andrei D. Polyanin等人在arxiv上发表了一篇论文(arxiv.org/pdf/2201.09062),专门测试了iThenticate在处理含公式的数学论文时的表现。结论是:系统无法正确比对公式和方程,经常得出荒谬的结果。
具体怎么个荒谬法?
系统把公式拆成单个字符和符号来比对。两个完全不同的公式,只要共享了几个字母和数学符号,就会被系统认为"部分匹配"。论文中举了一个例子:
一个是描述扩散的,一个是描述波传播的,"roughly like as a cow is from a horse"(原文这么说的,形容差距之大)。但iThenticate判定这两篇包含大量此类公式的论文相似度高达61%。
原因很简单:两个方程的右边完全一样,只有左边差了个下标t还是tt。系统把右边所有项都算作匹配,然后加上左边的部分重叠,拼出一个高相似度。
德国DKFZ图书馆的文件更直接:"Pictures, formulas, etc. cannot be verified."——公式无法被验证。他们甚至建议LaTeX用户删除所有公式、表格和图片后提交纯文本版本检测。
所以如果你投的是数学、物理、工程类期刊,公式多的论文被iThenticate虚高标记重复率几乎是必然的。
应对方法:
代码:被当作普通文本检测
如果你在论文中插入了代码片段(比如伪代码、Python脚本、MATLAB程序),iThenticate会把它们当普通文本逐词比对。
代码的重复率天然高。排序算法的写法就那几种,数据处理的套路就那么些函数调用,配置文件的格式更是千篇一律。一段Python代码里"import numpy as np""for i in range(len(data))"之类的表述,在GitHub和Stack Overflow上到处都有。
iThenticate没有任何针对代码的特殊处理——它不知道这段文字是代码还是散文,只知道这串字符和数据库里的哪段字符更相似。
据worldmetrics.org对查重软件的对比分析:"Less suited for non-academic or code-heavy integrity use cases"——iThenticate对代码密集的内容不太擅长。
应对方法:
各部分对重复率的贡献程度一览
把上面说的整理一下,大致可以排出一个"贡献度":
表格
内容类型 | 是否被检测 | 是否可排除 | 典型贡献度 | 编辑是否在意 |
|---|---|---|---|---|
参考文献 | 是 | 是(Exclude Bibliography) | 3-8% | 通常开启排除 |
致谢 | 是 | 否(只能手动排除来源) | 1-3% | 通常不在意 |
图表说明 | 是 | 否(无专门排除选项) | 1-5% | 看具体情况 |
公式 | 是(但检测方式有缺陷) | 否(只能手动排除匹配) | 5-20%(数学/物理类) | 了解这个问题的编辑会忽略 |
代码 | 是 | 否 | 2-10%(CS类) | 看具体情况 |
需要注意的是,这些贡献度只是经验值,实际数字取决于你的学科、论文类型和具体写法。一篇纯文科论文的公式贡献度为零;一篇理论物理论文的公式可能贡献20%以上。
五个常见误区
误区一:参考文献被标红了就是重复率太高。
参考文献被标红是因为格式固定,不代表你的正文有问题。开启Exclude Bibliography后重新看数字,那个才是你的真实"正文重复率"。
误区二:致谢用固定模板写没关系,反正不算抄袭。
致谢确实不算正文核心内容,但它确实被检测。如果致谢部分和某篇论文大面积重复,编辑可能会质疑你的致谢是不是从别人论文里直接复制过来的。虽然不会因此拒稿,但总归不好看。自己写几句,哪怕朴拙一点,也比照搬模板强。
误区三:图表说明用标准表述就好,系统会自动忽略。
系统没有"自动忽略图表说明"的功能。"Figure 1 shows the comparison results"这种表述太常见了,会被标记。你可以用更简洁或更有辨识度的表述方式。
误区四:公式重复率高说明论文有问题。
不是。iThenticate对公式的检测有已知缺陷。两个完全不同的方程,只要共享了几个数学符号就会被标红。数学类论文的作者和编辑都清楚这一点。
误区五:代码片段被标红需要逐行改写。
标准函数调用和API名称不需要改写。编辑看报告时能分辨哪些是通用代码表述。真正需要注意的是注释和大段逻辑——如果你的算法描述和别人的代码注释高度一致,那确实需要重写。
总结
参考文献、致谢、图表说明、公式和代码都会被iThenticate检测。参考文献有专门的排除功能,其他几个没有。公式是系统的已知短板,检测方式有缺陷。代码被当作普通文本处理。
最实际的建议:
重复率数字不是判决书。编辑看的不是那个百分比,而是报告里具体标红了什么、在什么位置、来源是什么。搞清楚这一点,你就不会被一个数字吓住。