参考文献、致谢、图表说明、公式代码,是否会被 iThenticate 计入重复率?

这个问题折磨过不少人。你精心写完一篇稿件,预查重一看——重复率18%。仔细一看报告,参考文献占了3%,致谢占1%,图表说明又贡献了2%,公式和代码片段零零散散标红了一大片。

心里不免犯嘀咕:这些东西真的算"抄袭"吗?

iThenticate查重系统入口

https://www.58sci.com/ithenticate/index.html

答案是:都会被检测,但不一定都被计入最终重复率。关键在于你(或者编辑)有没有开启排除选项。

下面逐个拆解。

参考文献:默认计入,但一键可以排除

iThenticate的默认设置是——参考文献参与检测。也就是说,你不做任何设置就提交,参考文献列表里的每一条都会和数据库比对,匹配上了就计入重复率。

一篇稿件如果有四五十条参考文献,每条都是标准化格式(作者、标题、期刊、年份、卷期页码),这些格式在成千上万篇论文里反复出现,自然会产生大量匹配。

不过iThenticate提供了"Exclude Bibliography"功能。开启后,系统会识别参考文献部分并把它排除在重复率计算之外。

据iThenticate/CrossCheck中文官网的FAQ说明,"删除Reference检测和排除Reference报告是不同的"。也就是说,你在提交前手动删掉参考文献再提交,和提交完整稿件然后在报告里开启排除参考文献,这两种做法的结果可能不一样。

原因在于iThenticate识别参考文献是靠关键词触发。据TopEditSci的官方FAQ,系统会识别以下关键词来定位参考文献区域的起始位置:

reference, references, reference list, reference cited, references cited, bibliography, works cited, literature cited

当系统在这些词后面发现内容时,就知道"这是参考文献了",然后在开启排除功能的情况下跳过这部分。

但这里有个坑:如果在参考文献和正文之间夹了附录(appendix),系统遇到"appendix"会重新开启检测。也就是说,参考文献里如果混了非标准内容,或者格式不规范导致系统没识别出来,那些内容照样会被计入。

实操建议很简单:提交时保留完整的参考文献(和投稿版本一致),然后在报告里开启Exclude Bibliography。不要在提交前手动删参考文献——那样系统识别的上下文变了,正文部分的检测结果可能也会跟着变。

致谢:会被检测,而且容易重复

致谢部分的处境比较尴尬。

iThenticate在检测过程中遇到"acknowledgement"或"acknowledgements"关键词时,会重启相似度检查(TopEditSci FAQ)。这意味着致谢内容不会被自动排除——它被当作正文的一部分来检测。

而致谢恰好是最容易重复的段落之一。"This work was supported by the National Natural Science Foundation of China (Grant No. XXXXX)"——这种表述在几十万篇论文里几乎一模一样。感谢基金项目编号的格式是固定的,感谢导师的措辞高度雷同,感谢实验室的句式也大同小异。

据德国癌症研究中心(DKFZ)图书馆的iThenticate使用指南(dkfz.de),他们建议作者在提交检测时删除致谢部分("without front page, acknowledgement etc."),因为这些固定表述会人为抬高重复率。

但矛盾在于:你投稿时稿件里是有致谢的,编辑拿你的稿件跑iThenticate时也会检测致谢部分。如果你预查重删了致谢,结果和编辑部跑出来的就对不上了。

比较务实的做法是:预查重时保留致谢,看报告时单独看一下致谢部分贡献了多少匹配。如果致谢让总重复率高了2-3个百分点,心里有数就行。多数编辑看到致谢部分的匹配不会当回事——他们也知道致谢的表述就是那些话。但如果你实在介意,可以在报告里手动排除致谢对应的那些匹配源(Exclude Source功能)。

图表说明:会被检测,而且没有排除选项

图表说明(figure captions)和表格标题(table titles)是纯文本内容。iThenticate会把它们当作正文的一部分来检测,没有专门的排除选项

iThenticate的章节排除(Exclude Sections)功能只能排除摘要(Abstract)和方法部分(Methods and Materials)。没有"排除图表说明"这个选项。

MDPI出版的作者服务指南(mdpi-res.com)明确指出:"Copied figures, although copied text in captions can be detected."图片本身不会被比对,但图片说明文字中的重复内容会被检测到。

TopEditSci的FAQ也提到:"如果图片中包含文字或者数字,那这些内容也会被查重。

问题在于,图表说明往往是标准化表述:

  • Schematic diagram of the experimental setup

  • Comparison of the proposed method with existing approaches

  • Data were collected from 2020 to 2024

  • Values are presented as mean ± SD (n = 3)

这些短语在你的领域里可能出现在几百上千篇论文中,iThenticate会把它们标记为匹配。

美国海军研究生院的iThenticate FAQ(nps.edu)提到:"In a document formatted with a template, standard or form text may account for 5% or more of the content. Numerous footnotes with common or lengthy source titles or URLs can contribute sizably to the composite percentage.

对于图表说明的应对策略:

1. 用自己的语言重写图表说明。 不要用领域里最常见的模板句式。"Schematic diagram of..."可以改成"Overview of the experimental configuration showing...",意思一样但表述不同。

2. 控制图表说明的长度。 简洁的说明既符合写作规范,也能减少匹配面积。

3. 如果图表是从已发表文献中复制的,说明文字里需要标注来源。 标注本身可能产生匹配,但不标注是抄袭。

公式:iThenticate的已知短板

公式和方程是iThenticate最被诟病的地方。

2022年,俄罗斯数学家Andrei D. Polyanin等人在arxiv上发表了一篇论文(arxiv.org/pdf/2201.09062),专门测试了iThenticate在处理含公式的数学论文时的表现。结论是:系统无法正确比对公式和方程,经常得出荒谬的结果。

具体怎么个荒谬法?

系统把公式拆成单个字符和符号来比对。两个完全不同的公式,只要共享了几个字母和数学符号,就会被系统认为"部分匹配"。论文中举了一个例子:

  • 第一个方程:u_t = [f(u)u_x]_x + g(u)——这是一个非线性反应扩散方程(抛物型偏微分方程)

  • 第二个方程:u_tt = [f(u)u_x]_x + g(u)——这是一个非线性Klein-Gordon方程(双曲型偏微分方程)

一个是描述扩散的,一个是描述波传播的,"roughly like as a cow is from a horse"(原文这么说的,形容差距之大)。但iThenticate判定这两篇包含大量此类公式的论文相似度高达61%。

原因很简单:两个方程的右边完全一样,只有左边差了个下标t还是tt。系统把右边所有项都算作匹配,然后加上左边的部分重叠,拼出一个高相似度。

德国DKFZ图书馆的文件更直接:"Pictures, formulas, etc. cannot be verified."——公式无法被验证。他们甚至建议LaTeX用户删除所有公式、表格和图片后提交纯文本版本检测。

所以如果你投的是数学、物理、工程类期刊,公式多的论文被iThenticate虚高标记重复率几乎是必然的。

应对方法:

  • 预查重时如果公式贡献了大量匹配,心里明白那些是假阳性就行

  • 在报告中手动排除(Exclude Match)明显是公式匹配的部分

  • 向编辑说明情况——多数数学/物理期刊的编辑对这个问题心知肚明,不会因为公式导致的虚高相似度拒稿

  • 不要尝试通过替换字母来降低公式重复率(比如把x换成y),那是在做无用功,而且可能让公式含义出错

代码:被当作普通文本检测

如果你在论文中插入了代码片段(比如伪代码、Python脚本、MATLAB程序),iThenticate会把它们当普通文本逐词比对。

代码的重复率天然高。排序算法的写法就那几种,数据处理的套路就那么些函数调用,配置文件的格式更是千篇一律。一段Python代码里"import numpy as np""for i in range(len(data))"之类的表述,在GitHub和Stack Overflow上到处都有。

iThenticate没有任何针对代码的特殊处理——它不知道这段文字是代码还是散文,只知道这串字符和数据库里的哪段字符更相似。

据worldmetrics.org对查重软件的对比分析:"Less suited for non-academic or code-heavy integrity use cases"——iThenticate对代码密集的内容不太擅长。

应对方法:

  • 论文中尽量避免直接贴大段代码。如果必须展示,用伪代码或者简化版

  • 代码中的注释用你自己的语言写,不要从GitHub仓库直接复制

  • 标准函数调用和API名称的匹配通常属于"common phrasing",编辑看到会忽略

  • 如果代码匹配贡献了大量重复率,在投稿信中主动说明

各部分对重复率的贡献程度一览

把上面说的整理一下,大致可以排出一个"贡献度":

表格

内容类型

是否被检测

是否可排除

典型贡献度

编辑是否在意

参考文献

是(Exclude Bibliography)

3-8%

通常开启排除

致谢

否(只能手动排除来源)

1-3%

通常不在意

图表说明

否(无专门排除选项)

1-5%

看具体情况

公式

是(但检测方式有缺陷)

否(只能手动排除匹配)

5-20%(数学/物理类)

了解这个问题的编辑会忽略

代码

2-10%(CS类)

看具体情况

需要注意的是,这些贡献度只是经验值,实际数字取决于你的学科、论文类型和具体写法。一篇纯文科论文的公式贡献度为零;一篇理论物理论文的公式可能贡献20%以上。

五个常见误区

误区一:参考文献被标红了就是重复率太高。

参考文献被标红是因为格式固定,不代表你的正文有问题。开启Exclude Bibliography后重新看数字,那个才是你的真实"正文重复率"。

误区二:致谢用固定模板写没关系,反正不算抄袭。

致谢确实不算正文核心内容,但它确实被检测。如果致谢部分和某篇论文大面积重复,编辑可能会质疑你的致谢是不是从别人论文里直接复制过来的。虽然不会因此拒稿,但总归不好看。自己写几句,哪怕朴拙一点,也比照搬模板强。

误区三:图表说明用标准表述就好,系统会自动忽略。

系统没有"自动忽略图表说明"的功能。"Figure 1 shows the comparison results"这种表述太常见了,会被标记。你可以用更简洁或更有辨识度的表述方式。

误区四:公式重复率高说明论文有问题。

不是。iThenticate对公式的检测有已知缺陷。两个完全不同的方程,只要共享了几个数学符号就会被标红。数学类论文的作者和编辑都清楚这一点。

误区五:代码片段被标红需要逐行改写。

标准函数调用和API名称不需要改写。编辑看报告时能分辨哪些是通用代码表述。真正需要注意的是注释和大段逻辑——如果你的算法描述和别人的代码注释高度一致,那确实需要重写。

总结

参考文献、致谢、图表说明、公式和代码都会被iThenticate检测。参考文献有专门的排除功能,其他几个没有。公式是系统的已知短板,检测方式有缺陷。代码被当作普通文本处理。

最实际的建议:

  1. 提交和投稿版本完全一致的稿件

  2. 开启Exclude Bibliography排除参考文献

  3. 手动排除图表说明和公式的明显误匹配

  4. 致谢自己写,别照搬模板

  5. 代码用伪代码或简化版替代,减少不必要的匹配

重复率数字不是判决书。编辑看的不是那个百分比,而是报告里具体标红了什么、在什么位置、来源是什么。搞清楚这一点,你就不会被一个数字吓住。

#1000+ 高校及科研团队刚需 #累计服务大量文稿 #支持全天在线提交检测 #多数好评反馈 #安全加密传输

立即开始您的自信投稿

让每一次提交,都更接近发表。

正规检测通道 快速获取报告 数据安全,定时清理