很多投稿作者会问:我的论文里有实验照片、流程图、化学结构式、数学公式,iThenticate 会不会把这些东西也算进相似度?还有人听过一个叫 ImageTwin 的"图片查重"工具,它跟 iThenticate 是一回事吗?
先把最核心的结论说清楚:iThenticate 只查文字,不查图片。你论文里的实验照片、流程图、示意图,它的像素一个都不会被比对。但图片的标题、说明文字、数据来源标注,这些文字部分会被正常检测。公式的情况比较特殊,取决于你怎么输入的。ImageTwin 则是完全独立的另一套系统,跟 iThenticate 没有任何从属关系。
下面展开说。
iThenticate查重系统入口
https://www.58sci.com/ithenticate/index.html
ImageTwin图片查重系统入口
https://www.58sci.com/imagetwin/index.html
iThenticate 到底检不检测图片?
不检测。
斯坦福大学图书馆的 iThenticate 使用指南写得很直白:"iThenticate reviews text in scholarly research manuscripts and will not flag potential image integrity issues."——iThenticate 只审核稿件中的文本,不会标记图片完整性问题。
原因不难理解。iThenticate 的底层逻辑是文本比对。当你上传一篇 Word 或 PDF 稿件时,系统第一步就是把它转换成纯文本,去掉排版、图表、图片、引用编号等非文字内容,只保留可以参与语义识别的文本单元。然后把这些文本片段拿去跟数据库里的内容逐句匹配。
这意味着,你论文里嵌的显微镜照片、Western Blot 条带图、实验流程图、电路示意图、化学结构式——只要是"图",系统在这一轮就已经看不见了。它不参与比对,也不会出现在相似度报告里。
但有一个容易踩坑的地方:图片的附属文字。
每张图下面都有标题(Figure 1. XXX)和说明文字(Caption),这些信息是纯文本,100% 会被 iThenticate 检测。如果你直接复制了别人论文的图题和图注,哪怕图是自己重新做的,这些文字照样会被标红。同样的道理,表格内的文字和数据(如果以文本形式存在)也会被检测。表格的框线、颜色、底纹不会被检测,但里面的字会。
还有一点容易被忽略:如果你的图是矢量图(比如用 Excel、Python matplotlib、Visio 生成的),图里面嵌入的文字标签、坐标轴标题、图例,有可能被系统提取出来参与比对。位图(截图、照片)则不会。
流程图呢?
流程图本质上是一张图。不管你是用 Visio、draw.io、PPT 画的,还是用 TikZ 在 LaTeX 里画的,上传后它都会被当作图片处理。流程图里面的框框、箭头、连接线、颜色,iThenticate 一律不看。
但流程图里的文字,情况就跟前面说的一样了。如果是矢量格式中嵌入的文本,有可能被提取。如果你把流程图截图存成 PNG 或 JPG 插进去,那里面的文字就彻底不可见了。
流程图的标题和说明文字——比如"Figure 3. Schematic diagram of the experimental setup showing..."——这些属于正文文本的一部分,正常参与查重。
有一个实际场景需要注意:有些人的流程图画得非常标准,跟某篇高引论文里的流程几乎一模一样。iThenticate 查不出来,但审稿人和编辑能看出来。图片的学术抄袭判定不完全依赖算法工具,人眼审阅仍然是关键环节。
公式的情况比较复杂
公式是这里面最特殊的一类。它检不检测,完全取决于你是怎么把它放进文档里的。
纯文本输入的公式:会被检测。 比如你直接在 Word 里用键盘打了"E = mc²"或者"y = ax + b",系统会把它当普通文本处理,跟数据库里的内容做比对。如果恰好跟别人论文里的公式表述一致,就会被标红。
专业公式编辑器插入的公式:通常不会被检测。 用 MathType 编辑的公式、LaTeX 编译后嵌入 PDF 的公式,在 iThenticate 把文档转换为纯文本的阶段,这些公式要么变成乱码,要么直接被跳过。系统"不认识"它们。
公式的解释性文字:会被检测。 比如"其中,β 为摩擦系数,γ 为重力加速度"这段说明,不管你公式本身怎么输入的,这段文字都是普通文本,正常参与比对。
这就引出一个在理工科论文中很常见的现象:一篇满是公式的物理论文,iThenticate 跑出来的相似度可能只有 8%,而一篇纯文字的综述论文反而可能到 25%。不是因为物理论文更"原创",而是公式、符号、化学结构式这些承载了大量信息的非文本内容,根本没被系统计算在内。
所以别拿低相似度当成绝对安全的信号。它只代表"文本层面的重复率低",不代表你论文里的公式、模型或方法论没有跟别人撞车。
ImageTwin 是什么?跟 iThenticate 什么关系?
没有关系。
ImageTwin 是一家独立的图片完整性检测公司,总部在欧洲。它不是 Turnitin 的产品,也不属于 iThenticate 的生态。
两者的区别可以用一句话概括:iThenticate 查文字抄袭,ImageTwin 查图片造假和重复。
ImageTwin 的数据库目前有 1.6 亿张已发表的科学图片,来源覆盖开放获取期刊和出版商合作资源。它做的事情是把作者投稿中的图片拿去跟这 1.6 亿张图比对,看看有没有以下问题:
全球排名前 10 的学术出版商中有 8 家在使用 ImageTwin,包括 Elsevier、Springer Nature、Wiley、Taylor & Francis、AAAS 等。根据 PubPeer 上的数据,ImageTwin 的检测结果已被引用在约 4200 篇论文的更正或撤稿中。
说白了,iThenticate 和 ImageTwin 在期刊审稿流程中是两个并列的检查环节:一个管文字,一个管图片。
期刊实际是怎么检查图片的?
不是所有期刊都用 ImageTwin。图片完整性检测目前在大型出版商中比较普及,中小型期刊可能还没有纳入这个环节。
典型的流程是这样的:
斯坦福大学用的是 Proofig 而不是 ImageTwin 来做图片检测。不同机构选择不同的工具。但核心逻辑一样:这些图片检测工具和 iThenticate 是分开运行的,各管各的。
对于作者来说,最需要注意的是:即使你的期刊目前不用图片检测工具,这个趋势正在快速扩展。尤其是 Dana-Farber 癌症研究所那起涉及 60 多篇论文的图片造假丑闻(最终导致 1500 万美元的和解)之后,出版界对图片完整性的重视程度大幅上升。
实用建议
关于图片:
关于流程图和示意图:
关于公式:
关于 ImageTwin:
常见误区
误区一:"iThenticate 没标红就代表没问题。
iThenticate 只检查文字。你的图片是否造假、流程图是否照搬、公式是否抄袭,它一概不管。
误区二:"ImageTwin 是 iThenticate 的图片检测模块。
不是。ImageTwin 是独立的公司和独立的产品,跟 Turnitin/iThenticate 没有任何关系。
误区三:"公式不会被查重,所以随便抄。
公式本身可能不会被 iThenticate 识别,但公式的推导过程、文字说明会被检测。而且公式的原创性审查靠的是同行评议,不是查重软件。
误区四:"流程图截图插进去就查不出来了。
查重系统确实看不到截图里的内容。但审稿人能看到。学术规范不会因为工具检测不到就不存在。
误区五:"我的论文图片多,所以 iThenticate 相似度会更高。
恰恰相反。图片越多,纯文本在论文中的占比就越低,iThenticate 计算出的相似度百分比可能反而更低。这不是好事——它只意味着系统"看不见"的部分更多了。
一句话总结
iThenticate 管文字,ImageTwin 管图片,两者互不干涉。公式的检测取决于输入方式。但工具能查到的只是冰山一角,真正的学术诚信靠的是你自己对每一张图、每一个公式、每一段文字负责。