投出去三个月,编辑一句话打回来:重复率22%。
你打开iThenticate报告一看,傻眼了。标红的段落来源显示"Publications"——你压根没抄过这些文章。更奇怪的是,有几段你明明自己写的,也被标记出来跟某个不知名的会议摘要高度相似。
问题出在哪?不是你的论文有问题,是你对iThenticate的数据库一无所知。
这篇文章把iThenticate的比对数据库拆透。5大来源类别、1500多家出版商合作网络、Crossref索引机制、ProQuest学位论文库、预印本平台收录路径,以及最关键的——数据库有哪些盲区,什么内容它查不到。搞懂这些,你才能知道报告上的每一个红色标记到底从哪来。
iThenticate查重系统入口
一、iThenticate数据库到底有多大
先把数字摆出来。
根据Turnitin官方数据和多个第三方测评,截至2026年,iThenticate的数据库规模大致如下:
表格
来源类型 | 收录规模 | 说明 |
|---|---|---|
互联网网页 | 990亿+页面 | 包含当前页面和网页存档快照 |
学术期刊文献 | 9000万+篇 | 来自1500+家出版商的合作内容 |
会议论文 | 千万级 | IEEE、ACM等主要计算机/工程会议 |
学位论文 | 百万级 | 主要通过ProQuest收录全球博士论文 |
书籍及章节 | 未公开具体数字 | 通过出版商合作获取 |
预印本平台 | 持续收录中 | arXiv、bioRxiv、SSRN等 |
乍一看觉得挺全。但"全"是相对的——你得搞清楚它收录了什么、没收录什么,以及为什么同一篇论文在iThenticate和Turnitin里跑出来的分数不一样。
二、报告里的5大来源类别,每一条代表什么
打开iThenticate的相似度报告,右侧面板的每一条匹配来源都会标注一个来源类型。很多人看都没看过这个分类,直接盯着百分比焦虑。实际上,搞清楚来源类别,你就知道这段重复是"正常的"还是"危险的"。
iThenticate的比对来源分为5类:
1. Internet(互联网来源)
你参考的网页内容、博客文章、新闻报道、维基百科条目,甚至别人发在个人主页上的课件PDF,都可能在这里被匹配到。iThenticate用自己的网络爬虫持续抓取公开网页,而且保留了网页存档——也就是说,你参考的那个网页就算已经被删了,iThenticate库里还有快照。
匹配特征:通常是连续大段文字高度重合。如果这一类匹配占比高,说明你可能直接复制了网上的内容,而不是学术期刊里的。
2. Publications(学术出版物)
这是最核心、也是编辑最看重的来源库。它包含通过出版商合作协议获取的期刊全文、会议论文集和书籍章节。来源覆盖Elsevier、Springer Nature、Wiley、IEEE、ACS、PLoS、Taylor & Francis等主要学术出版集团。
匹配特征:如果你的重复主要来自这个库,意味着你的论文跟某篇已发表的学术论文高度相似。编辑会逐条审查。
3. Crossref
Crossref是全球最大的学术作品DOI注册机构。iThenticate通过Crossref的索引获取会员出版商的元数据和全文内容。绝大多数SCI/SSCI期刊都是Crossref会员,所以你在这些期刊上发表过的文章,几乎都会出现在Crossref库里。
匹配特征:Crossref库的匹配通常来自正规期刊论文。值得注意的是,Crossref还有一项服务叫Similarity Check——全球超过1500家出版商用它来筛查投稿,而这套系统的底层引擎就是iThenticate。换句话说,期刊编辑部用来审你的工具,和你自己用来预检的工具,跑的是同一个数据库。
4. Crossref Posted Content(Crossref预发布内容)
这个库比较特殊。它收录的是已经提交到Crossref但还没正式发表的内容,包括预印本、技术报告、数据集说明等。也就是说,如果有人在arXiv上挂了一篇预印本,而这篇预印本后来被Crossref索引了,它就会出现在这个库里。
匹配特征:你看到的来源可能显示为"Submitted to [某期刊/平台]"或者带有预印本标识。这种匹配在2024-2026年越来越多,因为预印本发布量暴增。
5. Preprint Sources(预印本平台来源)
iThenticate单独设了一个预印本来源类别,直接收录arXiv、bioRxiv、medRxiv、SSRN、Research Square等主流预印本平台的内容。这个类别跟Crossref Posted Content有交集,但不完全相同——有些预印本只被平台直接推送给iThenticate,没有经过Crossref。
匹配特征:如果你的论文和某篇预印本撞了,来源会明确标注"Preprint sources"。这种情况在自己先发了预印本再投期刊的作者中非常常见。
三、1500+出版商合作伙伴:你的论文几乎不可能"躲过去"
iThenticate的学术出版物数据库之所以强大,是因为它通过两条路径获取内容:
路径一:出版商直接合作
Turnitin(iThenticate的母公司)与全球主要学术出版集团签有内容授权协议。根据公开信息,主要合作方包括:
表格
出版集团 | 旗下代表期刊/品牌 | 覆盖学科 |
|---|---|---|
Elsevier | The Lancet, Cell, 2800+期刊 | 全学科 |
Springer Nature | Nature, Science系列, BMC | 全学科 |
Wiley | Advanced Materials, Chemical Reviews | 材料/化学/工程 |
IEEE | IEEE Transactions系列, 会议论文集 | 电子/计算机/通信 |
Taylor & Francis | 1700+期刊 | 人文社科/理工 |
ACS | JACS, 化学领域主力期刊 | 化学 |
PLoS | PLoS ONE, PLoS Biology | 生物/医学(开放获取) |
MDPI | Sensors, Molecules, IJMS | 多学科开放获取 |
Frontiers | Frontiers系列期刊 | 多学科开放获取 |
Cambridge University Press | 400+期刊 | 全学科 |
Oxford University Press | 300+期刊 | 全学科 |
SAGE | 1000+期刊 | 社科/医学 |
这只是头部玩家。实际上iThenticate的合作出版商超过1500家,覆盖30多个学科领域。
路径二:Crossref Similarity Check
Crossref Similarity Check是一项面向出版商的服务,底层由iThenticate驱动。加入这项服务的出版商,其期刊上发表的每一篇论文都会自动成为iThenticate数据库的比对来源。目前使用该服务的出版商超过1500家,涵盖了全球绝大多数主流学术期刊。
这意味着什么?你在投稿时,编辑部用iThenticate检查你的论文。而iThenticate用来比对的数据库,包含了几乎所有你引用的那些文献的全文。编辑看到的匹配结果,和你自己预检看到的一模一样。
四、ProQuest学位论文库:iThenticate独有的"秘密武器"
一个常被忽略的事实:iThenticate收录了ProQuest Dissertations & Theses Global(PQDT)数据库。
PQDT是全球最大的学位论文数据库,收录了从1743年至今的全球博硕士论文,引用回溯至1637年。数百万篇全文论文,每年还在持续增加。
这跟Turnitin有什么不同?Turnitin的数据库核心是"学生作业库"——全球大学生提交的课程论文和毕业论文。而iThenticate收录的是正式授予学位的博硕士论文,通过ProQuest渠道获取。
实际影响:
如果你的文献综述参考了某篇美国大学的博士论文,而且那篇论文被ProQuest收录了,iThenticate会标出来。Turnitin大概率不会——因为Turnitin的数据库侧重的是学生课程作业,而不是正式学位论文。
反过来,如果你的论文跟某个同学去年提交的课程报告撞了,iThenticate查不出来,Turnitin能查出来。各管各的。
五、数据库的更新频率:新发表的文章多久会被收录
很多作者碰到一个情况:你参考了一篇论文,那篇论文两周前刚发表。你拿去iThenticate查,结果报告里完全没匹配到。你觉得安全了,投出去。编辑部一查——标红了。
怎么回事?
iThenticate的数据库更新不是实时的,但不同来源的更新频率差异很大:
表格
来源类型 | 更新频率 | 入库延迟 |
|---|---|---|
互联网网页 | 持续爬取 | 数小时到数天 |
Crossref学术内容 | 出版商推送+定期同步 | 数天到数周 |
出版商合作内容 | 批量授权更新 | 数周到数月 |
预印本平台 | 平台推送 | 数天 |
ProQuest学位论文 | 定期更新 | 数月 |
几个关键信息:
网页内容最快。 你参考的网页、博客、新闻报道,iThenticate可能在你提交检测的前一天就已经爬取入库了。
期刊论文的入库有延迟。 一篇论文在Elsevier上线后,iThenticate要等Crossref同步或出版商批量推送才能获取到。这个周期通常在1-4周。也就是说,你预检的时候那篇文章可能还没入库,但编辑部几周后检查时已经入库了。
预印本入库也在加快。 arXiv和bioRxiv的预印本通常在发布后数天内就会出现在iThenticate的数据库里。
ProQuest最慢。 学位论文从答辩通过到被ProQuest全文收录,中间可能有数月的延迟。但一旦收录,就是永久性的。
这就是为什么"预检通过"不等于"编辑检查也通过"。时间差是一个真实存在的风险。
六、iThenticate查不到什么:数据库的盲区
说完收录了什么,聊聊没收录什么。这部分同样重要——有些内容iThenticate确实查不到,但别因此心存侥幸。
1. 非公开内容
没有公开发表的文献、内部报告、未上传到任何平台的文稿,iThenticate查不到。它的比对基础是"已进入数据库的内容"。如果某篇论文只存在于作者的硬盘上,没有任何数据库收录,那iThenticate自然无法匹配。
2. 付费墙后的部分非合作内容
虽然iThenticate的合作出版商已经覆盖了主流学术出版集团,但世界上还存在一些小型出版商、地区性期刊,它们既不是Crossref会员,也没有跟Turnitin签内容授权协议。这些期刊的全文内容可能不在iThenticate的数据库里。
不过,这些期刊的网页版如果被iThenticate的网络爬虫抓到了,那还是会以"Internet来源"被匹配到。
3. 翻译内容
这是最大的盲区之一。如果你把一篇中文论文翻译成英文,或者用DeepL把一篇日语文献翻译成英文后放进自己的论文里,iThenticate是查不出来的。它比对的是文字指纹,不是语义。英文文本跟日文/中文原文的文字指纹完全不同。
但要注意:语义级别的查重技术正在发展。iThenticate 2.0已经引入了一些语义分析能力,虽然目前还不能完全做到跨语言比对,但这个方向已经在推进了。
4. 刚发表的新论文
前面说过,新论文入库有1-4周的延迟。如果你的论文跟一篇昨天刚上线的文章撞了,你的预检报告里不会显示。但编辑部两周后检查的时候,大概率能查到。
5. 代码和数据
iThenticate检测的是文本相似度。代码片段、数据表格、公式推导——如果它们不是以文本形式被数据库收录的,iThenticate不会去匹配。但如果你的方法描述部分用了跟别人一模一样的句子来解释代码逻辑,那是会被查出来的。
6. 图片内容
iThenticate不做图片比对。如果你的图片是复制别人的,iThenticate的相似度报告不会标出来。但这不意味着你可以随意用别人的图——图片抄袭由编辑人工审查和版权系统来管,不在iThenticate的职责范围内。
七、同一篇论文,iThenticate和Turnitin的分数为什么不同
这个问题被问了无数次。答案是数据库结构不同。
表格
对比维度 | iThenticate | Turnitin |
|---|---|---|
定位 | 学术出版/研究查重 | 学生作业/论文查重 |
学术出版物 | 9000万+篇,1500+出版商 | 1.9亿+篇,覆盖更广但侧重不同 |
学位论文 | ProQuest正式博硕士论文 | 学生提交的课程作业和毕业论文 |
学生论文库 | 无 | 核心功能,数十亿份 |
互联网覆盖 | 990亿+页面 | 910亿+页面 |
平均重复率(同一文档) | 8.30% | 12.10% |
数据来源:Research Experts 2025年对比研究,对同一批论文分别用两个系统检测。
为什么Turnitin通常分数更高?因为Turnitin有学生论文库。一篇论文如果跟某个学生去年提交的作业撞了,Turnitin会标出来,iThenticate不会。
为什么iThenticate对出版商内容更敏感?因为iThenticate的ProQuest学位论文库收录的是正式发表的博士论文,这些内容Turnitin的学生库不一定有。
简单记:期刊投稿用iThenticate,课程作业用Turnitin。 两者数据库侧重点不同,不能互相替代。
八、数据库来源对查重策略的实际影响
搞清楚数据库收录什么、不收录什么之后,你的改重策略也应该据此调整。
Publications来源匹配多:优先处理。 这是编辑最关注的来源。跟已发表论文撞车,不管你是无意的还是参考了同一篇文献,都得改。具体改法是逐句重写+重新组织逻辑,不是换同义词。
Internet来源匹配多:检查是否引用了网页内容。 如果你参考了某个网页上的资料,但没有标注来源,iThenticate会标出来。要么加上引用格式,要么自己重新表述。
Crossref Posted Content匹配多:预印本冲突。 要么是你自己的预印本,要么是别人的。自己的预印本在Cover Letter里声明就行;别人的就要考虑是否存在优先权争议。
Preprint Sources匹配多:同上,预印本问题。 参考本系列文章中关于预印本应对方案的专门讨论。
参考文献列表标红:不用慌。 在提交检测前开启"Exclude Bibliography"(排除参考文献)选项。绝大多数SCI期刊编辑看的就是排除参考文献后的结果。如果报告底部标注了"Filtered from the Report: Bibliography",说明参考文献已经被排除了。
九、投稿前你可以做的数据库层面准备
最后给你一个实用的操作清单,帮你在投稿前最大限度地利用对数据库的了解来降低风险:
常见问题(FAQ)
Q1:iThenticate数据库里的期刊论文都是全文比对吗?
是的。iThenticate跟出版商的合作协议通常包含全文内容授权。比对时不是只比摘要或标题,而是逐句匹配全文。
Q2:我引用了一篇会议论文,但那个会议很小众,iThenticate能查到吗?
如果是IEEE、ACM、SPIE等主要学术会议出版商出版的会议论文,大概率在库里。如果是非常小型的地区性会议,且没有被Crossref索引,那可能不在数据库里。但这不代表你可以直接复制——编辑人工审查时也可能发现。
Q3:我的论文参考了一本英文专著的某个章节,iThenticate能检测到吗?
如果该出版商是iThenticate的合作方(如Springer、Cambridge University Press等),书籍章节大概率在库里。书籍的收录覆盖率不如期刊那么全面,但主流学术出版商的书籍覆盖已经相当好。
Q4:iThenticate能不能检测到非英文论文的重复?
iThenticate的数据库以英文内容为主。如果你的论文是英文的,而参考的内容也是英文的,检测效果最好。如果你参考了一篇法语论文并将其翻译成英文,iThenticate目前无法检测这种跨语言重复。
Q5:我在预印本平台发了论文,投期刊时iThenticate会把自己跟自己的预印本比对出来吗?
会。arXiv、bioRxiv、SSRN等主流预印本平台的内容已经收录在iThenticate数据库里。你的论文跟自己的预印本高度重合是正常的,编辑也理解这一点。关键是你在Cover Letter里声明这是同一工作的预印本版本。
Q6:数据库多久更新一次?我能查到某篇论文是否已经入库吗?
iThenticate没有公开透明的入库查询接口。你无法主动检查某篇特定论文是否已经进入数据库。不同来源的入库延迟不同:网页数天,期刊论文1-4周,学位论文数月。
Q7:iThenticate会收录我的论文吗?我预检之后,我的论文会进入数据库吗?
不会。这是iThenticate和Turnitin的一个重要区别。iThenticate不存档提交的文档。你预检的论文不会进入数据库,不会被后续的其他论文匹配到。Turnitin默认会存档学生提交的文档(除非机构选择退出)。
投稿前自检清单
本文基于iThenticate 2.0(2026年2月发布)的数据库架构和Crossref Similarity Check公开信息撰写。各出版商合作内容可能随授权协议更新而变化,具体覆盖范围以iThenticate官方报告为准。