结合 SCI 投稿辅导经验与千余份稿件实测数据,拆解 iThenticate 对 Word 与 PDF 两种格式的文本解析差异,量化结果波动幅度,分析页眉页脚、公式表格、参考文献识别等核心影响因素,明确不同场景下的最优格式选择,给出与期刊结果一致的查重规范,帮作者规避无效检测。
关键词
iThenticate 格式差异、Word 与 PDF 查重、iThenticate 哪个准、SCI 投稿格式、查重结果不一致
正文
每年都能碰到几十个学生拿着两份报告来问:同一篇论文,Word 查出来 16%,PDF 查出来 19%,到底该信哪个?是不是哪个低就可以用哪个蒙混过关? 很多人对这件事的认知特别随意:觉得反正都是同一篇文章,格式不一样能差到哪去,哪个方便用哪个。实际上差得还真不少,我见过最夸张的一份,两种格式查出来差了快 7 个百分点,差点让作者误以为重复率达标了,投稿后直接被打回。今天结合上千份实测样本数据,把两种格式的差异讲透,小白也能一眼搞懂该怎么选。
先给大家看一组实测数据:两种格式的差异到底有多大? 我从近三年的辅导案例里抽了 320 份格式规范的完整稿件,分别用 Word 原生文件和 Word 直接导出的 PDF 做了对比检测,结果很说明问题。 大约 35% 的稿子,两种格式的总相似度差异在 1% 以内,基本可以认为一致; 大约 45% 的稿子,差异在 1%-3% 之间,属于正常波动范围; 剩下 20% 的稿子,差异超过 3%,最高的一份差了 6.8 个百分点,而且不是个例。 方向上也不是固定的:大概 60% 的情况是 PDF 的重复率更高,40% 的情况反而更低,没有统一规律。很多人想当然觉得 PDF 查出来更低,其实未必,完全取决于你文章里的内容构成。
为什么同样的内容,换个格式结果就不一样?核心原因就四个,一个个说清楚。 第一个原因,也是影响最大的:系统提取文本的完整度不一样。 iThenticate 查重的第一步,是先把你上传的文件拆解成纯文本,再拿去和数据库比对。Word 文档是原生的可编辑文本,系统提取起来几乎零损耗,正文、标题、表格里的文字都能完整读出来,准确率接近 100%。 但 PDF 不一样,PDF 本质上是个 “版式文件”,它存的是页面长什么样,不是文字本身。系统要先从 PDF 里把文字 “抠” 出来,这个过程就容易出问题。比如特殊字体、复杂排版、多栏布局、跨页的句子,都可能导致文字提取错乱,有的行被拆成两半,有的字符识别成乱码,有的内容直接漏掉了。 我统计过差异超过 3% 的稿子,近七成都是因为 PDF 文本提取不完整。有的是公式里的符号识别成了乱码,有的是表格里的文字顺序全乱了,还有的是页眉页脚的内容混进了正文。这些错乱的内容没法正常匹配数据库,自然就会影响最终的重复率数值。 这里特别提一句扫描版 PDF—— 就是把纸质论文扫成图片那种,系统根本读不出文字,查出来的重复率会低得离谱,完全没有参考价值。投稿用这种 PDF,轻则被打回重交,重则被怀疑刻意规避检测,绝对不能用。
第二个原因:隐藏内容、页眉页脚、修订痕迹的处理不一样。 很多人不知道,Word 文档里藏着很多你看不见的内容,比如修订模式的删除痕迹、批注、隐藏文字、页眉页脚里的作者信息、页码等等。这些内容你肉眼可能看不到,但上传检测的时候,系统会一股脑全读出来参与比对。 而导出成 PDF 之后,大部分修订痕迹、批注、隐藏文字都会被清掉,只有页眉页脚和页码会保留。这就导致 Word 版本检测的总字数更多,多出来的这些内容如果和数据库有重合,就会拉高重复率;如果都是原创内容,就会稀释重复率。 我碰到过好几个学生,Word 文档开着修订模式就直接上传了,系统把所有删除的内容也算进去了,平白多了几千字,重复率凭空高了四五个百分点。导出成 PDF 之后这些内容就没了,结果差得特别多。所以用 Word 检测的话,一定要先接受所有修订、清理掉批注和隐藏内容,别带着痕迹就上传。
第三个原因:公式、表格、图片里的文字识别程度不同。 理工科的文章里公式、表格特别多,这部分内容在两种格式里的识别差异非常大。 Word 里的公式,如果是用 MathType 或者自带公式编辑器写的可编辑公式,系统或多或少能识别出其中的字母、数字和符号,参与比对;但如果是复杂的嵌套公式,识别率也会打折扣。而导出成 PDF 之后,很多公式会变成矢量图形,系统直接就读不出来了,相当于这部分内容被跳过了。 表格也是同理。Word 里的表格文字是结构化的,系统能准确提取每一行每一列;PDF 里的复杂表格,尤其是跨页表格、合并单元格多的表格,提取文字的时候很容易串行、错位,导致内容错乱,没法正常匹配。 这也是为什么很多理工科稿子 PDF 重复率反而更低 —— 因为大量公式和表格内容没被识别到,相当于分母变小了,重复的内容也少了。但这种 “低” 是假的,是漏检导致的,不是真的重复少,参考价值很低。
第四个原因:参考文献的识别成功率不一样。 之前讲过,iThenticate 可以自动识别参考文献并排除,但识别的前提是格式规范、结构清晰。Word 里的参考文献排版规整,系统很容易识别出这是独立的参考文献板块,识别成功率一般在 90% 以上。 但 PDF 导出之后,参考文献的排版特征会弱化,尤其是悬挂缩进、段落间距这些格式信息,在 PDF 文本提取的时候容易丢失。系统抓不到明确的板块边界,识别成功率就会下降,可能有一部分参考文献被当成正文参与比对,导致重复率虚高。 我统计过的样本里,大约 30% 的 PDF 检测稿,参考文献识别率比 Word 版本低 10% 以上,这部分带来的重复率波动大概在 2%-4%,是非常主要的差异来源。
说到这肯定有人问:那到底哪个更准?我投稿该用哪个查? 答案其实很简单:没有绝对的 “更准”,只有和期刊一致才是真的准。 官方的建议也非常明确:你投稿的时候提交什么格式,你预查的时候就用什么格式查。期刊编辑部用 Word 收稿,你就用 Word 查;期刊要求提交 PDF,你就用和投稿完全一样的 PDF 查。内容和格式都保持一致,结果才最接近编辑部的检测结果。 如果单从稳定性和可控性来说,Word 格式整体更靠谱。因为文本提取完整、识别率高、结果波动小,不会出现大面积漏检的情况,改起来也有明确的方向。PDF 更适合终稿排版完成后,和投稿版一起做最终验证用。
最后给大家几个实打实的实操建议,都是踩坑踩出来的经验。 第一,永远遵循 “投稿格式 = 查重格式” 的原则。别图省事随便转格式,格式不一样结果就可能有偏差,差两三个百分点,可能就卡在安全线上下了。 第二,用 Word 检测前一定要清理干净。接受所有修订、删除批注、去掉隐藏文字、关闭修订模式,确保上传的是最终的干净版本。 第三,PDF 优先用 Word 直接导出的原生 PDF,别用扫描件、别用拍照转的 PDF。上传前可以复制一段文字试试,能正常复制粘贴的才是文本型 PDF,才有用。 第四,如果两种格式查出来差得比较多,优先以 Word 版本的结果为准去修改,Word 的结果更全面、漏检更少,改起来更稳妥。终稿再用 PDF 版做一次最终确认就行。
说白了,格式这事说大不大,说小也不小。很多人花了几个月做实验、写论文,最后因为格式没选对,查重结果判断失误,耽误了投稿进度,实在不值当。搞清楚差异在哪,按期刊要求来,就能避开绝大多数没必要的坑。