拆解 iThenticate 对参考文献的识别与排除逻辑,依托实测样本对比完整稿与删参考文献稿的结果差异,纠正 “删文献降重更准” 的误区,给出规范检测的实操方法,帮作者获得与期刊一致的查重结果,避开无效操作,顺利通过初审。
关键词
iThenticate 参考文献查重、删掉参考文献查重、SCI 论文查重、参考文献排除、iThenticate 检测规范
正文
每到投稿集中的时间段,都有几十个学生问同一个问题:“老师,参考文献反正都是重复的,我能不能删掉再查 iThenticate?这样重复率低一点,是不是更准?” 很多人觉得参考文献全是公开的条目,查了也是白查,只会拉高总重复率,干脆删掉眼不见为净。还有的更极端,不仅删参考文献,连摘要、致谢都全删掉,只传正文去查,自以为这样能精准看 “有效重复率”。今天结合我攒了五六年的上千份实测数据,把这件事讲透,告诉你为什么我从来不建议大家删掉参考文献查重,以及正确的操作应该是什么样的。
先给大家交个底:参考文献会标红,是百分百正常的事。 iThenticate 的数据库里收录了海量已出版的文献,你文末列的每一篇参考文献,基本都能在库里找到对应的原文。所以文献条目里的作者名、标题、期刊名、DOI 这些内容,和库里重合是必然的,查出来全标红太正常了。 我统计过近 1200 份正常原创的 SCI 稿件,参考文献带来的重复,一般会占到总重复率的 20% 到 40%。比如总重复率 18% 的稿子,拆开一看,可能有 6%-8% 都是参考文献带来的。也难怪很多人看着闹心,总想删掉。 但你要明白:标红不等于算抄袭。业内所有期刊编辑都知道参考文献必然重复,所以看报告的时候,都会手动勾选 “排除参考文献” 这个选项,把这部分重复直接剔除掉,根本不会算进有效重复率里。说白了,这部分重复就是 “无效重复”,看着吓人,其实对最终判定毫无影响。
那删掉参考文献再查,行不行?结论很明确:能查,但结果不准,很容易误导你。 很多人觉得,反正编辑最后也要排除,我提前删掉不就等于提前排除了?真不是一回事。我专门做过一组对比测试:找了 86 份格式规范的完整稿件,先完整上传检测,再手动删掉所有参考文献只传正文,对比两组结果。 数据很说明问题:删掉参考文献后,总重复率数值平均比 “完整版 + 系统排除参考文献” 的数值低了 2.4 个百分点。听起来差得不多,但关键是没规律 ——65% 的稿子数值偏低,35% 的稿子反而偏高,差值最大的一份差了 7 个百分点。 为什么会这样?其实逻辑很简单:重复率是个比例,等于重复字数除以总字数。你删掉了参考文献,总字数(分母)变小了,而正文里的引用短句、专业术语这些重复内容还在,它们在总字数里的占比就会波动。有的稿子参考文献占比大,分母缩得多,比例就降了;有的稿子正文本身重复就多,分母变小后比例反而抬上去了。 更重要的是,你投稿给期刊的时候,总不能也删掉参考文献再投吧?人家要求提交完整的论文,你就必须用完整的版本去预查,这样结果才和编辑看到的最接近。你私自删掉内容查出来的结果再好看,和投稿版对不上,等于白查。每年都有学生删了参考文献查出来 12%,觉得稳了,结果投稿完整版查出来排除文献后是 17%,差点踩线,平白多折腾一轮修改。
说句实在话,绝大多数想删参考文献的人,本质上是踩了格式的坑 —— 参考文献格式乱七八糟,系统识别不出来,没法一键排除,总重复率虚高得离谱。 我统计过近 200 份总重复率虚高的稿件,其中近四成都是因为参考文献格式不规范,系统没识别成独立的参考文献板块,当成普通正文去比对了。格式混乱的稿子,系统对参考文献的识别率可能连 40% 都不到,大量文献条目被当成正文标红,总重复率凭空高了十几个百分点都很常见。 这时候正确的做法根本不是删掉参考文献,而是把格式改规范,让系统能准确识别。怎么改?其实不用抠得特别细,不用每个标点都完美对齐,抓住三个核心点,识别率就能提上来: 第一,文末加明确的 “References” 或者 “Bibliography” 标题,单独占一行,和前面的正文清晰分开,别跟讨论部分混在一起; 第二,所有文献条目按统一规则排序,要么按作者姓氏首字母排,要么按正文引用顺序排,别想到哪写到哪乱堆一气; 第三,每条文献的要素结构要一致,作者、年份、标题、来源信息的顺序统一,别有的缺年份有的缺期刊名。 就这三步改完,绝大多数稿子的参考文献识别率都能升到 90% 以上,系统就能自动排除,根本不用你手动删。我碰过最夸张的一个学生,格式乱排导致总重复率 32%,改完格式一键排除后,有效重复率只有 13%,前后差了快一倍,比删文献靠谱多了。
还有个误区顺带纠正一下:有人觉得删掉参考文献,能避开 “过度引用” 的判定,纯属想多了。 编辑判断你是不是过度引用,看的是正文里的引用内容占比,不是看文末的参考文献列表。你正文里大段直接引用、自己的原创观点少,哪怕把参考文献全删了,编辑也一样能看出来。反而删掉参考文献会让编辑觉得你刻意隐瞒引用,性质比重复率高更严重,完全是得不偿失。
最后给大家说几个实打实的实操建议,都是这么多年看学生踩坑总结出来的,照着做能少走很多弯路。 第一,预查永远和投稿版本保持一致。期刊要求交什么,你就原封不动传什么查,别私自增删内容。内容一致,结果才有参考价值,不然改了半天都是无用功。别为了刷个好看的数字自欺欺人,最后投稿结果对不上,吃亏的是自己。 第二,拿到报告先点 “排除参考文献”+“排除引用”,看排除后的数值,别盯着总相似度瞎焦虑。总重复率里无效内容太多,有参考文献、有通用术语、有规范引用,看了只会自己吓自己。编辑真正看重的,是排除后的有效重复率。 第三,如果识别率低,优先改格式,别删文献。删文献是治标不治本,还容易导致结果失真;改格式才是一劳永逸的办法,改完不仅查重能正常排除,投稿的时候格式分也能拿到手,一举两得。 第四,别追求零重复。参考文献带点重复太正常了,哪怕总重复率稍高一点,只要排除后在安全区间里就没问题。完全没必要为了几个百分点,把时间浪费在删文献、改文献条目这种毫无意义的事情上。
说白了,查重这件事,核心是 “预判期刊的判定结果”,而不是 “刷出一个好看的数字”。删掉参考文献查出来的数字再低,也只是自己骗自己。老老实实传完整版本,用好系统自带的排除功能,把精力放在正文的核心重复内容上,才是最高效、最稳妥的做法。