投稿SCI期刊,很多人会遇到一种特殊情况:稿件里同时存在中英文内容。比如中英双语摘要、图表注释里的中文对照、参考文献中标注的中文原文,甚至有些作者在方法部分保留了中文数据源的原始表述。
问题就来了:这些中文内容,会不会影响英文部分的查重结果?
答案没那么简单。说"不影响"吧,不完全对。说"影响很大"吧,也不是你想的那种影响。得拆开看。
iThenticate查重系统入口
https://www.58sci.com/ithenticate/index.html
iThenticate的检测逻辑:同语言比对
iThenticate的设计原则很明确——只比对同一种语言。
据Crossref官方文档说明(CrossCheck - interpreting the similarity reports):"iThenticate will only detect text copying in the same language."翻译过来就是:系统只能检测同语言之间的文本复制。
具体到你的英文稿件里混了一段中文,情况是这样的:
系统识别到你上传的主要是英文文档,它会把英文部分拿去和数据库里的英文文献比对。中文段落呢?系统不会把它翻译成英文去比对,也不会把它和中文数据库里的内容比对。在英文查重的语境下,那些中文字符基本处于"透明"状态。
iThenticate日本官网的FAQ里也提到(iThenticateに関してよくある質問),如果一份文档中包含多种语言,"チェック結果が適切に出ない可能性があります"——检测结果可能不准确。他们建议尽量使用单一语言的文档。
这其实已经在暗示问题了:中英混合不是最优做法。
中文内容如何间接影响查重百分比
虽然中文段落不会被拿去和英文文献比对,但它会出现在一个关键计算里——总字数。
iThenticate官方帮助文档解释过相似度指数的计算方式(FAQs about the Similarity Report):
公式很简单:
相似度 = 匹配词数 ÷ 总字数 × 100%
中文内容虽然不贡献匹配词数,但它会被算进总字数(分母)。分母变大了,百分比反而会被稀释——也就是说,中文内容在理论上可能让你的查重率看起来更低。
举个例子:你一篇英文稿件有8000个英文单词,其中1200个单词存在匹配,查重率15%。如果你还加了2000个中文字符,系统把它们换算成字数后一并计入分母,总字数变成10000左右,匹配数不变,查重率就降到了12%。
听起来像是好事?别高兴太早。
第一,这种做法在出版商编辑眼里不是"聪明策略",而是"信号异常"。编辑看到稿件里有大段中文,第一反应不是"哦这人想稀释查重率",而是"这稿件怎么混着两种语言"。如果中文内容没有合理的存在理由,可能会被要求修改后再提交。
第二,iThenticate日本站明确说多语言混合文档可能导致检测结果不准确。不准确意味着什么?可能是中文被错误计入匹配,也可能是某些英文段落因为周围的中文字符干扰了文本识别,没有被正确比对。两种情况对作者都不利。
哪些场景下中文内容出现在英文稿件里是常见的
先理清楚,英文SCI稿件里出现中文的情况,大致有这几种:
1. 中英双语摘要
部分期刊要求或允许同时提供英文和中文摘要。这种情况很常见,尤其是在中国主办的英文期刊上。
2. 图表注释的中文对照
有些作者在英文图表标题后面加了中文翻译,方便国内读者理解。
3. 参考文献中的中文标注
引用中文文献时,按照某些引用格式的要求,需要在英文翻译标题后面加注"in Chinese"或保留原文标题。
4. 方法部分的数据源说明
用到中国数据库或问卷数据时,偶尔会保留原始中文变量名或量表名称。
5. 作者信息、基金项目等
稿件标题页上的中文作者姓名、中文机构名称、中文基金项目编号。
这些场景里,第1和第3种是最常见的,编辑和查重系统也都见怪不怪了。但第2、4、5种就需要注意了——它们出现的数量和位置,可能影响到检测质量。
逐场景分析:每种情况对查重的实际影响
双语摘要:
期刊如果要求双语摘要,中文摘要是合规内容。这部分中文不会和英文数据库比对。但要注意:中文摘要会被计入总字数。如果期刊不要求双语摘要,你主动加了,编辑可能让你删掉。这跟查重无关,跟投稿规范有关。
图表注释中文对照:
除非期刊明确要求,否则不建议在英文图表标题后面加中文。iThenticate识别文本时按文档整体处理,图表注释里的中文会出现在文档流中,可能干扰周围英文内容的识别精度。实际案例中,有人反馈图表注释里混了中日韩字符后,系统把相邻的英文短语识别成了乱码,导致本该被排除的术语被错误地计入了匹配。
参考文献中的中文标注:
这个是影响最小的。通常就是括号里加个"in Chinese"或者附一行中文原标题,字数很少,几乎不会对查重结果产生实质影响。iThenticate的"排除参考文献"(Exclude Bibliography)功能可以进一步消除这部分干扰——不过需要注意,官方文档说明,英文论文的参考文献排除依赖机器学习算法自动识别,非英文论文的参考文献则需要系统识别特定的起始和结束标记(Managing exclusions and filters)。中英混合的参考文献格式,可能让自动识别算法判断失误。
方法部分的中文数据源说明:
如果你保留了中文变量名或量表原名,这些中文片段不会被英文数据库比对。但它们同样会进入总字数。更重要的是,如果中文和英文混排在同一段落里,系统可能把整段的字符识别搞得混乱。这种情况比单独放一段中文更糟糕。
标题页的中文信息:
标题页通常不是查重的重点。很多期刊在使用iThenticate时会排除标题页,或者编辑在看报告时会忽略标题页的匹配。这里的中文影响微乎其微。
中译英内容:另一层面的问题
中英文对照稿件还涉及另一种情况:你的英文内容是从中文翻译过来的。
这种翻译和"中文内容混在英文稿件里"是两码事。翻译后的英文内容会被拿去和英文数据库比对——如果翻译得足够好,查重率不会高;但如果翻译过程中恰好和已有英文文献的表达撞车了(尤其是专业术语、固定句式),就会被标红。
据iThenticate/CrossCheck中文官网的分析:
iThenticate基于文本相似性检测,其比对是语言层级的逐词逐句匹配,语言转换后,即使语义完全一致,但词汇和句式发生了显著改变,系统就很难判别这种跨语言抄袭。
但紧接着他们指出了一种特殊情况:
翻译时使用了网络机翻工具,且未进行语言润色;翻译内容较为直译,与已有英文学术文章中出现的表述高度一致。
这些情况会被检测出来。
万维书刊在2025年的一篇分析文章(答疑|中文论文翻译成英文后,查重率会升高吗?)中提到了实证数据:某研究将中文论文直译后查重率为12%,经过语言优化后降至6%。专业术语的固定翻译在方法学章节的重复占比高达35%。
所以,如果你的"中英文对照"是指翻译对照,那问题不在于中文本身,而在于翻译质量——直译越接近原文表达,越容易撞车。
实操建议:投稿前怎么处理中英混合稿件
1. 投稿版本中删除不必要的中文内容
除非期刊明确要求双语摘要或保留中文原文,否则在提交给期刊的稿件中把所有中文内容去掉。图表注释只保留英文,参考文献里中文文献只写英文翻译标题加"(in Chinese)"标注。
这样做的好处:
2. 预查重时使用纯英文版本
如果你用iThenticate做投稿前预查重,提交的文档必须是纯英文版本。中英混合文档的查重结果没有参考价值——编辑看的是你英文部分的查重率,不是中英混合的查重率。
3. 参考文献格式统一
中文文献的引用格式按期刊要求来。常见做法是:
不要在参考文献列表里保留完整的中文原标题——除非期刊明确要求。标题页之外的地方,中文出现越少越好。
4. 翻译内容不要照搬原文结构
如果英文稿件是基于中文初稿翻译的,在翻译过程中做句式重构。不要逐字翻译,而是按英文学术写作习惯重新组织。专业术语用该领域通用的英文表达,不要自己发明翻译。
5. 利用iThenticate的排除功能
提交后可以调整过滤设置:排除参考文献(Exclude Bibliography)、排除引用(Exclude Quotes)、排除小匹配(设置最低匹配词数阈值)。这些操作能让查重报告更聚焦于实际可能有问题的内容。iThenticate官方帮助文档提供了详细的操作指引(Using filters and exclusion settings)。
五个常见误区
误区一:中文内容不会被检测,所以放在稿件里无所谓。
中文内容确实不会被英文数据库比对,但它会影响总字数、可能干扰文本识别精度、让编辑觉得稿件不规范。"不影响查重"不等于"没有影响"。
误区二:加了中文内容反而能降低查重率,因为分母变大了。
理论上是这样。但编辑如果发现你为了稀释查重率故意保留中文,或者查重报告因为语言混合而失真,后果比查重率高一点更严重。这不是该钻的空子。
误区三:iThenticate有语言过滤功能,可以排除非英语内容。
iThenticate没有"排除非英语内容"的过滤选项。它的排除功能只支持:排除引用、排除参考文献、排除小匹配、排除特定章节(如abstract、methods)。你不能设置"只检测英文,排除中文"。
误区四:翻译后的英文内容不算重复,因为是翻译不是抄袭。
翻译后的英文文本会被拿去和英文数据库比对。如果翻译结果恰好和已有英文文献的表达高度相似,就会被标红。翻译不构成抄袭的前提是你引用了原文并标注了来源,但如果翻译后没有标注,就属于自我剽窃或翻译剽窃。
误区五:只要中文比例不大,就完全不用担心。
少量中文(比如参考文献标注、作者信息)确实影响很小。但即使比例不大,中英混排也可能干扰系统对相邻英文内容的识别。关键不是中文占了多少比例,而是它出现在什么位置、以什么形式出现。
总结
中文内容在英文稿件中的存在感比你想的复杂。它不会被直接比对,但会间接影响查重计算的基数。它可能干扰系统识别精度,让查重报告失真。它还可能引起编辑对稿件规范的质疑。
最稳妥的做法很简单:投稿版本保持纯英文,把中文内容留给国内期刊版本或者补充材料。预查重也只用纯英文版。别在查重率上玩花样,编辑见过的情况比你多。