1. 查重的基本定义和主要应用场景
查重是利用专业技术手段对文本内容和已公开的大量资源进行比对,判断原创性占比的一种校验方式,是目前学术以及很多内容场景中核验内容原创度的通用方法,全称为文本原创性核验,核心就是完成内容重合度筛查、原创性核验的基本目标,也是支撑引用规范校验、学术不端识别的技术基础。
1.1 查重产生的背景以及主要的应用场景
查重技术的普及,本质上就是数字内容爆发式增长背景下,维护内容原创生态的一种必然结果。在纸质内容为主的时代,人工核验原创性成本很高,几乎不可能进行批量校验;伴随着数字化出版、内容传播效率的提高,大量的重复搬运、不当引用的内容也开始占据原创的空间,查重技术也逐渐得到应用。目前查重的应用场景已经覆盖多个领域:
- 高校场景:本科论文查重、硕博毕业论文抽检、课程作业原创性核验,是目前国内高校使用最广泛的场景
- 学术出版场景:期刊投稿前的原创性筛查、已发表文献的学术不端检测,对应期刊查重标准的规范要求
- 商业场景:职场项目报告合规校验、企业内部文档原创性核验、招投标文件内容重合度排查
- 内容平台场景:自媒体原创内容保护、平台二次搬运内容筛查,维护内容创作者权益
不同场景下查重的核心诉求存在着明显的差别,学术场景下查重的主要目的就是发现学术不端行为,促使创作者遵守引用规范,保证学术成果的原创价值;内容平台场景下查重的主要目的就是打击搬运抄袭,保护原创内容的权益归属;企业场景下查重更多的是为了防止不同的部门产出的项目报告出现无意义的重复,提高办公效率。
不同的场景下查重通用基准的要求不同,也直接导致了不同的场景选择的查重系统类型、合格查重率区间存在较大的差别。
2. 查重的核心运作原理是什么
很多零基础用户第一次使用查重的时候,会以为查重就是简单的全文关键词匹配,其实正规的查重系统有一套完整的技术运作流程,最终得到的查重率结果是经过多轮算法校验后得到的数值。
整个查重的运作过程可以分为6个主要步骤,即上传待检测文本、文本结构化拆分处理、特征值提取、与海量比对数据库匹配、重复内容标记、查重报告生成,全部由系统自动完成,不需要人工参与初筛环节。
2.1 核心比对及重复判定规则
查重系统会把待检测的完整文本拆分成连续的字符片段,对每一个片段提取出它的专属特征值,防止因为纯关键词匹配而造成的大量误判。目前国内主流学术检测系统的通用规则是,连续13个字符(中文约合6-7个汉字)与数据库中已有的资源完全相同,就会被判定为疑似重复内容,不同的系统会根据自身的算法特点来调整匹配阈值。
需要指出的是,图片、公式、嵌入的多媒体类非文本内容,目前大部分查重系统不能直接识别出来,不会被计入重复比对的范围之内。
2.2 查重率的基础计算逻辑
查重率又称文本重复率,计算方法为:待检测文本中,被判定为重合的总有效字符数除以待检测文本的全部总有效字符数,再乘以100%,得到的结果就是查重率。
我们可以用一个很直观的例子来演示计算过程,假设待检测的论文全文共有1000字有效文本内容,经过系统比对后,总共有150字的内容与数据库中已公开的文献重合,那么这篇文本的最终查重率就是15%,属于多数高校本科论文查重通用基准线内的合格范围。
这里的“有效字符数”是指排除格式空行、完全不能识别的乱码内容之后的纯文本字符数,并不是文档的总字数统计结果,部分用户查重时发现系统统计的总字数和自己Word文档显示的字数不一致,本质就是这个原因。
3. 常见的主流查重系统类型与差异
国内学术领域的正规查重平台主要是知网查重系统、万方检测平台、维普论文检测三大平台,三者都是官方批准的学术类文本相似性比对服务机构,但是它们的数据库覆盖、技术特点、适用场景存在着明显的不同,这也是很多新手用户查重结果出现大幅波动的主要原因。
曾经有本科毕业生一开始以为所有的平台查重结果都是一样的,先用免费工具自查结果显示重复率为10%,最后用学校指定的知网查重结果为27%,这种偏差的本质是不同的检测系统所覆盖的数据库不同造成的。
主流查重平台数据库覆盖占比示意
除此之外,市面上还有很多针对自媒体、普通文案场景的通用类轻量查重工具,这些工具的比对数据库主要是公开网页内容、普通自媒体内容,基本上不会涵盖学位论文、核心期刊等学术类资源,只适合用于非学术类内容的初步原创性检查,如果用来进行学术类文本的查重,那么结果的参考价值非常低。
新手用户在选择查重渠道的时候要注意避坑,很多没有官方资质的第三方非正规查重平台存在用户上传的文本被违规收录、转卖的风险,很容易造成之后学校官方查重时文本被判定为已存在的收录内容,从而出现异常的高重复率,一定要选择有官方正规授权的查重渠道提交检测。
4. 关于查重的常见认知误区澄清
大部分零基础用户在第一次接触查重的时候,会受到网上很多不实的泛科普内容的误导,产生很多不符合官方规则的错误认识,这些错误认识很容易造成用户最后提交终稿时出现查重不合格的情况。
首先要明确的是,所有的查重率阈值都是通用行业基准线,不同的高校、期刊会按照自己的培养要求、出版规范来调整相应的标准,没有全国统一的绝对化合格数值。通用场景下的查重合格参考标准如下表所示:
4.1 三大高频认知误区逐一勘误
误区1:查重率为0%就代表内容完全合格合规
很多新手用户认为查重率越低越好,甚至认为查重率0%是最完美的结果,这是典型的错误认知。根据教育部《学术出版规范期刊学术不端行为界定》的相关公开说明,正常的学术创作不可避免地要参考、引用前人的研究成果,完全没有重合内容的0查重率,反而不符合正常的学术创作规律,很容易被审核老师判定为文本查重结果异常,需要额外提交原创说明材料。另外部分查重系统如果用户提交的文本过短,也会出现误判的0%结果,并不表示文本真的100%原创。
误区2:随意拆分语句、替换字词就可以规避查重判定
很多用户相信网上流传的技巧,认为只要将重复的长句子拆分成短句子,把关键词全部替换成近义词,就可以逃避查重系统的判定。实际上目前主流查重系统的算法已经完成了迭代,不再是简单的字面字符匹配,而是会提取文本的语义特征、核心观点逻辑进行比对,仅仅替换字词、拆分语句,完全没有修改核心观点表述的内容,依然会被系统识别为相似内容,无法有效降低重复率,反而会破坏文本的语句通顺度,影响整体内容质量。
误区3:所有查重系统通用一个重复率合格标准
很多用户用某免费查重工具得到15%的结果后,就认为所有的平台检测都会得到同样的结果,不需要再用学校指定的系统进行复查。实际上不同的系统数据库资源、判定阈值是不一样的,甚至同一个查重系统对于不同的文本类型所使用的专属数据库也是不互通的,比如知网查重的本科PMLC系统自带“大学生论文联合比对库”资源,而知网硕博VIP5.3系统的数据库根本不包含这个库,两者检测同一篇本科论文的结果差异可能会超过20%,根本就不存在一个适用于所有系统的合格重复率标准。
5. 查重过程中的通用注意事项
零基础入门用户,在第一次接触查重全流程的时候,只需要了解基本的合规注意事项,就可以避免很多不必要的麻烦,不需要提前去接触复杂的修改操作,先建立起完整的基础认知体系即可。
5.1 提交查重前的基础格式优化要点
正规查重系统可以智能识别排版格式,提交检测前只需按照学校发布的官方格式要求,规范设置目录、参考文献的排版层级,系统就会自动将参考文献、声明、目录等非正文内容排除在重复率计算之外。如果参考文献的格式混乱、排版层次不清,系统就无法自动识别出来,从而把参考文献中的文献标题、作者信息等全部当作正文重复内容进行计算,造成最终查重率不必要的升高。
5.2 自检查重与官方查重的合理时间安排
建议用户尽量将初稿自查时间提前到终稿提交前1-2周,不要等到截止日期前1天才第一次提交查重。不同的查重系统检测高峰期一般需要数小时甚至一个工作日才能出结果,临时提交检测很容易因为排队而耽误最终的提交时间。同时尽量不要在非正规的第三方平台上提交检测,以免造成自身文本的泄露。
5.3 合规使用查重的核心原则
查重是学术原创性的检验手段,不是规避检测的手段,合规使用查重的核心思想就是先补充上自己的原创研究观点、调整内容的逻辑结构,而不是为了降低数值而替换字词、调整语序。所有的引用内容都要注明规范的出处,符合教育部发布的学术不端行为界定的要求,才是查重场景下最基本的合规原则。
常见问题
常见问题
共 4 个问题,点击展开查看答案
-
正规的查重系统会自动识别出格式规范的参考文献部分,并将其排除在重复率的计算之外,但是如果参考文献格式不符合要求,系统无法识别就会被计入重复内容,从而导致查重率升高。
-
不同的平台所拥有的比对数据库覆盖范围、文本相似性识别算法、判定重复的阈值规则等都存在着差异,而这些差异正是造成查重结果出现偏差的主要因素,并没有一个绝对统一的查重数值标准。
-
只要不使用会主动提交收录检测文本的非正规第三方平台,使用正规的、不会默认上传用户内容的查重渠道进行自检,就不会导致个人的文本被提前收录,影响后续学校官方的查重结果。
-
即使标注了引用,引用部分的字数如果超过学校或者期刊规定的引用比例上限,仍然会被判定为重复内容,引用的来源如果不在对应的查重系统比对数据库中,也不会被识别为有效的引用。