1. 什么是知网AIGC检测?
知网AIGC检测是中国知网于2023年正式推出的一项技术服务,主要用来识别学术论文中由AI生成的内容。它的主要价值就是用局部一致性(logit)、重复模式检测和语义分布偏离度这三个算法来准确地区分出人类写作和ChatGPT、文心一言、通义千问等AI工具生成的文本,从而给高校、科研机构以及研究生在学术诚信审查时提供更加准确的判断依据。
一位硕士生的实测数据可以很好地说明它的效果,他在提交初稿之前使用知网AIGC检测,结果显示AI率为70%。经过人工修改核心段落、改变句式结构之后,二稿的查重率降到了12%,顺利通过了学院的初审。这就证明了知网AIGC检测的灵敏度,它并不是简单的“一刀切”,而是可以真实的反映出论文中AI痕迹所占的比例。
知网AIGC检测与Turnitin AI检测相比,具有以下优点:
知网AIGC检测的定位是辅助学术审查工具,不是取代传统的查重。它解决的是“AI代写”这种新的学术不端问题,传统的查重检测的是“复制粘贴”。两者互相补充,一起保持学术的原创性。
2. 知网AIGC检测的检测原理
知网AIGC检测的底层原理是利用深度学习模型,对文本的统计特征、语义特征、结构特征进行分析,从而找出AI生成内容特有的模式。
知网AIGC检测的检测原理
检测过程分为三个主要步骤,即:
第一步:文本预处理
- 分词:把连续的文本分成最小的语义单位(中文词或者英文单词)
- 去噪:去掉标点符号、空格、特殊字符等非语义信息
- 标准化:统一大小写、简繁体转换、数字格式规范化
第二步:特征提取
- 统计特征:分析词汇分布频率、句长分布、段落长度等。人类写作一般存在自然的波动性,但是AI生成的文本却表现出非常均匀的分布(每句话的长度几乎一样)。
- 语义特征:评价逻辑连贯性。人类写作常常会出现语义跳跃、隐喻、情感表达,但是AI却会保持逻辑上的平滑,并且不会使用有争议的表述。
- 结构特征:检测段落模式。AI写作会反复使用某些句式结构(首先……其次……最后),而这些结构在人类写作中很少出现。
第三步:模型判别
采用Transformer架构的深度分类器,用提取出的特征同大量的AI生成文本语料库做对比,得到一个概率值(0到100%)。该概率值就是AIGC指数,指数越高,说明AI生成内容的可能性就越大。
算法细节:局部一致性(logit)分析的是文本中相邻词之间的关联强度。人类写作时词汇选择一般会有更多的语义跳跃,而AI生成文本里词与词之间局部关系更平滑、更一致。知网AIGC检测用每个位置的logit值和预期分布的偏离程度来判断该位置是否为AI生成。
3. 知网AIGC检测的覆盖范围
知网AIGC检测的覆盖范围
知网AIGC检测覆盖的AI工具和文体范围很广,有:
支持的文体类型:
- 学术论文(期刊、学位、会议)
- 综述类文章
- 研究报告
- 实验记录
- 本科/硕士/博士毕业论文
不支持的类型:
- 未公开发表的预印本
- 专利文档
- 书籍整本
- 非学术类文本(小说、新闻)
与语言模型版本的关系:较新版本的AI模型(GPT-4o、Claude 3.5)生成的文本,在语义分布上更接近人类,检测识别率会低一些。但是知网AIGC检测算法不断更新,对于新的一代模型的识别能力也在不断提高。
对混合文本(人工+AI)的检测能力:这是最具挑战的场景。学生用AI生成框架,再人工填充数据和分析结果,检测系统不能100%准确地将两者区分开来。因此知网官方明确表示,检测结果仅供参考,不能作为唯一的判定标准。
4. 知网AIGC检测结果解读
知网AIGC检测结果解读
知网AIGC检测报告一般包含以下内容:
1. 总体AIGC指数(0-100%)
- 0-20%:低风险,论文以人工写作为主
- 20-50%:中风险,可能存在部分AI辅助写作
- 50%以上:高风险,高度疑似AI生成内容占主导
2. 疑似AI生成段落标注
报告会用高亮或者特殊标记标出检测系统认为是AI生成的段落。用户需要对这些段落进行人工检查并修改。
3. 风险等级标签
- 绿色:低风险
- 黄色:中风险
- 红色:高风险
重要提示检测结果只作为学术诚信的参考,不能作为唯一的判定标准。以下情况可能会造成误判:
- 参考文献格式:标准化的引用格式(作者,年份,标题,期刊)容易被误认为是AI痕迹
- 图表说明:规范化的图注、表注等固定表述
- 专业术语密集段落:高度标准化的学术表述
所以,在收到检测报告之后,要依靠人工审核来加以二次确认。
5. 知网AIGC检测对学术写作的影响
知网AIGC检测对学术写作的影响
正面影响:
- 促进学术规范,引导学生合理使用AI辅助工具(文献检索、语法检查等)
- 推动学术写作回归原创性,减少AI代写现象
- 帮助研究者明确AI辅助和AI代写的界限
负面影响:
- 可能会对合理使用AI辅助的情况做出误判(例如用AI进行语法润色)
- 给学生造成心理压力,害怕正常的AI使用被当作学术不端
- 有些学生因为过于担心而完全拒绝使用AI工具,从而失去提高效率的机会
应对建议:
1. 明确标注AI辅助范围:在论文致谢或者方法论部分说明AI工具的使用范围,例如“本文使用AI辅助进行文献检索和语法检查”
2. 保留写作过程记录:保存初稿、修改记录、实验数据等,以备申诉
3. 平衡AI使用与人工写作:AI可以用来生成框架、整理数据,但是核心分析、创新点、讨论部分必须由人来完成
实测改写策略:
根据多位研究生的经验,以下方法可以将AI率从45%降到5%以下:
- 替换AI常用的连接词,把“首先”、“然后”、“综上所述”等词替换成更自然的过渡词
- 增加个人案例分析,在文中加入自己的实验数据、调研结果或者行业案例
- 改变句式的长度和结构,避免出现AI典型的“主语+谓语+宾语”的固定结构
- 加入情感色彩,人类的写作一般会带有情感判断、批判性的思考,而AI则是中性的
6. 常见误区与注意事项
知网AIGC检测与传统查重对比表
常见误区:
误区一:AIGC检测等于查重
事实:两者原理和目标完全不同。AIGC检测识别的是“AI写作痕迹”,查重识别的是“复制粘贴”。一篇完全原创但由AI生成的论文,AIGC指数可能很高,但重复率可能为0%。
误区二:所有AI生成内容都能100%识别
事实:识别率受AI工具类型、生成策略、改写程度等多因素影响。经过深度改写、混合人工写作的文本,识别率会下降。
误区三:检测结果等同于学术不端判定
事实:知网官方明确表示,检测结果仅供参考,最终的判定要依靠导师评审和学术委员会的审核。
注意事项:
1. 提交前自检:建议在论文定稿前,使用知网AIGC检测自检,保证AI率低于学校标准
2. 保留证据:保存所有初稿、修改记录、数据来源,以备申诉
3. 关注学校政策:不同高校对于AI使用的规定不同,需要提前了解
4. 合理使用AI:AI辅助不等于AI代写,区分二者是学术诚信的重要标准
常见问题
常见问题
共 6 个问题,点击展开查看答案
-
暂无答案
-
知网AIGC检测主要针对常见的AI写作工具(ChatGPT、文心一言、通义千问等)生成的文本进行识别,涵盖了论文、报告、综述等学术文体。较新版本的模型(GPT-4o)生成的文本识别率会低一些,但是算法会不断更新。
-
知网AIGC检测算法是基于大量的AI生成文本语料进行训练的,并且结合了学术文本的特点,对于完全由AI生成的内容识别率较高(实测可以达到90%以上),但是对经过深度改写、混合人工写作的内容,准确率会降低(约60-80%)。因此检测结果要依靠人工审核。
-
检测结果一般用百分比的形式来表示,即疑似AI生成内容所占的比例(0-100%),并给出高、中、低三个风险等级。同时也会对疑似AI生成的段落进行标注,供用户参考。报告中还会包含总体说明和建议。
-
知网AIGC检测结果有时间限制。由于AI模型、检测算法都在不断更新之中,所以建议在论文定稿前1-2周进行检测,这样可以得到最准确的结果。检测报告一般会长期保存,但是学校会要求提供最新的检测结果。
-
越来越多的高校把AIGC检测加入到学位论文审核的过程当中。有些学校要求在论文答辩之前必须经过AIGC检测,并且设定了阈值(AI率小于30%)。提前向导师或者学院询问具体的要求。
行动建议:在提交论文定稿之前,用知网AIGC检测对论文进行自检,保证AI率小于学校的标准(一般要求控制在20%以下)。如果检测结果偏高,首先对高亮标注的疑似AI段落进行人工改写,重点替换AI常用的连接词,增加个人案例分析,改变句式结构。保留全部修改记录以及数据来源,以便日后申诉或者审核。合理使用AI辅助工具,注明使用范围,可以提高效率,也可以保证学术原创性。