为监督AI技术使用◈◈ღ,如今市面上不乏各类用于检测AI生成内容(AIGC)的工具◈◈ღ,如普林斯顿大学学生开发的GPTZero◈◈ღ、斯坦福大学研究团队推出的DetectGPT等◈◈ღ。我国一些研究团队也陆续发布各类检测工具◈◈ღ,如西湖大学文本智能实验室研发的Fast-DetectGPT◈◈ღ。
人类的创作与AIGC之间存在哪些差异?AI检测工具如何根据差异进行识别?AI检测工具如何应对越来越聪明的大模型?带着这些问题◈◈ღ,记者采访了有关专家◈◈ღ。
“虽然大模型在不断发展迭代◈◈ღ,但到目前为止◈◈ღ,AIGC与人类的创作在用词用语口述20个乱真实案例◈◈ღ、逻辑语法等方面依旧存在明显区别◈◈ღ。”Fast-DetectGPT研发者之一◈◈ღ、西湖大学文本智能实验室博士生鲍光胜说◈◈ღ。
在用词用语上◈◈ღ,AIGC有相对固定的偏好◈◈ღ。“不难发现◈◈ღ,一些词语会反复在语段中出现◈◈ღ。”鲍光胜举例说◈◈ღ,有研究发现◈◈ღ,大模型应用于英语学术论文写作时◈◈ღ,“delve”(深入研究)一词的使用频率大大提高◈◈ღ,这是因为大模型习惯用这个词对语句进行润色修改◈◈ღ。
在逻辑语法上◈◈ღ,AIGC惯常使用的一些语法搭配方式◈◈ღ,在人类创作中可能并不常见◈◈ღ。“受模型建模的影响◈◈ღ,AIGC有相对固定的行文逻辑和表述模式◈◈ღ,且这些模式会不断地被重复◈◈ღ。人类在行文上则更为灵活◈◈ღ,没有固定套路◈◈ღ。”鲍光胜说◈◈ღ。
北京大学信息管理系师生比较了AI生成与学者撰写的中文论文摘要◈◈ღ。研究结果同样显示◈◈ღ,AI生成的摘要具有较高同质性和较强写作逻辑性◈◈ღ,并惯用归纳总结等学术话语体系◈◈ღ;学者撰写的摘要则具有显著个性化差异◈◈ღ,使用凸显实际含义的搭配较多◈◈ღ,并常用与国家政策密切相关的词语Jdb电子游戏试玩◈◈ღ。
哈尔滨工业大学一名研究生向记者讲述了他使用大模型的实际感受◈◈ღ:“当我给大模型提供一些材料让它扩写◈◈ღ,它每次都用相同的套路——把给定的材料拆解开◈◈ღ,分为若干点论述◈◈ღ。总体来说感觉它写得比较‘僵’◈◈ღ。”
AIGC相对套路化的创作◈◈ღ,可能会影响人类的用语习惯口述20个乱真实案例◈◈ღ。“随着越来越多人用AI创作或润色文字◈◈ღ,人类会受到潜移默化的影响◈◈ღ,这或将影响整个社会对语言的使用◈◈ღ。”鲍光胜说◈◈ღ。
如何准确识别AI生成内容?鲍光胜介绍Jdb电子游戏试玩◈◈ღ,目前主要有三种技术路径进行检测◈◈ღ,分别是模型训练分类器法(也被称为监督分类器法)Jdb电子游戏试玩◈◈ღ、零样本分类器法◈◈ღ、文本水印法◈◈ღ。“三种检测方法本质上都是利用AI检测AI口述20个乱真实案例◈◈ღ,且各有优劣◈◈ღ。”鲍光胜说◈◈ღ。
模型训练分类器法◈◈ღ,首先要收集大量人类创作内容与AIGC口述20个乱真实案例◈◈ღ,然后以此为基础训练一个能区分两类内容的分类器◈◈ღ。“这是目前被广泛使用的一种方法◈◈ღ,但缺点较为明显◈◈ღ。”鲍光胜解释◈◈ღ,用于训练分类器的数据有限◈◈ღ,很难覆盖所有类型和语言的文本口述20个乱真实案例◈◈ღ。分类器在训练数据覆盖的文本领域或语言上检测准确率较高◈◈ღ,反之准确率则较低◈◈ღ。而且口述20个乱真实案例◈◈ღ,模型训练往往需要较高成本◈◈ღ,数据规模越大◈◈ღ,训练成本越高◈◈ღ。
相比之下◈◈ღ,零样本分类器法不需要对机器进行训练◈◈ღ,也无需收集数据Jdb电子游戏试玩◈◈ღ。它利用已训练好的大模型◈◈ღ,抽取语言模型生成文本的特征◈◈ღ,据此来区别人类与机器◈◈ღ。“似然函数是零样本检测法中比较常用的基准之一Jdb电子游戏试玩◈◈ღ,它可以简单理解为一段文本在某个模型的建模分布中出现的概率◈◈ღ。概率是一种特征◈◈ღ,不同的概率体现了人类创作内容与AIGC的差异◈◈ღ。”鲍光胜进一步解释◈◈ღ,“零样本分类通过综合考虑多种函数特征来区分人类创作内容与AIGC◈◈ღ。”
如今◈◈ღ,很多大语言模型几乎覆盖了互联网上的全部数据◈◈ღ。因此Jdb电子游戏试玩◈◈ღ,相比于模型训练分类器◈◈ღ,零样本分类器在不同领域◈◈ღ、不同语言的文本上表现较为一致◈◈ღ。
不过口述20个乱真实案例◈◈ღ,零样本分类器也存在明显缺点◈◈ღ。一方面◈◈ღ,现有零样本分类器依赖生成文本的源语言模型进行检测◈◈ღ,这意味着如果是未知源模型生成的文本◈◈ღ,分类器就无法准确检测◈◈ღ。另一方面◈◈ღ,为提高检测准确率◈◈ღ,零样本分类器往往需要多次调用模型◈◈ღ,这增加了模型的使用成本和计算时间◈◈ღ。
“文本水印法则是一类‘主动方法’◈◈ღ。区别于前两类方法◈◈ღ,它不是检测已生成的文本◈◈ღ,而是在AI生成文本时加入水印◈◈ღ。人类虽然看不出这些水印◈◈ღ,但却能通过技术手段检测出来◈◈ღ。”鲍光胜说◈◈ღ,文本水印法的准确率较高◈◈ღ,但缺点在于水印可能被人为弱化甚至移除◈◈ღ。此外◈◈ღ,对于无法访问模型内部结构的大语言模型口述20个乱真实案例◈◈ღ,技术人员可能无法在生成内容时成功加入水印◈◈ღ。
“未来◈◈ღ,我们要不断更新◈◈ღ、完善现有技术◈◈ღ,力争实现快速◈◈ღ、准确◈◈ღ、低成本检测◈◈ღ,在大模型这把‘矛’越来越锋利的同时◈◈ღ,让检测技术这面‘盾’更为坚固◈◈ღ。”鲍光胜说◈◈ღ。
记者了解到◈◈ღ,为提升检测准确性◈◈ღ,目前市面上的商用AI检测软件大多融合了多种技术手段◈◈ღ。国内外研究团队也在进一步完善相关技术◈◈ღ。
例如◈◈ღ,西湖大学文本智能实验室团队在DetectGPT基础上研发的Fast-DetectGPT模型◈◈ღ,可提升AI检测准确性◈◈ღ,缩短检测时间◈◈ღ。“Fast-DetectGPT与其他零样本分类器原理一致◈◈ღ。其中一个创新点在于◈◈ღ,我们提出通过条件概率曲率指标进行检测◈◈ღ。”鲍光胜说◈◈ღ,“与DetectGPT相比◈◈ღ,Fast-DetectGPT在速度上提升340倍◈◈ღ,在检测准确率上相对提升约75%◈◈ღ。”
对AI检测AI的前景◈◈ღ,有两种截然不同的观点◈◈ღ。一种观点认为◈◈ღ,未来AIGC将会与人类创作极为相似◈◈ღ,以至于检测工具无法判别◈◈ღ。还有一种观点认为◈◈ღ,随着技术发展◈◈ღ,检测技术或将赶超大模型技术◈◈ღ,实现对AIGC的有效识别◈◈ღ。
“目前◈◈ღ,无论是AI生成的文字◈◈ღ、图片还是视频◈◈ღ,都在技术可识别的范畴之内◈◈ღ。相较于文字◈◈ღ,图片和视频甚至可以直接被专业人士肉眼识别◈◈ღ。期待未来通过大模型技术的不断进步◈◈ღ,推动检测技术发展◈◈ღ。”鲍光胜说◈◈ღ。(来源◈◈ღ:科技日报)jdb平台app◈◈ღ,jdb电子官网入口App◈◈ღ,JDBAPP下载◈◈ღ,jdbAPP官网◈◈ღ!jdb电子试玩平台◈◈ღ,
微信公众号
JDB电子视频号
全国统一热线:400-696-6916
广东公司:广东省佛山市顺德区伦教宝汇路JDB电子智造数智产业园
13077439821 屈老师
浙江公司:浙江省宁波市江北区JDB电子·「中国」官方网站
13077439821 屈老师
江苏公司:江苏省无锡市梁溪区
13077439821 屈老师
安徽公司:合肥市高新区中安创谷
13077439821 屈老师
全国统一服务热线