当人眼分辨AI作品开始失效:我在线体验了合合信息 AI 跨模态鉴伪,图片、视频、文本如何被高效识别?
当人眼分辨AI作品开始失效:我在线体验了合合信息 AI 跨模态鉴伪,图片、视频、文本如何被高效识别?
过去,我们判断一张图片是不是真的,往往会放大观察人物的手指、文字边缘和光影方向;判断一段视频是否经过伪造,会留意口型、表情以及声音是否自然;判断一篇文章是不是 AI 写的,则可能依据措辞是否模板化、句式是否过于工整。
但这些经验正在迅速失效。
生成式 AI 已经不再局限于生成一张带有明显错误的图片。它可以修改支付截图中的金额,替换照片中的局部对象,生成口型自然的人物视频,也可以将机器生成的文本改写成更接近个人表达习惯的版本。更麻烦的是,这些内容往往还会经过截图、压缩、裁剪、转码和二次编辑,进一步抹去原始生成痕迹。
在这种情况下,仅凭人眼寻找“六根手指”或者语句中的“AI 味”,很难继续承担内容真实性判断的任务。
2026年世界人工智能大会期间,合合信息升级了 AI 跨模态鉴伪技术,将鉴别范围从此前的图像和人脸视频,拓展至图片、视频、文本等主要信息介质,并面向社交聊天、图文资讯、电商交易、短视频分享和学术研究等场景提供鉴别能力。
这次我将从一个线上技术体验者的角度,重点关注三个问题:
- 所谓“跨模态鉴伪”,是不是把不同内容统一交给一个模型判断?
- 图片、视频和文本分别可以留下哪些机器可识别的证据?
- 鉴伪系统真正适合承担什么角色,能不能把结果直接理解成最终结论?
文章目录
- 当人眼分辨AI作品开始失效:我在线体验了合合信息 AI 跨模态鉴伪,图片、视频、文本如何被高效识别?
- 一、先说体验感受:有价值的不只是“真”或“假”
- 二、“跨模态”并不意味着所有内容都走同一条检测路径
- 三、图片鉴伪:既要看画面表达,也要看像素背后的生成痕迹
- 1. 高层语义特征
- 2. 底层视觉特征
- 3. 实测**扫描全能王AI鉴伪小程序**图片鉴伪能力
- 四、视频鉴伪:单帧看不出的问题,可能会在时间轴上暴露
- 五、文本鉴伪:统计“AI味”已经不够,需要进入语义和逻辑层
- 六、线上“AI较真大赛”最有意思的地方:它暴露了人类判断的不稳定
- 七、真正的产品价值,不是代替人下结论,而是承担规模化初筛
- 八、也要理性看待:鉴伪不是一劳永逸的“终局技术”
- 结语:从“我觉得是真的”,转向可验证的内容可信机制
一、先说体验感受:有价值的不只是“真”或“假”
合合信息提供的线上扫描全能王AI鉴伪小程序支持上传多种类型的素材,包括 AI 生成图片、真实照片、经过编辑或合成的图片,以及视频和文本。检测完成后,页面会展示鉴别结论及相应的置信度。按照投放材料中的要求,这次体验的重点也并非单独测试某一种图片,而是观察系统是否具备跨图片、视频和文本的检测能力。
这里有一个容易被忽略的细节:相比简单地显示“真”或“假”,置信度实际上更重要。
现实中的内容鉴伪很少是边界清晰的二分类问题。一张图片可能是相机拍摄的,但其中一小块区域被 AI 修改;一段视频可能主体真实,但背景、口型或音轨经过生成式编辑;一篇文本可能由人类写出初稿,再经过大模型润色。
因此,“这份内容是不是完全由 AI 生成”与“这份内容中是否存在生成或篡改痕迹”,本身就是两个不同的问题。
从实际使用角度看,置信度可以被理解为一种风险信号:
- 低风险内容可以继续进入正常业务流程;
- 中等风险内容可以结合来源、元数据和上下文进一步检查;
- 高风险内容则可以进入人工审核或专业取证流程。
这比把检测器当成一台只会输出“真”“假”的机器更合理。
本文我将通过实际测试来帮助我们观察:系统究竟是在记忆某个模型的固定“指纹”,还是能够从更广泛的语义、频谱、噪声、时序和结构特征中发现异常。
二、“跨模态”并不意味着所有内容都走同一条检测路径
“跨模态鉴伪”很容易让人联想到一个巨大的统一模型:无论用户提交图片、视频还是文字,都直接送入同一个神经网络。
但从合合信息公开的技术介绍来看,更准确的理解是:系统围绕图片、视频和文本建立了差异化的检测路径,再通过统一的产品入口和可信鉴别体系向用户提供服务。
这是一个重要区别。
因为不同信息介质中的伪造证据并不相同:
| 内容类型 | 可能存在的鉴伪线索 |
|---|---|
| 图片 | 频谱伪影、噪声异常、纹理不连续、语义矛盾、局部编辑痕迹 |
| 视频 | 帧间抖动、运动轨迹异常、时序不一致、时空频域伪影 |
| 文本 | 语义连贯模式、句法微小畸变、高概率表达、逻辑结构异常 |
如果强行使用完全相同的特征空间处理三种介质,反而可能损失各自最关键的取证信息。
因此,这套技术的核心价值不只是“支持三种文件格式”,而是在同一真实性判断框架下,对不同介质分别寻找更适合的证据。
三、图片鉴伪:既要看画面表达,也要看像素背后的生成痕迹
图片通常是普通用户最先接触到的 AI 鉴伪场景。
早期 AI 图片的破绽比较明显,例如手指数量错误、文字无法辨认、物体结构违反常识。但随着扩散模型和图像编辑模型持续升级,仅依靠语义错误已经不够。
现在一张看起来完全合理的图片,仍然可能在频域、噪声和局部纹理中留下生成痕迹。
合合信息公开材料中提到,其图像鉴伪会综合分析图像语义信息、频谱伪影和噪声分布异常,用于判断图片是否由 AI 模型生成或经过篡改;覆盖的类型不仅包括 AI 生成,还包括 AI 编辑和人工伪造。
可以把这些检测维度粗略分成两层。
1. 高层语义特征
高层语义关注的是“画面表达了什么,以及这些内容是否合理”。
例如:
人物、物体与背景之间是否符合常识;
阴影方向和光源位置是否一致;
镜面、玻璃和水面反射是否符合物理规律;
局部替换区域与周围内容是否存在语义冲突;
文字、标识和重复纹理是否出现异常。
但高层语义检测也有局限。生成模型正在变得越来越擅长遵循物理和语义约束。仅靠寻找明显的内容错误,很容易漏掉高质量生成图片。
2. 底层视觉特征
底层特征不主要关心图片画了什么,而是研究这张图片“如何形成”。
真实相机拍摄通常会经历镜头成像、传感器采样、图像信号处理、压缩编码等过程。AI 生成图片则来自神经网络的逐步生成或重建。两种形成机制不同,可能造成不同的频率分布、噪声模式和局部统计规律。
例如,在肉眼看起来十分平滑的区域,模型可能检测到异常的高频分量;在看似自然的纹理中,可能出现与真实传感器噪声不一致的分布;局部 AI 编辑也可能破坏原图连续的成像特征。
公开研究同样表明,面对越来越高保真的 AI 图片,仅使用单一线索并不可靠。AIDE相关研究通过结合高层语义特征与低层噪声、频率特征,提高对复杂生成图片的识别能力,同时也指出,AI生成图片检测远未被彻底解决。
需要强调的是,AIDE只是投放材料提供的学术参考案例,并不等同于合合信息的具体模型架构。它能够帮助我们理解一个行业趋势:图片鉴伪正在从寻找单一伪影,转向对语义、频谱、噪声和局部结构进行综合判断。
3. 实测扫描全能王AI鉴伪小程序图片鉴伪能力
针对以上的各种技术问题,我准备了18组测试图片,最终测试结果如下:
经过18轮实测,在不同场景下,扫描全能王AI鉴伪小程序都能够精准分辨出我上传的图片的AI占比以及真实程度。
四、视频鉴伪:单帧看不出的问题,可能会在时间轴上暴露
如果把视频拆成一张张静态图片,很多 AI 视频的单帧质量已经非常高。但视频比图片多了一个关键维度:时间。
一个物体在连续帧中的运动,需要保持位置、速度、形状、光照和遮挡关系的一致性。生成模型即使能够做好单帧,也可能在连续生成过程中产生细微的不稳定。
根据合合信息的技术介绍,其视频鉴伪会结合视频时序、运动规律、时空频域和传感器噪声等检测维度,并关注帧间物体抖动、运动轨迹异常以及时空网格伪影等线索。
这类异常未必会表现成明显的“画面崩坏”。
例如:
人脸轮廓在连续帧中发生轻微跳动;
嘴唇动作与面部肌肉变化不同步;
背景物体在镜头运动过程中产生不自然的形变;
饰品、头发和衣物纹理在相邻帧间突然改变;
物体运动轨迹缺少真实世界中的连续性;
视频经过生成或重建后,留下周期性的时空伪影。
人眼观看视频时更关注故事内容和人物动作,很难逐帧比较这些细节。算法则可以把连续帧转化为时序信号,对运动和频率分布进行系统分析。
这也是视频鉴伪不能简单等同于“对每一帧执行一次图片鉴伪”的原因。单帧检测只能提供空间证据,而视频还需要利用时间轴上的一致性证据。
视频场景实测结果如下图所示:
我这里准备了五组不同场景的视频,经过扫描全能王AI鉴伪小程序鉴别之后,我们可以看到结果如图所示,精准的分辨出了真实视频和AI内容,大家如果有好的视频,也可以直接前往小程序测试体验~,另外在“AI较真大赛”中也可以更直观的体验AI视频鉴伪的价值,如下图所示为真假视频辨别关卡:
五、文本鉴伪:统计“AI味”已经不够,需要进入语义和逻辑层
相比图片和视频,文本鉴伪更加容易引发争议。
这是因为文字本身不存在传感器噪声,也没有稳定的像素频谱。人类和 AI 还可以使用相同的词汇、语法和写作模板。一篇由人类撰写的公文可能非常规范,一篇经过精心提示和人工改写的 AI 文本则可能十分自然。
传统文本检测往往依赖词频、句长、标点使用习惯或者困惑度等统计特征,但这些特征容易受到同义词替换、句式重写和提示词设计的影响。
合合信息公开介绍称,其生成式 AI 文本鉴定会从表层统计进一步进入语义层,分析模型生成过程中容易出现的高概率表达形式,并关注 AI 文本与人类写作在深层语义连贯性、句法结构微小畸变以及高维逻辑表征上的差异。
这里可以用一个简单例子理解。
一段文本的每一句话单独看都可能正确,但把整段内容放在一起,可能出现以下情况:
不同段落重复表达同一个结论;
论点之间缺少真实的因果推进;
内容看似完整,却回避具体事实或限定条件;
句法结构过于稳定,缺少自然写作中的变化;
局部措辞自然,但全文逻辑表征呈现异常一致性;
大量使用高概率、安全但信息密度较低的表达。
这些特征不一定能被读者明确指出,却可能在模型的高维表示空间中形成可检测的模式。
不过,文本检测结果尤其需要谨慎使用。检测器不应仅凭某种“写作风格”否定内容,更不能把一次模型判断直接作为学术不端、职业处罚或法律责任的依据。
更合理的使用方式,是将文本鉴伪作为风险筛选工具,并结合版本记录、引用来源、写作过程、事实准确性和人工复核作出综合判断。
文本部分我也做了一些实测,结果如下图所示:
通过不同纬度的文案测试,文本鉴伪部分对AI味道的文案能够有效的区分,大家有想测的文案,欢迎评论区交流讨论,也可以直接前往小程序体验~
六、线上“AI较真大赛”最有意思的地方:它暴露了人类判断的不稳定
除了上传素材进行检测,合合信息还在线下的WAIC展位设计了“AI较真大赛”互动挑战,内容包括转账截图、社交媒体人像照片、萌宠视频和论文文本等。参与者需要先依靠自己的观察作出判断,再与 AI 检测结果进行对比。
从技术角度看,这种形式比直接罗列准确率更容易让普通用户理解鉴伪的必要性。
当我们看到一张转账截图时,通常会关注姓名、金额和时间是否合理,却不一定检查字体边缘、背景纹理和局部压缩特征;看到一段人物视频时,会被说话内容吸引,很少逐帧分析嘴部、眼睛和背景的运动一致性。
人类的判断还会受到先入为主的影响。
当题目提示“其中可能有一张是真的”,用我们可以主动寻找异常;但在真实社交平台中,人们往往默认收到的内容是真的。相同素材放在不同上下文中,判断结果可能完全不同。
所以,“人眼与 AI 对比”的意义并不是证明机器永远比人更正确,而是说明:面对规模化、跨介质和高仿真的生成内容,真实性判断已经无法只依赖个人经验。
七、真正的产品价值,不是代替人下结论,而是承担规模化初筛
对开发者和企业技术决策者来说,评估一套鉴伪技术时,不应该只问“它能不能判断一张图”。
更关键的问题是:
能否处理不同生成模型和不同伪造方式;
能否覆盖图片、视频和文本等多种业务输入;
能否承受截图、压缩和二次编辑带来的分布变化;
能否提供置信度或其他可供业务系统使用的风险信号;
能否接入审核、风控和内容治理流程;
能否在实际业务量下稳定运行。
合合信息披露,其 AIGC 鉴伪技术已经应用于金融、保险和电商等场景,仅图文鉴伪技术即可完成日均数十万条内容的全量核验,并逐步替代传统的人工抽样审核方式。
这里体现的是自动化鉴伪与人工审核之间的根本差异。
人工审核适合处理复杂、模糊和需要上下文判断的案例,但很难对海量内容逐条检查。算法系统则适合完成高并发初筛、风险排序和异常发现,再把少量高风险内容交给人工复核。
这种组合可以应用在很多具体场景中:
金融与支付
检查转账截图、收入证明、电子凭证或业务材料是否存在局部篡改,并将高风险材料转入人工审核。
保险理赔
识别事故图片、票据、视频和说明文本中的生成或编辑痕迹,辅助发现重复理赔、伪造材料和内容不一致问题。
电商平台
检测商品图片、评价截图、聊天记录和售后材料中的异常,辅助处理虚假宣传与交易纠纷。
内容平台
对图文资讯、短视频和用户投稿进行自动化风险筛选,减少虚假内容在传播链路中的扩散。
学术与教育
将 AI 文本检测作为辅助信号,同时结合引用、实验数据、写作记录和人工审查判断内容的真实性与原创性。
八、也要理性看待:鉴伪不是一劳永逸的“终局技术”
生成技术和鉴伪技术之间,本质上是一场持续演化的攻防。
新的生成模型不断减少旧有伪影,内容还可能经过压缩、滤镜、截图、转码和人工修改。检测系统如果过度依赖某个模型或某种固定特征,面对未见过的生成器时,就可能出现性能下降。
学术研究已经反复说明,真实网络环境中的高质量生成内容,往往比标准测试集中的样本更加难以识别。AIDE在研究中评估多个现有检测器时发现,它们在更贴近真实环境的高保真 AI 图片上可能出现明显的泛化问题。
此外,检测结果的可解释性同样重要。
如果系统只输出一个概率,却无法说明风险来自哪里,审核人员就很难继续验证。FakeShield等公开研究已经开始探索同时进行图片真假判断、篡改区域定位和人类可理解解释,这也说明鉴伪技术正在从单一分类逐步走向“判断—定位—解释”的完整链路。
这类研究同样只是行业技术方向的参考,不能直接用于推断合合信息采用了相同的模型结构。
对普通用户而言,最稳妥的原则仍然是:
检测结果可以提高警惕,但不应脱离来源、上下文和其他证据,被直接视为最终裁决。
结语:从“我觉得是真的”,转向可验证的内容可信机制
生成式 AI 带来的问题,并不是网络上突然多了一批“假图片”。
真正的变化在于,图片、视频和文本都可以被低成本地生成、修改和批量传播,而普通用户很难判断内容经过了什么处理。
在这个背景下,合合信息将 AI 鉴伪能力从图像和人脸视频进一步扩展到图片、视频、文本等主要信息介质,其意义并不只是多支持了几种文件格式,而是试图建立一套覆盖不同内容载体的可信鉴别体系。相关技术展示面向开发者及技术决策者,重点呈现扫描全能王在 AI 鉴伪方面的能力深度。
从线上体验和公开技术信息来看,我认为这类工具最现实的定位有两种:
对普通用户,它是一种低门槛的真实性检查入口,帮助我们在转发、付款或采信内容之前多做一次验证。
对企业和平台,它更适合作为自动化风险筛选基础设施,对海量图片、视频和文本进行初步核验,再与人工审核、来源验证和业务风控机制配合。
当生成内容越来越接近真实,“看起来没有问题”已经不能等同于“内容可信”。
开发者也需要开始考虑:未来的 AI 应用不仅要能够生成和理解内容,还应当具备判断输入是否真实、来源是否可靠、内容是否经过修改的能力。
想测试自己能否分辨 AI 生成和篡改内容,可以进入合合信息扫描全能王AI鉴伪小程序,分别准备真实素材、AI 生成素材和二次编辑素材进行对照测试。相比只测一张图,更建议同时测试图片、视频和文本,并重点观察不同处理方式是否会影响检测结论及置信度。
