发布于2026-07-28 阅读(0)
扫一扫,手机访问
经常在互联网上被AI视频假冒的黄仁勋,这次终于出手了。
近日,英伟达正式推出Synthetic Video Detector NIM,一套号称能逐帧分析视频的检测工具。它通过识别生成模型留下的统计与频域痕迹,来判断哪些内容是AI生成的。根据官方数据,准确率最高可达92%。

(图源:英伟达)
没办法,谁让现在生成假图、做假视频的门槛越来越低。
前阵子刷到一个视频,内容挺简单:一只猫刚把花瓶碰碎,转头就溜得比谁都快,旁边的狗子当场愣住,疯狂挥爪解释,表情像是在说——不是我,真的不是我。

(图源:抖音)
挺好笑的对吧,如果不是AI视频就更好了。
更麻烦的是,以前判断假视频,还能靠一些比较明显的画面破绽,比如嘴型对不上、手指数量不对。现在视频生成模型进步速度飞快,很多生成内容已经不会留下这么明显的漏洞。也难怪家里的长辈能天天上钩。
既然普通人不知道该怎么辨别,那也是时候轮到检测工具上场了。
先简单介绍一下,英伟达在2024年3月公布了NVIDIA Inference Microservices,简称NIM。它本质上就是把“模型+推理+API接口+运行环境”打包成一个部署工具,算是一种让开发者快速获得AI服务的办法。
而这次发布的Synthetic Video Detector NIM,可以理解成英伟达在NIM标准下打包的一套AI视频检测服务。
正因为这玩意主要面向本地部署,目前想要在线使用必须通过英伟达的媒体测试申请,而本地部署又需要Linux系统和兼容NVENC/NVDEC视频编解码的硬件,普通人想用上还挺困难。

(图源:英伟达)
不过用不上,不影响我们借着目前的资料和演示好好聊一聊。
根据最新介绍,视频上传后,SVD NIM会先把H.264编码的MP4拆成画面帧,再交给DINOv2和DINOv3组成的视觉模型分析,给每一帧打分并汇总,告诉你整段视频到底有多像AI生成。
重点是,它不会盯着六根手指、人物穿模或者水杯突然消失这种传统艺能。
按照最新说法,SVD NIM识别的是生成和去噪过程中留下的底层统计特征、频率异常,以及正常相机不太容易拍出来的像素规律。即便用户将视频压缩和重新编码,也依然能保证较高的识别概率。

(图源:英伟达)
参考最新提供的案例,可以看到这个视频本身并没有出现早期AI视频特有的各种画面崩坏、前后不一的问题,但SVD NIM却给出了高达99%的综合得分。当然,这视频确实一眼假——毕竟运镜有点太平滑了。

(图源:英伟达)
可以说,英伟达这套思路确实比盯着画面里的破绽要靠谱些。
毕竟要在没有前情提要的情况下,给大伙看下面这段视频,至少八成左右的人看不出这是完全由AI生成的——现在Seedance和Kling的视频生成能力就是这么恐怖。

(图源:bilibili)
按照英伟达的说法,他们准备了超过4000个视频的内部测试集,SVD NIM检测的成功率高达85.64%,未压缩视频的准确率更是高达92%。
不过,92%的准确率不能理解成一测一个准。
尽管在宣传稿里没说,但英伟达在说明文档里还是有标注的:这么高的准确率是由偏严格的阈值采样的,在真实环境中可能造成大量误判。所以,这玩意更适合给视频做初筛,出现可疑素材的话,还是应该交给人工继续核实。
而且这个准确率还是基于H.264编码的MP4格式视频得到的,任何转码和压缩都会降低准确率。只能说老黄的免责声明还是太专业了。
目前来说,英伟达这套SVD NIM确实离普通用户还有点远。
不过国内其实也有类似定位的检测工具,直接打开就能用。其中一个是腾讯朱雀AI检测助手,另一个是反诈中心App里的“AI内容鉴定”。两款应用均支持文字/图片/视频检测,每天也有一定次数的免费检测。
为了看看AI抓AI到底靠不靠谱,准备了一组混合测试:
几张由主流模型直接生成的图片、几张手机实拍照片;一段精心挑选的AI视频,再搭配Vlog题材的真实视频。还把部分素材发过微信、截过图,准备看看它们应对二次压缩的表现怎么样。
第一轮,来点AI视频。

(图源:bilibili)
这段视频本身我觉得是很不错的。略显模糊的分辨率、微微晃动的模拟镜头和角色的动作神态融合在一起,真的很有老电影的感觉。制作者手绘了大量分镜图供模型参考,可以说完全发挥了Seedance的制作能力。
结果腾讯朱雀第一个就栽了。

(图源:)
作为对比,通过媒体申请的朋友帮忙测试了SVD NIM,结果显示高达93%的综合得分,意味着这个视频高概率是AI合成的。同时,逐帧检测的疑点也在坐标系上标注出来了。不过,检测速度确实不快,13秒的视频检测了两分钟。

(图源:)
更牛的还是反诈中心内容检测——愣是试了半个小时没能传上去,最后只能作罢。
第二轮,换上真实视频。

(图源:)
当然,不能是那种简单的真实视频。选了一个很多视频生成模型都喜欢模仿的Vlog视频,制作者用的相机不错,镜头过渡顺滑自然,街头光影也很有质感,属于一眼真假莫辨的水平。
猜怎么着?腾讯朱雀又翻车了。

(图源:)
英伟达这边相对还是要强不少,虽然也给出了34%的综合得分,但这毕竟是个参考数值,意味着模型检测到的合成内容证据不多。

(图源:)
至于反诈中心,依然没有上传成功。要是有老人家真的想用这功能,那就受罪了。
接下来换图片。这个就不详细介绍了,总之是同一个题材下的真实图片,以及两张由豆包、image 2制作的AI图片,后面两个均通过后期、压缩抹除水印。

(图源:,从左到右为豆包、image2和真实照片)
结果刚想夸朱雀这次认出AI图了,它就把真实照片也判成了AI。

(图源:)
相反,之前折腾了好几次没传上视频的内容检测,这次倒是做到三题全对。看来反诈中心在算法上还是有些优势的。

(图源:)
最后吐槽一点:这两家给的免费次数都不多,真遇到啥事还不一定够用。
这一轮测下来,对AI检测工具的信心,只能说比没有强一点。
视频这块,英伟达表现还行,腾讯朱雀完全靠不住,居然能得出相反的答案。图片相对会好一些,但腾讯朱雀依然能整出真图当假图的好活,而反诈中心内容检测的服务器则大部分时候都是爆满的,根本上传不了内容。
这机器自己都拿不准,人就更别急着拿检测截图去评论区断案了。
从测试结果来看,相比事后猜一张图有没有AI味,生成时直接留下水印和来源记录,显然更加靠谱。
如今谷歌已经在用SynthID给生成内容加隐形标记,Adobe等公司也在推动C2PA,希望把文件从生成到修改的过程记录下来。国内也在跟进,网信办已明确要求AI内容添加标识,腾讯、阿里和字节也在检测、数字签名和平台提示上积极补课。

(图源:)
问题是,目前这套体系还没有完全连起来。
去部署一个开源模型,生成的内容必然也是没有水印的;图片、视频转发几次,元数据可能就没了;至于平台之间能不能互相认出对方的水印,就目前国内各家厂商互相防范的情况来看,同样也是个问题。
在这些环节真正打通以前,普通人只能自己多长个心眼了。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9