当前位置:

首页 > 硬件相关 > 一张图生成一个世界?Vidu S1体验:问题比想象的要多

一张图生成一个世界?Vidu S1体验:问题比想象的要多

ViduS1可通过上传图片生成实时交互角色,但存在画质模糊、延迟较大、动作受限等问题,自定义角色效果不佳。灵光App的世界模型能生成可探索场景,但交互有限、延迟卡顿,角色和场景记忆不稳定。当前技术尚不成熟,但代表了AI从被动展示向主动交互的演进。

我这人没什么养宠物的耐心,但却很喜欢折腾AI角色。有段时间,隔三岔五就去豆包、千问里翻别人的Bot。有人让诸葛亮来到现代,有人让霸道总裁教高数,还有人捏了个天天催自己上班的二次元老婆。好不好用先放一边,至少每次点进去,都不知道会遇上什么新品种的电子活人。

结果前阵子再打开,发现这帮Bot要集体毕业了,豆包、千问接连宣布下线相关功能。眼看聊天框里的电子朋友一个接一个消失,本来已经准备接受现实,结果转头又刷到一个更抽象的东西——Vidu S1。



(图源:Vidu)

Vidu S1是一个主打实时视频交互的模型。不同于普通的AI Bot,用户只需上传一张图片,模型就能快速理解角色的身份、外观和风格,并在交互过程中实时生成该角色的各种表情和动作,同时尽量保持形象与音色的统一。

既然大厂的Bot不让玩了,那干脆自己造一个。一个会说中文、能听懂指令,最好还能当场打坐的哈兰德,想想就挺有意思。

一张图就能生成可对话的哈兰德

Vidu S1的上手流程,其实比想象中要简单。这个模型本身完全公开,在手机应用商店搜索Vidu AI Pro下载最新版本,进入APP内点击Vidu S1即可体验。注意别下错成Vidu AI,这是两个不同的APP,容易混淆。



(图源:雷科技)

为了方便体验,Vidu S1里已经准备了一批预设角色。数量最多的是各式各样的妹子,从古装到现代,从魔幻到现实,此外还有一些动画角色、拆家狗子可供选择,多样性这一块是没啥问题。

先没急着上传图片,随便挑了一个聊了几句。选定角色后,通过麦克风直接发出语音指令,角色就会在画面中实时回应,并根据对话内容生成表情、口型,搭配上身子左右自然晃动,还真有几分在打视频通话的感觉。



(图源:雷科技)

就是这画面本身确实有点糊,看了一下最新规格,说是540P、25帧,只好当成网络不佳的效果来接受。

当然,这玩意的能力不止对口型,还可以直接用语音指挥角色做出不同动作。当发出“举起左手”的指令后,画面中的角色确实能够响应,对应的举手动作也很流畅,没有出现什么穿帮的情况。



(图源:雷科技)

稍微复杂一点的,比如推眼镜、撩头发,都算是能较好地完成。甚至提出了一个类似于“左手整理头发,右手整理衣襟,然后双手放在胸前比&心”的复合指令,角色也能勉强做到,就是没那么到位。



(图源:雷科技)

至于槽点,延迟挺大的。它的“实时”是站在AI视频角度说的,你讲完一句,角色往往还要停顿一下,再开始回答。这个速度放在视频生成里确实不赖,但放进视频通话里就很明显,尤其是角色还会一直盯着你,让人心里多少有些毛毛的。

动作也是同样的情况。为了防止穿帮,Vidu S1似乎在系统层面写死了不准转身的限制,无论怎么尝试角色都会拒绝,至于跳舞、上下蹲这类连续动作更是直接糊弄。属于是嘴上答应得很积极,身体只象征性地晃两下,有点像摆烂的样子。



(图源:雷科技)

当然,预设角色毕竟经过精心挑选,Vidu S1也支持用户上传图片创建自己的角色,接着就该试试自定义角色了。

先选了一张Q版角色,正好可以看看它在面对非常规体型时的处理效果。上传菲比啾比的图片后,填写角色描述,选择系统提供的预置音色,或者录制自己的声音,等个1分钟左右,一个自定义角色就完成了。



(图源:雷科技)

结果非常吓人,角色的动作和体型完全不匹配。当发出“跳起”的指令后,画面里的角色身体被骤然拉长,其他指令也都是类似橡胶人的效果。更别说设置的角色描述似乎完全没用,角色无论如何都会在那里自说自话。



(图源:雷科技)

最后,上传了一张挪威前锋哈兰德的图片。估计是因为训练集的缘故,真人图片比二次元要简单。静止时,Vidu S1能把五官和发型保持得不错;开始说话后,嘴型也能跟上。但表情一激动,牙齿、脸颊和眼神偶尔就会有点不协调。比较抽象的是声音,录制的声音完全没生效,而是随机在几种不同的男/女声中进行切换,画面看起来异常诡异。让角色复刻招牌打坐庆祝,他先是低头,再抬了抬手,最后还是稳稳站在镜头前。



(图源:雷科技)

看来Vidu S1只能造出一个会聊天的哈兰德,但暂时造不出那个能在球场上跑起来的哈兰德,可以改进的地方还是太多了。

AI让「一分钟创建一个世界」梦想成真

无独有偶,今年初谷歌推出了Genie,最近灵光App也升级了世界模型体验功能。这类产品的宣传点都很一致:用户只要上传一张图片,AI就会自己解析画面元素、理解什么是地面、什么是障碍物、角色该怎么动,把静态画面变成可以交互的视频应用,听起来跟小时候幻想的“随便画张图就能变成游戏”差不多。

尤其是灵光App,公开展示里又是攻击,又是射箭,又是施法的,看起来相当厉害,还没有什么会员之类的资格限制,难免让人手痒。



(图源:雷科技)

既然手痒了,那就去试试,直接从系统推荐的图片开始。选择“解锁冷冽的高科技都市”,灵光自动上传了一张高度类似于《赛博朋克2077》的场景截图,等了不到半分钟,系统就提醒专属世界已经就位了。



(图源:雷科技)

这速度,真的假的?灵光App还真就在短时间内生成了一个像模像样的赛博朋克世界。你往前走,前方路径会实时生成;你转视角,镜头也会跟着同步调整。整个过程更像是在一个持续展开的空间里进行探索。



(图源:雷科技)

生成完成后,画面下方除了基础方向键,还出现了一些个性化交互按钮。第一眼看着确实比过去丰富,仿佛模型已经理解了图片里的内容,专门设计了一套玩法。实际按下去就会发现,这些按钮更多只是让这个世界播放不同的效果。画面里即便还有其他人物,也不能靠近对话,不能攻击,甚至很难产生任何像样的接触。所谓交互,基本还是用户控制一个角色,在AI持续生成的视频里走来走去。



(图源:雷科技)

而且这个操作延迟,移动角色差不多有1-2秒延迟,切换视角更是卡到吓人。

为了测试它到底能不能看懂图片,又上传了一张《怪物猎人》的游戏截图。按理来说,画面里有人物、有怪物,还有非常明确的战斗场景,模型即便不能还原完整玩法,至少也应该根据内容生成攻击、闪避或者狩猎相关的按钮。结果它并没有。系统给出的交互方式非常通用,跟图片里的《怪物猎人》没有多少关系。更抽象的是,角色才走了没多久,原来的猎人就慢慢变成了悟空。



(图源:雷科技)

看来模型确实知道这是一张游戏截图,但至于玩的是啥游戏,它可能觉得都差不多,反正手里拿着东西打怪就行。

再来,这次上传了一张哈兰德参加足球比赛的截图。这次的问题更直接。进入场景后,原本最关键的足球很快就消失了,系统也没有让用户操控哈兰德,反而选中了对面一名穿白衣服的球员。这个角色没办法踢球,也不能跟哈兰德或者其他球员产生有效互动。画面里的球门、草地和观众更像背景贴纸,看着都在,实际上碰不到,也用不上。更麻烦的是,一旦角色开始移动,整个画面都会跟着发生变化。



(图源:雷科技)

因为原图里的元素本来就不多,模型又无法稳定记住人物和场景,角色稍微跑两步,球场、球员位置甚至衣服细节都会重新生成。上一秒还在身边的人,下一秒可能已经换了长相,连主控角色自己都像边跑边整容,队服换了又换。

真要说有什么体验好一点的,或许是POV视角的风景图片。给这玩意一张风景图片,倒是真的能够享受到在一个不存在的世界里旅行的感觉,只要你能忍受时不时出现的顿卡。



(图源:雷科技)

当个新鲜玩具,玩几分钟娱乐一下或许还行,长期的可玩性肯定是支撑不起的。

世界模型成了AI的下一个核心战场?

说到这里,可能有人会觉得,既然画质这么渣,Bug这么多,那这些厂商花这么多钱搞这个可交互的世界模型,是不是点错科技树了?从行业角度看,恰恰相反。

这类模型和应用的出现,其意义远不止做个游戏这么简单。它代表了人工智能从“理解静态世界”迈向了“模拟真实世界”的关键一步。我们现在熟悉的Seedance、可灵这些视频生成模型,虽然能做出足够唬人的大片感画面,但它们是被动展示的。观众只能看,不能互动。



(图源:字节跳动)

而这些厂商发力世界模型,核心就是想让AI理解:一个角色做了某个动作,世界就会跟着变化。让AI从被动展示到主动交互,从静态叙事到动态推演,这也是通往更强通用智能的重要路径之一。

试想一下,如果未来的灵光世界模型能进化到4K画质、60帧,并且物理逻辑完全准确,那意味着什么?直观点说,这意味着我们不需要在现实中去训练机器人了。可以让AI机器人在灵光生成的虚拟世界里,摔倒一万次,学会走路,学会拿杯子,然后再把这个算法加载到实体机器人身上。

当然了,目前盯着这个赛道的,可不止这几家厂商。OpenAI早在介绍Sora时,就曾把视频模型放进世界模型的语境里讨论;英伟达推出的Cosmos,同样把重点放在物理世界模拟上;国内不少智能驾驶、机器人和游戏公司也在布局。大家都在赌,谁能先造出那个成熟的世界雏形。

对这个新领域而言,好戏才刚刚开场。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

打印机加墨水后打印不出颜色的原因及解决方法
打印机加墨水后打印不出颜色的原因及解决方法

解决打印机加墨水后打印无色的问题,涵盖墨盒芯片计数器重置、喷头气锁排除方法以及驱动程序颜色设置检查,帮助用户快速恢复彩色打印功能。

显示器无信号但主机正常工作原因排查与解决方法
显示器无信号但主机正常工作原因排查与解决方法

面对主机运转正常但显示器无信号的困境,本文通过场景化分析,指导用户从线缆检查、输入源切换、内存金手指清洁到显卡重新插拔,逐步排除故障,恢复显示。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。