当前位置:

首页 > 硬件相关 > 世界模型的门槛,谷歌可能迈过去了

世界模型的门槛,谷歌可能迈过去了

谷歌未发布的GeminiOmni模型生成的两段视频引发关注。一段视频中教授讲解数学证明时手部动作自然、板书与语音精准同步;另一段则逼真呈现人物与物体的物理交互。这表明模型可能实现了跨模态深度协调,对现实世界约束有了整体理解。若其真正统一多模态能力并与谷歌生态整合,或将重塑视。

Google可能要放大招了。

就在Google I/O 2026开幕前夕,两条由尚未发布的新视频模型Gemini Omni生成的视频悄悄流出。没有预告,没有造势,整个社交媒体瞬间被引爆。

一条视频里,一位教授站在黑板前,手持粉笔,一步步推导着三角恒等式;另一条,则是两名男士坐在海边的高档餐厅里,安静地享用意大利面。

Reddit和X的评论区,几乎被同一句话刷屏:“这不可能是现有的技术水平。”

两个看似普通的日常场景,凭什么能让见惯了AI大场面的技术圈集体侧目?

令人震惊的视频

先看那条“教授黑板讲课”的视频。生成它,只用了一条简单的指令:

“一位教授在传统黑板上写出三角恒等式的数学证明,同时用语言解释他当前正在推导的步骤。”

就这么一句话,没有多轮对话,也没有分步骤控制。

结果呢?教授手持粉笔,逐步写下公式,同时开口讲解,画面流畅,板书工整。

听起来似乎平平无奇?

但如果你了解当前视频生成模型的技术边界在哪里,就会明白Gemini Omni同时做到了三件事——而这三件事,在过去从未被同一个模型完美实现。

第一,推理对了。

黑板上的证明过程,在数学上是成立的。这不是视觉上长得像公式的符号堆砌,而是数学意义上真实有效的推导。要做到这一点,模型必须在基础的token预测之外,具备一定的符号推理能力。它得“知道”下一步应该出现什么公式,而不是随机采样一个看起来像数学的图案。这种语义准确性叠加在视觉生成之上,正是大多数视频模型会在这类测试中翻车的原因。

第二,空间关系对了。

评测者描述,粉笔书写时的手部和手臂动作“读起来是自然的”,黑板上的方程式清晰可辨。手部,是AI视频生成里公认的“鬼门关”。手指数量错误、关节扭曲、与物体的空间关系失真,几乎是每一代视频模型都栽过的坑。而在这里,一支粉笔被正确握持,在黑板上留下有意义的笔迹,手腕的力道、落笔的角度,都在合理的范围内。这一关,比单纯画一只正常的手还要难,因为它要求手与黑板、粉笔、书写行为之间,形成一套完整的空间逻辑。

第三,时序对了。

这是最容易被低估的一点。教授写下某个推导步骤的同时,口头讲解的正是这个步骤,板书进度与语音内容保持完美同步。这远不止是音视频的帧级对齐,而是视觉事件、语义事件、时间事件三者之间的跨模态协调。任何一个维度的理解出现偏差,结果就会是“手在写A,嘴在讲C”。这种错位,人类观众一眼就能感知到。

如果这三件事只是分别做到,我们可以认为是三个专项模块拼凑的结果。但三者同时成立、彼此协调,更可能意味着模型在某个表征层面上,已经对“教授在黑板上讲课”这件事形成了整体性的语义理解。换句话说,它似乎理解了这件事在现实世界里是什么样子,以及其中各个元素之间的约束关系。这也正是“世界模型”这个词,会在这条视频流出后被频繁提及的原因。

在黑板视频流出的同时,另一条视频也一起曝光:两名男士在海边高档餐厅吃意大利面。

这个场景的选择,绝非偶然。2024年,一段AI生成的“Will Smith吃意大利面”视频曾在网上疯传。画面里手指数量不对,面条像活物一样扭动,叉子和嘴的空间关系完全失控。那段视频,成了早期AI视频生成能力的“耻辱柱”。

图为“Will Smith吃意大利面”视频截图

而这一次,Gemini Omni生成的结果,被用户评论为“令人难以置信地真实”。这背后考验的,是模型对刚体与柔性体之间动态交互的建模能力:叉子是硬的,面条是软的,两者在接触时会产生形变,而形变的方式必须符合现实世界里的物理直觉。这正是早期生成模型在隐式物理模拟上的致命短板。

一个模型,在两条视频里,分别挑战了视频生成最难的两类问题:一类是符号、语音与画面的同步,另一类是人与物体、刚体与柔性体的交互。并且,它把这些问题都推进到了一个更可用的状态。Gemini Omni展示的,更像是一个对世界有着更深层理解的基座模型。

Gemini Omni的冲击

截至目前,Google尚未发布Gemini Omni的任何技术文档,也没有公开模型参数或基准测试数据。但关于它的架构,外界已有三种主流解读。

最保守的说法是,Omni只是Veo的品牌重命名,底层推理引擎没有根本变化;第二种说法则认为,Omni是在Gemini架构下重新训练的全新视频模型,与Veo并行但独立;第三种说法最激进,认为Omni是一个真正意义上的原生多模态统一模型,能在单一架构里原生处理文字、图像、视频和音频。

基于那两段视频的表现,第三种解读反而像是“Omni”这个命名最合理的指向——毕竟在拉丁语中,“omnis”意味着“所有”。

如果Omni真正打通了多模态链路,那么模型竞争的焦点就会发生根本性转变。竞争将不再是谁能拍出更像电影的画面,而是谁能成为内容创作者的“唯一目的地”。

虽然现在还不能断言Gemini Omni已经是世界模型,但它至少表明,视频生成技术正在逼近世界模型要解决的核心问题:如何在时间中维持一个可解释、可编辑、可连续推演的场景。

产品层面的冲击同样不容忽视。今天,一条AI视频的生产链路通常需要串联语言模型写脚本、图像模型做故事板、视频模型做动画渲染,再用外部剪辑软件做后期处理。每一次跨工具切换,都意味着信息损耗和风格漂移。一旦Gemini Omni的对话式视频编辑能力成立,这条冗长的链路就可能被一个简单的对话窗口替代。

更关键的是,如果Omni被深度整合进Gemini入口,并与Gmail、Google Docs、YouTube、Android等生态打通,那么这种由分发和生态构筑的壁垒,将是字节的Seedance、快手的Kling等竞争对手在短期内难以复制的。技术能力决定上限,而生态决定规模。Gemini Omni真正的威胁,或许不在于它今天生成的视频有多好,而在于它把顶级的视频生成能力,放在了竞争对手根本进不去的生态位里——这几乎构成了一种降维打击。

世界模型时刻或许来临

回顾过去几年,生成式AI的进化路径相对清晰:语言模型学会了读和写,图像模型学会了看和画,视频模型学会了动。每一个模态都在自己的赛道上狂奔,但它们之间,始终存在一道隐形的墙。模型知道文字,也知道图像,但它未必理解文字和图像之间、声音和动作之间、逻辑和画面之间在现实世界中的约束关系。

如果说ChatGPT时刻定义了语言的边界,Sora时刻定义了视频的边界,那么Gemini Omni所指向的,很可能是第一个真正意义上的“世界模型时刻”。模型第一次开始尝试理解,不同模态在现实世界中的内在关联与约束,而不仅仅是分别生成它们。这无疑是一次质的飞跃。

当然,Gemini Omni是否真正实现了这一点,在5月19日Google I/O 2026大会正式揭晓之前,没有人能给出确定的答案。但泄露出来的视频,给出的信号已经足够有力。接下来Google会在台上说什么,我们很快就会知道。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。