苹果连发3项AI研究,推进空间计算与Vision Pro头显方向
苹果近期发布三项AI研究,涉及空间功能评测、手语视频标注与3D头部重建,均指向下一代空间计算核心。新评测体系考核AI对物体功能的理解,手语研究旨在降低无障碍技术门槛,头部重建技术可提升VisionPro虚拟形象逼真度。这表明苹果正持续推进空间计算底层技术,回应了相关战略动摇的传闻。
关于苹果Vision Pro项目被搁置的传闻,最近似乎可以告一段落了。几项最新公开的研究表明,苹果在空间计算和头显技术上的探索,不仅没有停止,反而在向更深处推进。
就在上个月,有消息称苹果内部已将研发重心从新款Vision Pro转向了Siri和AI智能眼镜,这让外界一度猜测其空间计算战略是否发生了动摇。然而,最新公示的三项研究论文,无疑是对这些猜测的有力回应。这些研究分别涉及多模态大模型的空间功能推理评测、美式手语的视频标注自动化,以及大规模高质量的3D头部重建。每一项,都直指下一代空间计算体验的核心难题。
从“在哪”到“干嘛用”:重新定义空间AI的智商测试
最直接体现苹果野心的,是其在机器学习博客上发布的论文《从物体所在到物体所用:为多模态大模型建立空间功能智能基准》。这篇论文提出了一个名为SFI-Bench的新评测体系,其目标不再是简单地测试AI能否识别物体和位置,而是考核它是否理解物体的功能以及如何在真实场景中使用。
简单来说,过去的测试可能只问“厨房台面上有什么?”,而SFI-Bench会追问“如果咖啡机不出咖啡了,可能是什么原因?该怎么排查?”或者“请从橱柜里找出同品牌数量最多的一组调料瓶。”这套基准包含了134段室内环境扫描视频和1555道由专家标注的问题,旨在模拟未来家庭助手在真实生活中可能遇到的复杂任务。

苹果公司的人工智能研究人员测试了智能体(LLM)对周围世界的理解能力。图源:苹果公司
测试结果颇有看点。在参与评测的模型中,Google的Gemini 3.1 Pro总分拔得头筹,OpenAI的GPT-5.4-High紧随其后。然而,论文也尖锐地指出了当前模型的共同软肋:几乎所有模型在“带条件的全局计数”(比如“找出所有未拆封的饮料”)、长序列的空间记忆、以及将视觉信息与外部知识灵活结合等方面,都表现得不尽如人意。这恰恰说明,要让AI真正成为得力的空间助手,还有很长的路要走。
让机器看懂手语:降低无障碍技术的门槛
另一项研究《用手语模型自举生成手语标注》则展现了苹果对技术普惠性的思考。该研究尝试利用AI模型自动为美式手语(ASL)视频生成候选标注,从而将人工标注者从数百小时的繁琐劳动中解放出来。

苹果公司的研究人员探索了使用人工智能进行美国手语(ASL)标注的可能性。图源:苹果公司
研究团队建立了一个近500条词汇的初始标注集,并将其扩展应用到超过300小时的ASL STEM Wiki数据和7.5小时的FLEURS-ASL数据上。其研发的手指拼写识别模型,在特定数据集上取得了6.7%的字符错误率(CER)和74%的Top-1准确率。这项技术如果成熟,将极大加速手语翻译资源的创建,为听障群体打开更便捷的信息之门,这无疑也是空间计算设备融入社会生活的重要一环。
重建数字化的你:3D头像技术的飞跃
第三项研究《基于多视角采集的大规模高质量3D高斯头部重建》,则与Vision Pro的用户体验直接相关。苹果提出了名为“HeadsUp”的新方法,能够从大规模的多摄像头采集系统中,重建出高质量、高保真的3D高斯散射头部模型。

苹果公司的人工智能研究人员探索了如何利用LLM(层级建模)技术,从多角度拍摄的图像中创建3D头部模型。图源:苹果公司。
这项研究的突破性在于规模。团队使用了一个包含超过10000名受试者的内部数据集进行测试,其数据规模比当前公开的多视角人头数据集高出了一个数量级。这显然不仅仅是为了学术突破。它很可能指向Vision Pro中“Persona”(虚拟形象)功能的未来迭代,旨在实现更自然、更实时的人脸捕捉与表情渲染,让用户在visionOS构建的虚拟空间中的交互变得无比真切。
回望苹果全球营销高级副总裁格雷格·乔斯维亚克(Greg Joswiak)此前的表态,这一切就显得顺理成章。他曾强调,Vision Pro所展示的数字与物理世界融合的未来形态是必然的。虽然他无法预测“空间计算”何时成为主流,但方向已然确定。如今,这些深耕底层技术的研究,正是苹果为那个“不可逆转”的未来,默默铺下的又一块基石。喧嚣的传闻之外,扎实的工程与研究仍在继续。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















