商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 京东推出全球首个全栈实时视频交互开源框架,拓展实景 AI 应用边界

京东推出全球首个全栈实时视频交互开源框架,拓展实景 AI 应用边界

  发布于2026-08-23 阅读(0)

扫一扫,手机访问

聊聊AI最近的一个新进展,这件事挺有意思的。

想象一下:一场火灾发生的瞬间,监控系统能立马发出警报;独居老人在家不小心摔倒,AI可以立刻通知远方的子女;视障人士出门,智能眼镜随时能描述周围环境、指明方向……这些场景,放在几年前还像科幻片,但在AI时代,可能很快就要走进日常生活了。

最近,京东搞了个大动作,开源了全球首个全栈开源的实时视频视觉语言交互模型——JoyAI-VL-Interaction。这个模型最大的亮点是,它让大模型从“一问一答”的模式,进化到了“边看边说”。开发者借助这套框架,能快速搭建出可以持续观察、自主判断、即时响应的实景AI助手。这等于说,AI真正走出屏幕,开始在物理世界里发挥作用了。


先澄清一个概念:现在的多模态模型,很多都停留在“一问一答”阶段——用户上传图片或视频,提出问题,模型再给出答案。这在图文问答、视频复盘、内容分析这些场景里确实够用,但一旦AI要介入真实世界,光聪明还不够,它得“在场”。真实世界的变化往往就发生在瞬息之间,一旦错过,就很难补救。

JoyAI-VL-Interaction的核心,就是让AI像人一样持续“在场”:边看、边记、边判断,在关键时刻主动回应,或者选择性地把任务交给后台Agent。相比传统模型,它有三大突破:

一是主动判断,而非被动回答。传统模型得等用户发问才开始处理画面,而JoyAI-VL-Interaction可以持续观察视频流,自主判断什么时候该说话,什么时候该沉默。比如你设置“裁判出示红牌时提醒我”,它就会一直盯着画面,事件发生时自动预警,根本不用你再追问一句“刚才发生了什么”。

二是实时响应,而非事后总结。传统视频理解往往需要上传完整视频再做分析,但在安防预警、实时翻译、直播解说、操作指导等场景里,晚几秒,体验和价值就完全不同。JoyAI-VL-Interaction面向正在发生的视频流,画面一变,它就能跟上。

三是适时委托智能体,同时保持观察和交互。这个能力特别有意思。当模型遇到生成代码、调用工具、复杂推理这类任务时,可以交给后台大模型或Agent。前台模型继续观察现场,后台模型处理复杂任务,结果返回后自然接回对话。这更像一套“前台实时助手+后台智能大脑”的协作系统:前台负责在场,后台负责干重活。这种模式,很可能开启AI与人类协作的新范式。

更关键的是,京东这次开源的不是一个模型,而是一整套系统。

在实时视频流中,JoyAI-VL-Interaction每秒都会做一次判断:继续观察、保持沉默,发现关键事件就主动回应,遇到复杂任务就交给后台Agent。这意味着,“什么时候说话”不再靠外部规则或定时触发,而是成为模型自己学会的能力。

对实时交互来说,会说话很重要,会沉默也同样重要。一个好的AI助手,不该一直打扰用户,而应该知道什么时候该出现,什么时候该安静,以及什么时候自己解决,什么时候交由agent处理。

很多开源模型只提供基础推理能力,开发者要真正用起来,还得自己处理视频接入、语音交互、记忆模块、前后端协同这些工程问题。而JoyAI-VL-Interaction开源的是完整技术栈,包括模型权重、交互数据集、训练方案和完整可部署系统。换句话说,开发者拿到手上就能用,大大缩短了从模型研究到真实场景落地的距离。

它还支持摄像头、直播流、监控流等多种视频输入,以及语音输入输出、可视化界面、长期记忆、后台模型接口和vLLM部署方案。ASR、TTS、可视化界面、后台模型、外部工具和业务模块,都可以按需替换。开发者可以接入自己的语音服务、Agent、API、业务系统或前端界面。

所以,JoyAI-VL-Interaction不是一个封闭的产品,而是一套开放框架。既可以用于研究,也可以改造成安防监控、老人小孩看护、直播讲解、电商导购、操作指导、AI眼镜、无障碍辅助等各类实时AI助手。

在评测中,JoyAI-VL-Interaction覆盖了监控预警、实时计数、实时翻译、时间感知、直播导览解说等真实流式场景。在58个与视觉触发的主动响应、实时性高度相关的真人盲评案例中,它对比豆包视频通话助手,总体胜率77.6%;对比Gemini视频通话助手,总体胜率87.9%。尤其是在监控预警场景中,对两个基线均取得100%胜率。这背后,源于交互模型相较传统“一问一答”回合制模型的天然优势:自主交互性长在模型内部,而非依赖外部触发。


今年以来,京东在模型基建上的进展确实不少。3月,开源基础大模型JoyAI-LLM Flash的Instruct版本,打破了大模型参数内卷的困局;4月,开源图像模型JoyAI-Image-Edit,空间理解与编辑能力达到世界一流水平;6月3日,又开源长视频生成模型JoyAI-Echo,推动长视频生成进入“所想即所得”时代。这些动作,标志着京东在上述领域已经进入全球第一梯队。

从“一问一答”到“边看边记边回应”,从离线视频理解到实时流式交互,从屏幕里的AI到物理世界里的AI——JoyAI-VL-Interaction的全栈开源,是京东把AI从数字世界推向物理世界的又一步。

京东深耕零售、物流、健康、工业等实体产业二十余年,拥有全球领先的物理世界运营网络,覆盖仓储、配送、门店、直播、客服、售后等海量真实场景。每一天,都有大量人、货、场的实时互动在发生。对AI来说,这些不是抽象的数据,而是进入物理世界的天然训练场与应用场,也为京东打造“全球最大物理世界运营中心”提供了坚实的保障。未来京东会不会让AI从千行百业走进千家万户?从这股势头来看,可能性不小。

本文转载于:https://www.163.com/dy/article/L02CRRCC0550WHYR.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注