发布于2026-08-07 阅读(0)
扫一扫,手机访问
8月5日,字节跳动正式推出了原生音视频全双工大模型SeedRealtime,并同步在豆包App全量上线。用户把豆包更新到最新版本后,就能通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。

SeedRealtime采用统一端到端架构,原生融合了音频、视频与文本三种模态信号。这跟业界主流的级联系统完全不是一个路子——那些系统依赖自动语音识别(ASR)、视觉模型、语音合成(TTS)等多个模块串联,感知、理解和表达各管一段,延迟层层叠加。而SeedRealtime把声音、画面、时序与表达统一到同一个端到端模型里,不再需要外部语音活动检测(VAD)来判定轮次,而是在连续的多模态信息流上同步完成感知、理解、决策与表达。
字节方面披露了三个关键突破,不妨逐一看看。
首先是音视频联合理解。模型原生支持声音、画面与时序信息的深度融合,能结合场景消解同音词歧义,也能准确理解视觉中的时序指代。举个场景:当用户说“这个怎么弄”时,模型需要结合当前画面、手势与历史动作,判断“这个”具体指向什么。
其次是主动交互能力。模型具备持续的环境感知与主动表达能力,能察觉画面状态变化并主动提醒,还能调用工具融入表达。在最新演示中,模型在博物馆里持续观察镜头画面,识别指定文物后主动提醒;用户操作咖啡机时,它也能根据画面变化实时纠错。
第三是流畅的交互节奏。模型能实时感知用户的对话状态,在适当时机自然接话、停顿与回应。同时,抗干扰能力很强——能分辨旁人闲聊与背景噪声,避免误触发。在机场等嘈杂场景中,它能区分用户与旁人的对话,这一点很关键。
字节披露的端到端人工评测数据显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少了约一半。“话未说完被抢断、话音已落却回应迟缓、被背景杂音与闲聊误触发”这类卡壳现象均有明显下降,单次对话能够完整、顺畅交流的概率也有明显提升。
从行业基本面来看,SeedRealtime的推出符合今年基础模型的演进趋势。自上半年以来,头部企业的竞争焦点已经明显从单纯追求参数规模,转向多模态实时交互的商业化落地。
豆包App是字节跳动在C端市场的核心AI产品。这次在端内快速全量上线全双工大模型,业务逻辑很清晰——通过降低交互门槛,进一步争夺用户规模和应用内的停留时长。
不过,音视频全双工技术的常态化运营仍面临直接的工程与商业挑战。连续多模态信息流的实时处理,对云端算力和网络带宽的消耗呈指数级增长。在C端海量并发请求的场景下,如何把模型的推理成本控制在商业可接受的范围内,这包括字节跳动在内所有AI研发企业必须跨越的门槛。
另一方面,市场对视频通话类AI的真实需求黏性仍需打个问号。主动提醒、实时视频交互等功能,在特定场景下是否会造成用户的体验冗余甚至打扰,目前尚无定论。SeedRealtime能否在新鲜感褪去后,沉淀出具有高频、刚需属性的核心应用场景,多模态应用生态能否就此闭环,还需要后续真实的留存数据来验证。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9