当前位置:

首页 > 硬件相关 > GPT-Live实测:语音交互追上了豆包、Gemini,这几点更强了

GPT-Live实测:语音交互追上了豆包、Gemini,这几点更强了

本文目录

    GPT-Live采用全双工语音架构,实现边听边说、可随时打断。其将交互与思考分离,后台调用GPT-5.5处理搜索推理。相比豆包更懂中文口语节奏、Gemini支持多模态实时交互,GPT-Live侧重边听边想边搜,回答更完整。

    ChatGPT 的语音模式,终于补上了迟到的一课。

    北京时间今天凌晨(7 月 9 日),OpenAI 正式推出了新一代实时语音模型 GPT-Live,并开始逐步接管 ChatGPT 里的语音模式。付费用户已经能用上 GPT-Live-1,免费用户则获得能力稍弱一些的 GPT-Live-1 mini。

    这次升级最核心的变化,是换上了“边听边说”的全双工语音架构。



    图片来源:雷科技

    简单回顾一下:过去 AI 语音交互更像是在用对讲机。用户说完一句,系统判断这一轮输入结束,再开始理解和回答。即便之前的 ChatGPT“高级”语音模式已经支持中途打断,也依然没有完全摆脱一问一答的轮次结构。

    但新版搭载 GPT-Live 的 ChatGPT 语音模式,可以一边说话一边持续听取用户输入。你可以随时插话,它也能根据停顿、语速和上下文,决定继续说、停下来,还是再等你一会。在长对话中,GPT-Live 还会用“嗯”、“明白”这类短促反馈,表示自己还在听。

    听起来很先进。不过放到整个行业里看,OpenAI 其实来得有点晚。无论是今年 3 月推出的 Gemini 3.1 Flash Live——用在 Gemini Live,还是 4 月字节跳动推出的原生全双工模型 Seeduplex——用在了豆包的语音通话模式中,都已经通过端到端实现了真正的“边听边说”。

    不过,GPT-Live 的出现,至少意味着 ChatGPT 在架构上终于追上了两位主要对手。实际用下来,三者也有明显的不同:豆包最懂中文用户怎么说话,Gemini 更在意 AI 能否看到周围世界,而 GPT-Live 则把大量精力放到了另一件事上——怎么让 AI 一边和人自然聊天,一边搜索、推理。这也是豆包之前就想做的事。

    边听边说、会等你、会思考,GPT-Live 追求更自然的语音交互

    先不急着拷问 ChatGPT。

    打开 ChatGPT 的语音模式后,你大概能在左上角看到新版用上 GPT-Live 模型的“Live”,而之前的高级和标准版则被归类为“旧版”。同时,在语音模式的配置界面,还能看到“智能”的调节选项,直接对应了 GPT-5.5 即时、中等、高的三档智能水平。



    图片来源:雷科技

    没错,除了实现全双工语音架构,让 AI 做到真正的边听边说的“全双工”交流,GPT-Live 另一个很大的变化和升级,是同时做到了把思考“外包”给 GPT-5.5。

    你可以把这种设计理解为将“交互”和“思考”拆开。虽然 GPT-Live 本身也有一定的智能,但遇到搜索、复杂推理或 Agent 任务时,它可以在后台直接把工作交给 GPT-5.5 来完成。

    举个实际使用中的例子:在简单听了它自己对 GPT-Live 的介绍后,我接着问了它(GPT-Live)与豆包、Gemini 在语音实时交互上的不同。

    GPT-Live 没有给出几个产品和模型之间宽泛的区别,而是从豆包在抗噪、低延迟等方面的技术,讲到产品定位更强调语音交互本身的体验;从 Gemini 多模态实时交互的模型设计,讲到 Google 更看好统一的音视频实时交互。内容比较具体,很少出现那种听上去什么都说了、实际没有回答问题的空话,同时联网信息也比较准确,知道豆包、Gemini 更早时候就支持了全双工语音。



    左为豆包打电话,右为 Gemini Live,图片来源:雷科技

    相比之下,豆包语音更倾向于给出短答案。即便明确要求它展开讲讲,回答通常也不会拉得太长。这当然不能全部归结为模型能力,还可能是一种主动“约束”:豆包希望电话模式始终保持轻量,尽量接近普通人打电话聊天,满足日常情绪价值。

    当然,GPT-Live 的聪明,实际还要归功于背后的 GPT-5.5。在具体设计中,GPT-Live 不仅支持智能调度不同推理强度的 GPT-5.5,也支持手动配置默认推理强度,比如选择即时模式会默认调用 GPT-5.5 即时,“中等”和“高”则会默认调用不同推理强度的 GPT-5.5 Thinking。



    图片来源:OpenAI

    这种设计对用户来说,直接拉高了实时语音对话中 AI 的智能水平。毕竟谁也不想“对牛弹琴”。过去人类被 AI 语音助手“气疯”的例子不少,今天大模型已经大幅提高了 AI 的自然语言理解能力和智能水平。但不同于基于文本的语音消息对话——将人类语音转录成文本、将 AI 输出文本转成自然语音,实时语音对话往往会牺牲 AI 的智能水平,AI 有时候的回应仍然会气死人。

    所以,如果说豆包升级 Seeduplex 后实现了“边听边说”,GPT-Live 则更接近“边听边说边思考”。实际上,豆包 Seeduplex 发布时就展望了未来的突破方向,其中一点就包括:

    “实现感知、思考、输出一体化,进一步探索‘边听边想’、‘边听边搜’等方案,让模型具备更深度的思考和执行能力,继续提升语音交互的流畅度。”

    不只是在搜索和思考上,GPT-Live 的实时语音交互实际上还优化了对话节奏。我说到一半卡住,思考接下来该怎么表达时,它并没有马上把话接过去,而是先安静等待一会,不行再询问。这是一个很小的细节,却也在一定程度上决定了语音交互体验的“自然”。我们实际在说话时,经常也会停下来想一想。过去的语音模型很容易把停顿当成一句话结束,于是用户只是吸了一口气,AI 已经迫不及待开始回答。豆包 Seeduplex 虽然宣称也改进了这一点,但实际来看还是更容易抢话。

    不过说实话,大概率还不会成为 ChatGPT 语音模式的忠实用户。一方面,相比英文发音,ChatGPT 的中文发音和你豆姐的“桃子音”还是差太远,这次升级也没有变化,还是更接近外国人说中文,多少有些别扭。另一个问题是,GPT-Live 在回答时,偶尔会出现明显的“卡壳”。结合文本输出的情况来看,大概率是 GPT-5.5 生成文本时会实时调整输出,放到屏幕上只是文字轻微变化,变成连续语音后,就会表现成停顿或者不自然的转折。



    图片来源:雷科技

    OpenAI 没有解释这种现象是否来自 GPT-Live 和 GPT-5.5 之间的协作,但从体验来看,两层模型的分工在带来更强能力的同时,也可能增加语音输出的复杂度。至少目前,GPT-Live 偶尔还会露出一点痕迹。

    AI 都追求“边说边听”,但想的却不是一件事

    边说边听的全双工架构,是 AI 语音交互的必经之路,这一点毋庸置疑。

    过去的我们都经历过“反人类”的语音交互:用户说完,AI 才开始想;AI 开口,用户最好先别说。真正自然的交流没有这么规整,人会犹豫、停顿、改口,也会在对方说话时用一句“嗯”表示自己还在听。AI 想成为一个可以长期交流的对象,得先适应这种连续、混乱,甚至有点含糊的对话。

    在这一点上,豆包、Gemini 和 GPT-Live 已经走到了同一个方向。模型可以一边输出语音,一边继续接收用户输入。用户不用等 AI 把整段话说完,也不用每次都明确结束一轮对话。

    但“边听边说”只是起点。具体怎么听、怎么说,以及听到之后能做什么,三家现阶段给出的答案有很大区别。



    图片来源:OpenAI

    豆包 Seeduplex 发布之时,字节花了大量篇幅讲抢话、误打断、背景人声和停顿判断。这些问题看起来很琐碎,却恰恰决定了电话模式像不像真的在和人说话。比如用户停顿两秒,可能是在思考,也可能已经说完。旁边同事讲了一句话,可能是在和用户交流,也可能只是无关闲聊。所以它的优势也很直接:豆包在中文环境下对口语节奏、含糊表达和背景干扰的处理,依然是三者中最稳的。

    另一厢,Google 很早就把 Gemini Live 放进实时多模态的统一框架里,支持声音、摄像头画面、屏幕内容和文本输入,并不是几套临时拼起来的功能,而是同一段连续上下文中的不同信息。用户可以一边拍摄眼前的物体,一边追问怎么使用;也可以共享手机屏幕,让 Gemini 理解应用界面或者网页内容。这套路线更强调统一感知。Google 想解决的,是让 AI 真正知道用户正在看什么、屏幕上发生了什么,以及环境里的声音是否值得回应。语音在这里更多是实时多模态助手的一部分,或者说一种交互方式。

    说到这里,GPT-Live 首发暂不支持视频通话,想用视频还得切回旧的语音模型,而 Gemini 从一开始就把“听”和“看”统一在一个 Live 模型里。不过,现阶段的模型统一,不意味着每一项体验都更好。至少在中文甚至多语言下,Gemini 实在差强人意,中文识别较差不说,有时候还会突然识别成其他语言。



    图片来源:雷科技

    GPT-Live 则把重点放到了另一个问题上:AI 边听边说的时候,同时认真思考。这也是豆包发布 Seeduplex 时已经提到的下一步。GPT-Live 没有强求一个实时语音模型包揽所有工作,而是采用了更灵活的架构设计,用今天最聪明的模型之一——GPT-5.5 来应对实时语音交互中更复杂的意图、需求和任务。所以在实际体验中,GPT-Live 的回答明显更完整,在不破坏对话节奏的情况下,从多个层面分析问题,也能更好地处理更长、更复杂的追问。

    不同的做法和思路,也反映在产品定位和交互设计上。Gemini Live 的通话和屏幕共享不是附加功能,而是整个交互的核心。它适合用户举着手机边看边问,也很符合 Google 对手机、眼镜、汽车和智能家居入口的长期想象。豆包的入口就叫“打电话”,界面、语气和回答长度都在尽量靠近普通电话。它通常不会连续讲很长时间,即便用户要求展开,回答也会保持相对克制。ChatGPT 的设计则更接近一个完整 AI 工作台的语音界面。用户可以在同一段对话里从闲聊转向搜索,从简单问答转向文件分析,也可以继续要求模型深入推理。语音没有被限制在一个独立的电话模式里,而是要连接 ChatGPT 已经具备的整套能力。

    三家都在追求自然,但对通往“自然”的想法和节奏并不完全一样。

    ChatGPT 架构看齐豆包/Gemini,体验不分伯仲

    所以,ChatGPT 终于追上豆包和 Gemini 了吗?

    架构上,答案基本是肯定的。GPT-Live 补上了原生全双工语音能力,可以持续倾听、处理中断,也开始更准确地理解停顿。过去 ChatGPT 高级语音模式与豆包 Seeduplex、Gemini Live 之间那条明显的架构差距,已经不存在了。

    体验上,却很难简单排出一个先后。想要最自然的中文发音、最稳的复杂环境识别,豆包依然更好;需要边看边聊、共享摄像头和屏幕,Gemini Live 的优势最明显;想通过语音深入讨论一个问题,甚至继续搜索、推理和执行任务,GPT-Live 已经开始领先。

    三家最后大概率会逐渐补齐彼此的能力。豆包会加入更深的推理和视觉,GPT-Live 会重新接回视频,Gemini 也会继续加强 Live 模型与通用 Agent 之间的配合。可以相信的是,AI 语音交互的体验会越来越好,一个以“说话”而非“手指操作”为主要人机交互方式的未来,也会越来越近。

    本文内容来源于网友投稿,如有侵权请联系删除。
    作者最新文章
    硬件相关 Gemini
    相关文章 更多
    笔记本加内存条后无法开机怎么办及解决方法
    笔记本加内存条后无法开机怎么办及解决方法

    笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

    电脑主机前置usb不能用怎么解决排查修复教程
    电脑主机前置usb不能用怎么解决排查修复教程

    针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

    无线鼠标充不进电解决办法及故障排查步骤
    无线鼠标充不进电解决办法及故障排查步骤

    遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

    蓝牙游戏手柄连接教程吃鸡
    蓝牙游戏手柄连接教程吃鸡

    想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

    游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
    游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

    本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

    显示器画面模糊抖动怎么解决及排查方法教程
    显示器画面模糊抖动怎么解决及排查方法教程

    遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

    小米智能门锁换电池后怎么开机
    小米智能门锁换电池后怎么开机

    小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

    电视机声音怎么连接到外置音响
    电视机声音怎么连接到外置音响

    想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

    打印机加墨水后打印不出颜色的原因及解决方法
    打印机加墨水后打印不出颜色的原因及解决方法

    解决打印机加墨水后打印无色的问题,涵盖墨盒芯片计数器重置、喷头气锁排除方法以及驱动程序颜色设置检查,帮助用户快速恢复彩色打印功能。

    显示器无信号但主机正常工作原因排查与解决方法
    显示器无信号但主机正常工作原因排查与解决方法

    面对主机运转正常但显示器无信号的困境,本文通过场景化分析,指导用户从线缆检查、输入源切换、内存金手指清洁到显卡重新插拔,逐步排除故障,恢复显示。

    查看更多
    精品专题 更多
    装机必备
    装机必备

    正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

    Windows
    Windows

    正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

    macOS软件
    macOS软件

    正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

    Mac软件 更多
    photoshop
    photoshop
    Windows、macOS 、 iPad

    Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

    灵活计算器
    灵活计算器
    macOS/iOS/Android

    灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

    WINDOWS 更多
    3dmax(3ds max)
    3dmax(3ds max)
    Windows

    Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

    photoshop
    photoshop
    Windows、macOS 、 iPad

    Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。