OpenAI最强语音模型:GPT-Live登场,让AI对话更接近真人聊天
OpenAI发布GPT-Live系列全双工语音模型,实现同时聆听与说话,对话节奏接近真人。提供GPT-Live-1和mini两个版本,面向不同订阅用户。采用全双工架构,每秒多次判断交互,复杂任务拆分前台语音与后台推理。新评测体系显示,在流畅度、打断等指标上优于AdvancedVoiceMode。每周超1.5亿用户使用,支持可视化卡片、搜索、记忆等功能,安全测
OpenAI今天(7月9日)发布了GPT-Live系列模型,新一代全双工语音模型。简单来说,这个模型可以同时聆听与说话,让AI对话的体验更接近真人之间的交流。


目前开放了GPT-Live-1和GPT-Live-1 mini两个版本,即日起面向全球ChatGPT用户开放。具体来说,GPT-Live-1模型面向Go、Plus和Pro订阅用户,免费用户则可以调用GPT-Live-1 mini模型。附上相关视频截图,可以直观感受一下对话流畅度。


架构是这次升级的核心看点。GPT-Live系列采用全双工架构,不再像传统语音模型那样需要等一轮对话结束后再响应。它可以在同一时间持续处理输入和输出——模型会“每秒多次”判断是否该说话、继续倾听、暂停、打断,甚至调用工具。这种机制,让对话节奏和真人聊天几乎无异。



面对复杂任务时,GPT-Live系列的处理方式很聪明:它会把连续交互和深度推理拆分开。前台维持语音对话流,同时把网页搜索、复杂推理等更繁重的任务委托给GPT-5.5系列模型在后台执行。具体分工是这样的——GPT-Live-1(instant)与GPT-Live-1 mini调用GPT-5.5 Instant;GPT-Live-1 Medium调用GPT-5.5 Thinking Medium推理强度;GPT-Live-1 High则调用GPT-5.5 Thinking High推理强度。

性能方面,OpenAI专门建立了一套新的人工评测体系,重点考察语音交流中的舒适度和整体交流流畅性。

和此前Advanced Voice Mode相比,在时长5到10分钟的配对对话中,GPT-Live-1与GPT-Live-1 mini在整体偏好、轮次衔接、打断情况、对话流畅度与自然度等指标上,都获得了更高的偏好得分。
用户规模数据很能说明问题:OpenAI披露,每周有超过1.5亿人通过Voice和Dictation等功能与ChatGPT语音交互。应用场景相当丰富,包括免手持日常协助、语言练习、睡前故事、通勤闲聊等等。新版本还支持在语音对话中展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆、图片和文件上传。

安全层面,OpenAI表示GPT-Live在自伤、精神病性症状与躁狂、对AI的情感依赖、暴力及性内容等领域,接受了音频原生评测、合成音频评测与内部红队测试。最新评估显示,该模型在几乎所有评估维度上,都与Advanced Voice Mode表现相当,甚至更优。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















