商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > ChatGPT语音杀入桌面,你负责动嘴,一群AI负责干活

ChatGPT语音杀入桌面,你负责动嘴,一群AI负责干活

  发布于2026-07-27 阅读(0)

扫一扫,手机访问

先说个有意思的。Andrej Karpathy,就是那个AI圈的大神,最近分享了一个他特别爱用的懒办法。

想让AI干活,但一个字一个字把需求敲清楚实在太麻烦,怎么办?

他的答案是:干脆往后一靠,切换到语音模式,彻底放飞自我,意识流全开,对着手机或者麦克风说上十分钟。哪怕说得一团乱麻、前言不搭后语,都没关系。

有时候他甚至会先跟AI打个招呼:“切语音识别了,别介意错别字。”

神奇的是,他发现AI特别擅长处理这种又长又乱的碎碎念。模型会把你的这些“意识流”重新拼起来,整理成一份非常干净、清晰的输出。说实话,最终给你的版本,往往比你自己说的还要来得有条理——你脑子里那团纠缠的想法,被它捋顺了,来回纠偏的次数也少了很多。

这,就是Karpathy自己跟AI打交道最顺手的一种方式。

用他的话说,这能极大地改善人和模型之间的“心智融合”。人嘛,总懒得把一件事的来龙去脉一个字一个字敲清楚,那还不如干脆开口,把整团乱麻一股脑倒出去,让AI来帮你理。

所以,语音的真正价值,说实话,不是解放双手,而是让你能一口气把一整个思考过程——前因后果、心路历程——全带宽地倒给AI。

巧了,就在这几天,OpenAI干脆把这套“用嘴指挥AI”的玩法,直接搬进了桌面。

桌面版ChatGPT,现在能用嘴指挥了

7月23日,OpenAI正式把ChatGPT的语音功能(Voice)送进了桌面版App的Work与Codex场景。

从当天起,在macOS和Windows上全球分批推送,覆盖了Plus、Pro、Business、Edu、Enterprise各档用户。Android版本也即将跟上,iOS则通过Remote配对远程接入。

它的底层,是7月8日刚上线的新一代语音模型GPT-Live。这个模型的厉害之处在于,它能同时听和说:你随时可以打断它,它会接着你最新那句话往下走,不再是老式那种“先录音、再转文字、然后回你一句”的笨办法。

但关键在于,这次语音功能不只是拿来闲聊的。

在Work和Codex里,你张嘴就能启动一个任务、问问它跑得怎么样了、看看某个智能体现在什么状态,甚至还能在同一段对话里同时协调好几个Agent,让它们各干各的。

任务在后台跑着,你随时插一句让它换方向;它卡住了或者干完了,会主动开口,或在屏幕上给你提个醒。

它甚至能顺着你手头的活儿往下接:调用已有的项目上下文,连上文档、日历、联系人和通讯记录,把一件做了一半的事收尾。

官方也给出了一些很生活的实例:让它查查日历有没有冲突、翻翻邮箱看看航班改没改、顺手把会议纪要备好。用他们的话说,“趁你泡咖啡或者忙别的”,这些活在后台自己就跑完了。

macOS上还多了一手Appshots和屏幕上下文,能直接读取你当前最前面那个窗口,结合本地文件和代码库一起理解,热键也能自定义。

数据方面,Codex加ChatGPT Work的周活已经过了1000万。

OpenAI发的宣传片里有个画面很有意思:几名工程师站在同一个房间,对着同一个桌面会话,各说各的指令。一个AI,一屋子人围着它下命令——这大概就是他们想象中的“群体编程派对”吧。

OpenAI用一段居家场景演示ChatGPT Voice:开口把想做的事说给桌面版Codex,它在后台接着干。

打字是AI输入瓶颈,但语音不是

这当然不是OpenAI一家心血来潮。

几乎同一周,三个行业大佬几乎不约而同地把票投给了“语音”。

Karpathy在X上发帖,前面已经说过了。一位Grok的铁粉转发了Karpathy的帖子,说自己早用惯了Grok的语音转文字,“现在打字都觉得像上刑”,还顺便吐槽了Anthropic的语音输入“其实还挺基础的”。

马斯克又把这条转了出去,补上一句:你可以像跟人说话一样,用Grok Build把任务交给Grok去干。

奥特曼也不忘推销自己新一代语音模型GPT-Live。他自曝一向更爱打字,不爱跟AI说话,但如今他跟ChatGPT“说的已经比打的多了”。

他还专门点出:当你有一大堆上下文要一次性倒给AI的时候,语音最好用。

让三位大佬兴奋的,其实不是“终于能用嘴了”这么简单。这背后藏着这样一个逻辑:智能体越来越强,你要喂给它的意图也越来越复杂,键盘这条管道就开始拥堵了——你打得越省事,模型拿到的信息就越干瘪。

而语音输出,则是天生的宽管道:你能一口气把前因后果、顾虑偏好全说出来,哪怕说得乱,模型也能兜住,再替你把那团意识流理清楚。

社区里已经有人实测过:语音吞吐大概每分钟240个词,打字顶多70到80个词,差了三四倍。

GPT-Live把重活甩给后台的GPT-5.5、GPT-5.6去想,前台只管让对话流畅地接住你。这套解耦,恰恰是为了让人们可以随便开口。

说到底,人脑里的想法本就是并行的、跳跃的,键盘却逼你压成一行一行的字。而语音,让这道墙松动了。它正从一个“偷懒的输入法”,变成一个“高带宽的上下文入口”。

一句话:打字是AI输入的瓶颈,但语音不是。

语音输入背后,是“用嘴管项目”

OpenAI这次真正塞进桌面版的,是让语音去“管AI”。

按官方FAQ的说法,在Work和Codex里,你开口能干很多事:启动一个任务,给几个任务排优先级,中途打断、掉头改方向,而活儿在后台继续跑。

更进一步,它能在多个对话和项目之间,协调好几个智能体一起干。你说一句“A先做,B先挂着,C出结果了叫我”,后台就照着重排。

它还能接着上次的活儿往下干,靠的是项目上下文,加上连接进来的工具——你的文档、日历、联系人、通讯记录。

任务卡住了或者干完了,它会用语音或者屏幕上的提示告诉你一声。

这已经不是语音输入法的活儿了。它更像一个中枢,你在上面调度一支智能体团队。同样是开口和AI说话,以往是让AI听懂你,现在是让AI替你干活。

ChatGPT想当的,是你的“AI工作操作系统”

一个语音功能背后,藏着一条更大的路线:OpenAI想让ChatGPT做你的“AI工作操作系统”。

这几个月,OpenAI一直在重做桌面版ChatGPT,把Chat、Work、Codex放进了同一个入口,一键切换,在后台长期跑着。Codex,也早扩成了能并行多个智能体、跑长任务、读懂整个项目的通用平台。

为什么把这套能力放桌面,而不是留在人人都在用的手机上?

主要是因为手机那块小小的聊天框干不了复杂活儿,它适合随口问两句。真要让AI连着你的文件、代码和软件,把一件事从头做到尾,它就得待在你的电脑里。桌面才有文件、集成开发环境(IDE)、浏览器、一整套企业办公软件,这才是智能体干活的主战场。

这背后,是一次人类与AI交互方式的翻转。过去你用AI,是在“操作软件”:打开、输入、等待,一个回合一个回合地来。现在你更像个带团队的经理:开口把任务分下去,你和AI的关系,从“你问它答”,悄悄变成了“你说它做”。

一位重度用户干脆说,这套东西用起来“基本就是贾维斯”。他甚至让Codex帮自己配了个快捷键,一开口就能在三台机器、几块屏幕之间来回切换。

回到开头那个场景,真正让马斯克、奥特曼、Karpathy等大佬们兴奋的,不是可以扔掉键盘了,而是当输入不再是瓶颈,人可以把省下来的那点脑力,还给真正值得琢磨的事:决策。

所以下一个问题,其实不是“你能不能开口”,而是当你面前站着一屋子随叫随到的AI,你到底想让它们,替你做什么。

本文转载于:https://36kr.com/p/3913603335099785 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注