硅谷正在流行“氛围办公”:不敲键盘,对着电脑叽叽咕咕
这个春天,硅谷的办公氛围正在发生一种微妙的变化。键盘敲击的“哒哒”声,正逐渐被一种压低音量的、持续不断的“嘀咕”声所取代。 有风险投资人半开玩笑地说,如今走进一家AI创业公司,感觉像是误入了某个高端呼叫中心。只不过,员工们戴着电竞耳机,对着麦克风并非在接听电话,而是在向AI发号施令。 这股风潮甚至有

这个春天,硅谷的办公氛围正在发生一种微妙的变化。键盘敲击的“哒哒”声,正逐渐被一种压低音量的、持续不断的“嘀咕”声所取代。
有风险投资人半开玩笑地说,如今走进一家AI创业公司,感觉像是误入了某个高端呼叫中心。只不过,员工们戴着电竞耳机,对着麦克风并非在接听电话,而是在向AI发号施令。
这股风潮甚至有了自己的名字——“voicepilled”,可以理解为“语音觉醒”。这个概念由LinkedIn联合创始人Reid Hoffman在2025年秋天的一篇帖子中普及开来。他描述道,所谓“被voicepill”,就是你突然意识到,一旦开始认真使用语音与技术交互,就能解锁一种全新的能力放大模式。这个词巧妙地借用了《黑客帝国》中红蓝药丸的隐喻:吞下这颗“语音药丸”,你看到的将是一个截然不同的生产力世界。
当然,语音输入本身并非新鲜事物。从苹果的Siri听写、Windows语音识别,到更早的Dragon NaturallySpeaking,相关技术已存在多年。但过去的体验往往令人沮丧:识别率堪忧、标点混乱,一句话重复多次仍错误百出,最终用户往往发现,还不如自己动手打字来得快。
真正的转折点,源于大规模AI语音模型的成熟。2024年,OpenAI发布了基于Transformer架构的开源语音识别模型Whisper,它使用了高达68万小时的多语言音频数据进行训练。Whisper的出现,一举将语音转文字的准确率拉到了实用门槛之上。
而新一代的听写工具,如Wispr、Aqua Voice等,在此基础上迈出了更关键的一步。它们不再满足于机械地逐字记录,而是引入了大语言模型(LLM)对输出进行深度“润色”。这意味着,工具会自动删除“嗯”、“啊”之类的口头禅,修正语法错误,调整句式结构,甚至能根据你正在使用的应用场景来适配语气和格式。整个过程延迟极低,通常控制在一到两秒之内。部分工具还支持“命令模式”,允许用户直接用语音指令编辑已有文本,例如“把上一段改成更正式的语气”或“删掉最后一句”。

(来源:Wispr ai)
这种工作方式之所以令人兴奋,有一个非常直观的原因:人类说话的速度远快于打字。对于英文使用者而言,普通人打字速度大约在每分钟40到80个单词,而正常语速可达每分钟130到150个单词。中文使用者的差异同样明显,打字速度通常在每分钟80~100字,而语速则在每分钟200~250字之间。
对于那些核心工作是将想法转化为文字的人——比如撰写邮件、文档或代码提示词——这意味着理论上可以将产出效率提升两到三倍。一些深度用户声称,他们的文字产出量确实实现了数倍增长。
更有趣的是,语音听写正与另一个热门趋势“氛围编程”(vibe coding)合流。这个概念由Andrej Karpathy在2025年初提出,指的是开发者不再逐行编写代码,而是用自然语言描述需求,由AI编程工具(如Claude Code、Codex)来生成代码。当“氛围编程”遇上语音听写,开发者甚至无需坐在电脑前。他们可以一边踱步思考,一边口述需求,听写工具将语音转为文字提示(prompt),再由编程AI将prompt转化为代码。Wispr的创始人Tanay Kothari透露,他们的员工现在就是在办公室里走来走去,对着电脑说话,将思考过程从桌前解放了出来。
据媒体报道,最狂热的用户甚至引入了可编程脚踏板(一种原本属于游戏外设的设备),通过踩踏来激活语音交互功能;还有人架起了体育解说员或牧师常用的鹅颈麦克风,以获得更清晰的收音效果;在Wispr公司内部,流行将无线领夹麦克风别在衬衫上,员工们看起来仿佛随时在录制播客。这家公司甚至有计划未来向客户销售品牌麦克风。

图 | 可编程脚踏板 (来源:Amazon)
资本市场对这种新的“氛围工作”(vibe working)方式显然十分看好。成立于2024年的Wispr,最初方向是脑机接口可穿戴设备,后转型专注于语音听写工具。据报道,2025年11月其估值约为7亿美元,而到了2026年5月,其目标估值已飙升至20亿美元。一个听写应用能获得如此高的估值,足以说明市场对“语音取代键盘”这一前景的乐观程度。
随之而来的,是日益激烈的竞争。同类公司Aqua Voice和Willon都获得了Y Combinator的投资,初创公司TalkTastic、Typeless、Superwhisper也各自拥有忠实用户。科技巨头自然不会缺席:在2026年5月的Android Show上,谷歌发布了Rambler,这是一个内置于Gboard输入法、由Gemini驱动的听写功能,能够将用户杂乱的口述自动整理成通顺文本。平台级玩家的入场,将如何挤压独立应用的生存空间,仍有待观察。
现实的门槛与挑战
然而,在这股新技术浪潮面前,依然存在一些不容忽视的现实门槛。
首先是硬件与环境的局限。目前主流的AI听写工具大多优先甚至独占于Mac平台。Wispr Flow和Superwhisper支持Mac,Aqua Voice长期仅限Mac(近期才开始支持Windows),TalkTastic则专注于iOS和Mac。而在企业环境中,Windows仍然是绝对主流的操作系统,尤其是在医疗、法律、政府、金融等行业。
更棘手的是远程桌面环境。许多企业员工通过Citrix、VMware Horizon或RDP(远程桌面协议)访问工作系统。而大多数听写工具依赖剪贴板粘贴来输入文字,这在被组策略严格锁定的远程会话中往往无法正常工作。
其次是成本问题。以Wispr为例,其订阅价格为每月18美元。对于一个基础生产力工具而言,这个价格让不少个人用户望而却步。传统的Dragon NaturallySpeaking则需要数百美元的一次性买断费用。尽管存在更便宜的选择(例如一些工具提供每月7美元的方案,或基于本地模型的免费层级),但整体来看,语音听写尚未成为一个人人可轻松采用的默认选项。
此外,还有一系列关于噪音和隐私的担忧。
在海外,开放式办公室本就因噪音问题饱受诟病。多项研究表明,开放式办公环境中无关的语音噪音,是影响员工注意力和心理健康的主要因素。而现在,语音听写正在向这个环境注入更多声源。想象一下:在一个容纳二十人的开放工位区,有七八个人同时在低声嘟囔——有人口述邮件,有人向AI编程助手描述一个bug,有人用语音命令修改文档格式。即便每个人都刻意压低音量,汇聚在一起也足以构成一种持续的听觉干扰。
一名受访用户坦言,这在公共场合“确实有点尴尬”。他说,在家中使用语音办公感觉像钢铁侠对Jarvis下达指令,颇具未来感;但在办公室里,当着同事的面自言自语,总归有些不自在。更重要的是,当你口述内容时,周围的人都能听到你在说什么。无论是邮件内容、代码逻辑还是商业想法,这些原本只停留在屏幕上的私密信息,现在变成了公开的声波,难免让人感到不安。对于涉及敏感信息的工作场景,这还可能带来合规风险。

(来源:Youtube)
未来的想象与重构
从更宏观的视角看,语音办公的兴起或许折射出一种根本性的技术趋势:人机交互的重心,正在从“让人适应机器的方式”向“让机器适应人的方式”迁移。键盘是一种为机器效率而设计的输入界面,人类花费了一百多年去适应它。而语音,是人类最原始、最自然的表达方式。AI的进步终于让机器能够较好地理解人类自然状态下的语言,于是,“让人回归说话”便成为一个顺理成章的发展方向。
但必须承认,人类发明文字书写,本身就是因为纯语音表达存在其固有的局限:它是线性的、信息密度相对较低、难以承载复杂的逻辑结构,并且极易受到环境干扰。对于这些问题,当前的语音听写工具还需要交出更好的答卷。
更进一步想,如果语音交互真的成为主流工作方式,那么我们熟悉的办公室结构也将面临重新设计。过去几十年,办公空间默认服务于安静打字的人类。而未来,它可能需要服务于一群持续进行低声对话的人。声学隔离、半封闭的语音工位、针对不同噪音等级的空间分区,甚至专门用于人机对话的“语音会议室”……这些听起来有些超前的设计概念,或许在未来会成为办公空间的标配。
1.https://www.theguardian.com/technology/2026/may/12/end-of-typing-workers-ditching-keyboards-voicepilling-ai-dictation
2.https://techcrunch.com/2026/05/10/get-ready-for-the-whisper-filled-office-of-the-future
3.https://www.wsj.com/tech/typing-is-being-replaced-by-whisperingand-its-way-more-annoying-a804fee7
注:封面/首图由 AI 辅助生成
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















