ChatGPT语音进入桌面端:OpenAI想把AI变成“会听指挥的工作中枢”

ChatGPT语音进入桌面端,重点从聊天转向用语音调度AI任务。

冷月清谈:

OpenAI近日将ChatGPT语音功能引入桌面版App的Work与Codex场景,面向macOS和Windows分批推送。文章认为,这次更新的重点不只是“用嘴聊天”,而是让用户通过语音启动任务、调整优先级、打断执行、协调多个Agent,并让任务在后台持续推进。语音被视为比打字更高带宽的输入方式,尤其适合一次性表达复杂背景、偏好和约束。Karpathy、马斯克、奥特曼等人都强调,语音能降低人与AI沟通的摩擦,让AI更好理解一团尚未整理清楚的想法。文章进一步指出,OpenAI正试图把ChatGPT桌面版打造成“AI工作操作系统”:连接文件、代码、日历、邮件和办公软件,让用户从逐回合提问,转向像管理团队一样调度多个智能体完成任务。

怜星夜思:

1、如果语音真的成了AI的主要入口,键盘会不会在很多工作场景里被边缘化?
2、把AI放到桌面端、接入文件和日历这些数据,便利和隐私之间该怎么取舍?
3、多Agent协作听起来很美,但普通人真的需要“一群AI替自己干活”吗?
4、语音能把“乱想法”倒给AI整理,这会不会让人的表达和思考能力变弱?

原文标题:ChatGPT语音杀入桌面!你负责动嘴,一群AI负责干活

原文作者:数据派THU

原文内容

图片
来源:新智元
本文约3000字,建议阅读5分钟
一个语音功能背后,藏着一条更大的路线:OpenAI想让ChatGPT做你的「AI工作操作系统」。



近日,Andrej Karpathy分享了一个他自己很爱用的懒办法:想让AI干活,又懒得一个字一个字把需求打清楚,怎么办?

他说,那就靠回椅背切到语音,意识流全开,说个10分钟,一团乱麻、怎么说都行。

有时开口先和AI声明一句「切语音识别了,别介意错别字」。

神奇的是,他发现AI特别擅长把这种又长又乱的碎碎念重新拼起来,回给你的版本,往往比你自己说的还干净:你脑子里那团纠缠的想法被它捋顺了,来回纠偏的次数也变少了。

这正是Andrej Karpathy自己跟AI打交道最顺手的一种方式。

用他的话说,这能改善人和模型之间的「心智融合」,人常常懒得把一件事的来龙去脉一个字一个字敲清楚,那还不如干脆开口,把整团乱麻一股脑倒出去。

语音的价值不在解放双手,而在把上下文高带宽地倒给AI。

就在这几天,OpenAI干脆把这套「用嘴指挥AI」的玩法,直接搬进了桌面。

桌面版ChtGPT 现在能用嘴指挥了

7月23日,OpenAI把ChatGPT语音(Voice)正式送进桌面版App的Work与Codex场景。

当天起在macOS和Windows上全球分批推送,覆盖Plus、Pro、Business、Edu、Enterprise各档,Android即将跟上,iOS则通过Remote配对远程接入。

它的底层,是7月8日刚上线的新一代语音模型GPT-Live,能同时听和说:你随时打断,它接着你最新那句往下走,而不再是老式那种「先录音、再转文字、然后回你一句」的笨办法。

关键在于,这次语音不只是拿来闲聊。

在Work和Codex里,你张嘴就能启动一个任务、问它跑到哪了、看某个智能体现在什么状态,还能在同一段对话里同时协调好几个Agent,让它们各干各的。

任务在后台跑着,你随时插一句让它换方向;它卡住了或干完了,会主动开口,或在屏幕上给你提个醒。

它甚至能顺着你手头的活儿往下接:调用已有的项目上下文,连上文档、日历、联系人和通讯记录,把一件做了一半的事收尾。

官方也给出了一些日常生活实例:让它查日历有没有冲突、翻邮箱看航班改没改、顺手把会议纪要备好,「趁你泡咖啡或者忙别的」,这些活在后台自己就跑完了。

macOS上还多一手Appshots和屏幕上下文,能直接读你当前最前面那个窗口,结合本地文件和代码库一起理解,热键也能自定义。

Codex加ChatGPT Work的周活已经过了1000万。

OpenAI发的宣传片里有个画面很有意思:几名工程师站在同一个房间,对着同一个桌面会话,各说各的指令:一个AI,一屋子人围着它下命令。

这大概就是他们想象的「群体编程派对」。

OpenAI用一段居家场景演示ChatGPT Voice:开口把想做的事说给桌面版Codex,它在后台接着干。

打字是AI输入瓶颈 但语音不是

这当然不是OpenAI一家心血来潮。

几乎同一周,三个行业大佬几乎不约而同地把票投给了「语音」。

Karpathy在X上发帖,他说上下文太多、又懒得打字的时候,就乱聊一通,让AI去整理。

一位Grok的铁粉转发了Karpathy的帖子,说自己早用惯了Grok的语音转文字,「现在打字都觉得像上刑」,还顺便吐槽了Anthropic的语音输入「其实还挺基础的」。

马斯克把这条又转了出去,补上一句:你可以像跟人说话一样,用Grok Build把任务交给Grok去干。

奥特曼也不忘推销自己新一代语音模型GPT-Live。

他自曝一向更爱打字不爱跟AI说话,但如今他跟ChatGPT「说的已经比打的多了」。

他还专门点出:当你有一大堆上下文要一次性倒给AI的时候,语音最好用。

让三位大佬兴奋的,其实不是「终于能用嘴了」这么简单。

这背后藏着这样一个逻辑:智能体越来越强,你要喂给它的意图也越来越复杂,键盘这条管道就开始拥堵了:

你打得越省事,模型拿到的信息就越干瘪。

而语音输出,则是天生的宽管道:你能一口气把前因后果、顾虑偏好全说出来,哪怕说得乱,模型也能兜住,再替你把那团意识流理清楚。

社区里已经有人实测:语音吞吐大概每分钟240个词,打字顶多70到80个词,差了三四倍。

GPT-Live把重活甩给后台的GPT-5.5、GPT-5.6去想,前台只管让对话流畅地接住你,这套解耦,恰恰是为了让人们可以随便开口。

说到底,人脑里的想法本就是并行的、跳跃的,键盘却逼你压成一行一行的字。

而语音让这道墙松动了:它正从一个「偷懒的输入法」,变成一个「高带宽的上下文入口」。 

一句话,打字是AI输入的瓶颈,但语音不是。

语音输入背后 是「用嘴管项目」

OpenAI这次真正塞进桌面版的,是让语音去「管AI」。

按官方FAQ,在Work和Codex里,你开口能干这些事:启动一个任务,给几个任务排优先级,中途打断、掉头改方向,而活儿在后台继续跑。

更进一步,它能在多个对话和项目之间,协调好几个智能体一起干。你说一句「A先做,B先挂着,C出结果了叫我」,后台就照着重排。

它还能接着上次的活儿往下干。靠的是项目上下文,加上连接进来的工具,你的文档、日历、联系人、通讯记录。

任务卡住了或者干完了,它会用语音或者屏幕上的提示告诉你一声。

这已经不是语音输入法的活儿了,它更像一个中枢,你在上面调度一支智能体团队。

同样是开口和AI说话,以往是让AI听懂你,现在是让AI替你干活。

ChatGPT想当的 是你的「AI工作操作系统」

一个语音功能背后,藏着一条更大的路线:OpenAI想让ChatGPT做你的「AI工作操作系统」。

这几个月,OpenAI一直在重做桌面版ChatGPT,把Chat、Work、Codex放进了同一个入口,一键切换,在后台长期跑着。

Codex,也早扩成了能并行多个智能体、跑长任务、读懂整个项目的通用平台。

为什么把这套能力放桌面,而不是留在人人都在用的手机上?

主要是因为手机那块小小的聊天框干不了复杂活儿,它适合随口问两句。

真要让AI连着你的文件、代码和软件,把一件事从头做到尾,它就得待在你的电脑里:

桌面才有文件、集成开发环境(IDE)、浏览器、一整套企业办公软件,这才是智能体干活的主战场。

这背后,是一次人类与AI交互方式的翻转。

过去你用AI,是在「操作软件」:打开、输入、等待,一个回合一个回合地来。

现在你更像个带团队的经理:开口把任务分下去,你和AI的关系,从「你问它答」,悄悄变成了「你说它做」。

一位重度用户干脆说,这套东西用起来「基本就是贾维斯」。

他甚至让Codex帮自己配了个快捷键,一开口就能在三台机器、几块屏幕之间来回切换。

回到开头那个场景,真正让马斯克、奥特曼、Karpathy等大佬们兴奋的,不是可以扔掉键盘了,而是当输入不再是瓶颈,人可以把省下来的那点脑力,还给真正值得琢磨的事:决策。

所以下一个问题,其实不是「你能不能开口」,而是当你面前站着一屋子随叫随到的AI,你到底想让它们,替你做什么。

参考资料:

https://x.com/OpenAI/status/2080378182469857576
https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy
编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



这个问题挺像当年多核CPU。普通人不会说“我需要8个核心”,但会说“电脑别卡”。多Agent如果做得好,用户感知到的不是一群AI,而是任务更快、更稳、更少打断。

2 个赞

多Agent对个人用户的价值,可能不在数量,而在角色感。一个负责查资料,一个负责写草稿,一个负责挑错,听起来像小团队。前提是它们别互相甩锅,也别同时给我三份看不懂的结果。

1 个赞

我反而觉得键盘会更重要。语音能让你说得多,但说得多不代表说得准。最后要把任务边界、验收标准、风险点钉死,还是文本更可靠。语音是入口,文字是契约。

3 个赞

我倒不太担心。人类本来就靠工具思考,从纸笔到思维导图再到搜索引擎,没哪个是纯靠脑子硬扛。关键是你最后有没有检查AI整理出来的东西,而不是闭眼照收。

2 个赞

回答“便利和隐私怎么取舍”:我的底线是分级授权。日历可以给,邮件只给特定标签,代码仓库按项目给,通讯录最好别全量开放。AI越像助理,权限管理就越像公司里的IT权限,不该一把梭。

3 个赞

这个问题不能只靠用户“自己注意”。普通人哪知道一个桌面AI读了多少文件、缓存了什么、会不会被拿去训练?产品层面至少要有清晰的权限面板、操作日志和一键撤销,不然就是便利包装下的黑箱。

2 个赞