近日,OpenAI总裁Greg Brockman接受了媒体人Joanna Stern的专访,语音交互会不会彻底取代打字?把ChatGPT和Codex揉进同一个应用,究竟是产品进化还是自我拆台?模型内测时入侵了Hugging Face,AI安全边界应该如何把控?本次对话中,Greg Brockman就语音交互、桌面端AI Agent能力、硬件布局与苹果诉讼、IPO与算力投入等近期OpenAI热点动向进行了回应探讨。
Brockman表示,ChatGPT正在从一个问答工具演变为具备行程管理、任务执行能力的全能AI Agent,未来用户早晨醒来时,AI已完成一批工作并列出待办清单,用户只需回复是或否即可决策。公司正在构建的是一系列硬件设备家族,而非单一产品,关键在于能否打造出完整的硬件生态。
对于与苹果的商业机密诉讼,他强调公司对其他公司的机密没有任何兴趣,团队具备足够的自主创新能力。谈及ChatGPT与Codex整合引发的界面混乱与“超级应用”争议,他坦言整合是渐进式尝试,当前状态确实有些杂乱,但到今年年底工作标签页将完全无缝融入ChatGPT。针对近期Hugging Face安全事件,他解释这是团队主动降低防护级别进行的网络攻防基准测试,事件本身印证了模型在现实世界中的真实能力,也促使团队进一步加强了安全防护与对齐机制。
01
语音交互:为什么机器要更贴近人类
访谈开场,Brockman即表明了自己对语音交互的基本立场,Brockman表示,他们想做的就是让机器更加贴近使用者,目前团队的重点仍是打造更出色的模型,这种指数级的技术增长还在继续。
在此基础上,他进一步解释了语音交互为何要向人类天性靠拢:纵观机器发展史,一直是人类在委屈自己去适应机器的操作方式,而人们至今仍在窝着身子对着手机打字,长期用电脑还会导致腕管综合征。在他看来,这恰恰说明现有的交互方式是反人性的,技术本应赋能人类、改善生活,而不是让人去迁就机器。打字、发短信对人类来说并不自然,直接开口说话才更符合天性,效率也会因此大幅提升。
Brockman还谈到了新模型语音中语气词、呼吸声等拟人化细节的必要性。他指出,这类话语反馈对人类进行高带宽、高效率的沟通至关重要:如果得不到任何反馈、看不到对方点头示意,人会觉得自己是在对空气说话,思路容易被打断,也会变得不自信。他强调,AI最核心的目标之一就是解放人类的时间,让人有余力投入真实的人际互动,这也是AI作为一种全新交互形态的意义所在。
基于这种判断,Brockman认为绝大多数日常事务的交互方式终将朝语音方向演进,未来回看如今办公室里人人敲键盘的场景,会显得颇为过时。他半开玩笑地提到,现在已经有人戴着鸟嘴状的隔音面罩对着电脑说话,这类产品在亚马逊上就能买到;他自己虽不使用,但认为这恰恰反映了市场对语音交互的真实需求。他还给出了一组对比数据加以佐证:人说话与打字的词汇输出速率至少相差四倍。也正因如此,他表示自己在需要快速来回确认信息时仍倾向打字,但面对长篇叙述或深入探讨的内容,会直接选择语音。
02
桌面端语音实战:AI Agent处理行程规划
围绕语音交互的实际落地,Brockman现场演示了ChatGPT桌面端的能力。他介绍,用户在桌面端拥有的是ChatGPT的全部能力,尤其是接入ChatGPT Work后,它已是一个能真正执行操作、并与用户授权的所有接口相连的全能AI Agent。演示中,他让接入了行程收件箱的ChatGPT核对多伦多出差行程(Project Gold)中各项安排是否存在冲突,系统随后自动弹出可视化网页界面,直观展示了具体行程。
以此为例,Brockman谈到了这类AI Agent对未来工作与生活形态的改变。他认为,这种界面本质上是一种语音交互入口:用户如同在与一个具备电脑操控能力的语音助手对话,而它背后调用的是Codex以及Work平台的全部功能与算力。由此他描绘了一种可能的未来场景,用户早晨醒来时,AI Agent已完成一批工作,并生成一份待办清单,提示哪些事项卡住需要处理,比如是否批准某笔报销、是否认可某个方案;用户只需在喝咖啡时回复是或否即可。在他看来,这将推动世界走向人人都是管理者的状态,让每个人都拥有更大的杠杆效应和自主权。
03
硬件布局与苹果诉讼
谈及外界对OpenAI自研硬件设备的猜测,Brockman表示,公司正在构建的是一系列设备家族,而非单一产品。他指出,无论是硬件投入还是自研第一方芯片的逻辑,关键都不在于某一款设备本身,而在于能否搭建起完整的硬件生态并持续创造价值;具体细节目前尚不便透露,但研发的核心问题始终是:一款为AI时代打造的设备应该是什么样子,如何让它真正具备不可或缺的实用价值。至于设备发布的时间,他没有给出明确答案,只表示大家可以拭目以待,相关消息很快会公布,但肯定不是现在。
这一硬件布局也牵出了当下与苹果的诉讼。据访谈介绍,苹果正就商业机密问题起诉OpenAI,指控其在进军消费硬件领域过程中存在不正当行为,而主导设计过iPhone等产品的设计师Jony Ive目前正与OpenAI合作开发硬件,OpenAI也已招募400多名前苹果员工。对于诉讼是否会拖慢硬件研发进度,Brockman回应称,由于案件仍在审理中,他不便多谈,但强调公司对长期路线图有着坚定承诺,团队会继续专注于自身技术研发。针对是否存在不当引入竞争对手商业机密的质疑,他明确否认,表示OpenAI对其他公司的商业机密没有任何兴趣,公司本身具备足够强的创新能力,一直是站在自己的角度、用自己的方式去思考和探索。
04
创新者的窘境与AI主动服务的愿景
在被问及把所有功能整合进ChatGPT、是否面临自我颠覆的创新者窘境时,Brockman承认这一困境确实存在,但表现形式出人意料。他提到,ChatGPT每周有近十亿用户使用,全球大概有二三十亿人体验过它,相当于地球上相当大比例的人口都在使用这款产品;而团队未来的发展方向,会比2022年11月发布时的ChatGPT强大得多。
他进一步描绘了产品的演进方向:ChatGPT正走向一个不仅能回答问题、更能主动采取行动、处理事务并深度连接用户所有上下文信息的阶段。他举了一个具体例子说明这种主动性——如果AI知道用户最喜欢的乐队,会在乐队官宣到访用户所在城市、门票刚发售时主动提醒,甚至在获得用户授权后直接代为完成购票,因为好座位可能十分钟内就会售罄;当然用户也可以选择不启用这种自动购买权限。
针对这种变革可能带来的适应问题,Brockman认为需要通过市场教育向用户展示其潜力。他同时强调,团队的一大优势在于并没有把用户界面做得更复杂、堆砌更多功能,反而让它更加极简,这也是他认为语音功能会成为一个重要风向标的原因。
05
超级应用与ChatGPT、Codex的整合
谈及超级应用这一说法,Brockman坦言自己对这个词并不认同,甚至认为它已经沦为一个行业流行语,团队内部也很少使用这个说法。他解释道,这个词之所以让他不喜欢,是因为团队正在构建的东西远比一个应用宏大得多,用冰山效应来形容或许更贴切:表面上看只是一个桌面应用,但它实际上是一个顶层带有语音界面的Codex Harness,内置浏览器、具备计算机控制能力,是桌面的一个新入口,但意义远不止于此,因为整个产品正在从桌面端向云端转变。他提到,这一变化已经体现在软件工程师的日常习惯中,很多人端着处于工作状态的笔记本电脑走来走去,因为合上电脑感觉像是在倒退;而在云端为主的世界里,合上笔记本只是失去当前的本地状态,工作本身仍会在云端继续。
围绕近期ChatGPT桌面应用与Codex整合过程中出现的界面混乱问题,Brockman并不回避,承认目前的状态确实有些杂乱,这是产品迈向未来过程中的渐进式尝试。他表示,团队原本希望实现零标签页的极简体验,但也深知需要先推向市场、收集反馈,因此当前只是一个过渡状态;他判断,到今年年底,工作标签页将不复存在,会完全无缝融入ChatGPT本身。
对于外界质疑这种整合是否是把消费级产品与专业开发工具强行拼接、损害了原有近十亿用户的体验,Brockman回应称,消费者业务与Codex带来的AI Agent业务此前确实缺乏协同效应,甚至很难向外界解释清楚——即便面对企业客户,团队建议让知识工作者使用Codex时,得到的反馈往往是这工具里全是代码,难道不是专给软件工程师用的吗。正是基于这个原因,团队才彻底重构了这套体系。他透露,整合完成后产品迎来了爆发式增长,Codex用户量一周内达到五百万,两周内突破一千万。面对这种增长是否只是因为把功能强行塞进应用里的质疑,Brockman表示,在某种程度上这确实是团队的目的:让更多原本可以从AI中获得更大价值的用户,真正体验并使用AI Agent,从而让AI Agent具备大众消费级的规模。
06
IPO与算力投入
在被问及是否考虑过首次公开募股时,Brockman表示自己基本没有认真想过这个问题。他说,团队目前的核心焦点依然是研发更强大的模型,这种指数级进化仍在继续;此外还要专注于建设算力,因为世界仍然低估了未来经济在多大程度上会运行在AI基础设施之上,这也意味着未来几年需要持续的巨额投资。他表示,打磨产品、思考如何将这项技术带给每一个人,才是团队真正的重心所在。
07
Hugging Face安全事件与AI失控争议
针对近期被称为史无前例的安全漏洞的Hugging Face事件,Brockman也给出了解释。他表示,当时团队正在特定基准测试中评估模型,主动降低了网络安全防护级别,目的正是为了评估模型在网络攻防方面的能力,模型也收到了明确指令,要求利用全方位的网络攻击潜力实现目标,整个过程是在高度隔离的沙盒环境中进行的。
他坦言,最终发生的事情确实令人惊讶:一方面,基准测试准确反映了这些模型的真实能力,当前的GPT-4o代表着最先进水平,也是市面上最强的网络模型,测试印证了这一点;但亲眼目睹它在现实世界中发起攻击、串联组合多条路径的复杂程度,仍带来了极大震撼。据他介绍,模型在第三方软件中发现了一个零日漏洞,并巧妙串联多条路径突破限制,最终成功潜入Hugging Face。他认为,这是一个关键时刻,促使团队进一步加强了沙盒模型的安全防范机制;同时这件事也说明,未来需要更快地将这些强大模型部署给网络防御者,因为防御端需要投入比攻击端多得多的算力,这或许是此次事件带来的最重要启示。
对于是否应该放缓研发步伐、停下来反思这一建议,Brockman表示深入研究当然必要,这也正是团队一直在做的事情。他提到团队曾发表过一篇关于AI目标偏离的研究论文,探讨AI做出意料之外行为的问题;针对Hugging Face这一具体案例,团队果断下线了相关模型,进行了深度剖析,并升级了对齐技术,相关成果也已应用到后续迭代模型中。他认为,通过迭代部署来学习,对于真正理解这些系统在现实世界中的运作机制至关重要,但与此同时必须保持极高的响应速度,因此团队一直在不断强化安全防护措施、优化对齐机制。
面对公众对AI日益增长的抵触情绪,Brockman表示,团队非常关注公众的真实反应,并始终将赋能人类过上更好的生活视为终极目标;在开发技术时,团队坚持以人为本的原则,思考如何构建真正造福人类的技术。他认为,部分责任在于团队需要更好地与公众沟通、帮助人们看清未来,但更重要的是必须践行承诺、说到做到。
08
公众信任与数据隐私
谈及语音交互让ChatGPT进一步深入人们生活这一趋势,Brockman强调,信任是重中之重,必须每天通过实际行动去努力赢得。他表示,团队做出的每一项决策,团队内部的每一位同事,都是为了确保这项技术造福全人类的使命而聚集在一起;他希望更多人能看到团队决策的过程,看到大家在建立信任方面的深思熟虑,这也是公司创立的初心和坚持前行的动力。
针对用户对临时聊天功能是否真正保护隐私的普遍质疑,包括数据肯定都被保存了不知道他们是否真的遵守隐身模式规则等观点,Brockman回应称,倾听用户声音始终是团队工作的重点。他谈到企业级业务的考量:每家公司都将自身数据视为命脉和护城河,极其在意数据的确切存储位置,因此团队一直在构建技术解决方案,探索通过加密手段提供可验证、可审计的承诺,确保只有AI能审查这些数据,以满足更高的安全保障需求。他同时表示,这不仅是AI行业面临的问题,而是整个科技行业普遍存在的现象,某种程度上也承受着科技行业过去遗留的历史包袱和公众固有偏见;对于担心临时聊天承诺未被遵守的用户,团队会持续提供保障。
当被问及这一功能是否真的有效时,Brockman表示,尽管具体条款中有一些细节需要仔细阅读,但团队力求向用户表达清晰,这是他们坚守的底线。他进一步透露,团队正在加大技术投资,确保相关场景下的数据处理过程可审计、可验证,并在密码学层面上绝对安全;这需要一定时间,具体推出的环节和方式仍在推敲中,但这是今年一整年的核心投资方向,未来几周内会有更多相关进展公布。