社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

实测ChatGPT新语音与豆包唠嗑,效果有点搞笑

智东西 • 2 月前 • 151 次点击  

全双工架构已成语音模型共识。
作者 |  陈骏达
编辑 |  心缘
智东西7月9日报道,今天,OpenAI推出了其史上首款支持“边听边说”的全双工实时语音模型GPT-Live,提供GPT-Live-1与GPT-Live-1 mini两个版本。

与此前的ChatGPT高级语音模式不同,GPT-Live能够像真人一样在倾听的同时持续思考和表达,不再需要等待用户完全说完才开始回复。用户可以随时打断、补充、追问,模型也会根据对话节奏实时调整回应方式,甚至用“嗯”、“对”、“我在听”等语气词表达倾听状态。


GPT-Live还实现了语音交互与深度推理能力的拆分,GPT-Live负责维持实时对话,而复杂搜索、深度推理等任务则交由后台模型GPT-5.5并行处理。这意味着即便模型正在执行搜索或复杂思考任务,对话本身也不会被迫中断。

▲GPT-Live-1与GPT-5.5的协作模式(图源:OpenAI)

GPT-Live的上述能力,与几个月前上线的豆包全双工语音模型颇为类似。我们也让豆包和GPT-Live简单聊了会儿天(女声是豆包,男声是GPT-Live),他俩可以自然对话,懂得互相等待、不插话,都支持打断和联网搜索。至于延迟方面,在这段对话中GPT-Live略胜一筹。


目前,GPT-Live已经上线ChatGPT应用、网页端,其API服务将在未来推出。在App中,用户只需双击语音交互按键就可以进入Live模式,直接与GPT-Live对话。
智东西第一时间对GPT-Live进行了体验测试。整体来看,其最明显的变化是交互流畅度大幅度升级,在实时翻译、长对话、搜索问答等场景下,GPT-Live已经能够呈现出接近真人交流的互动节奏。

01.
支持灵活打断、边听边说
可胜任同声传译任务


过去几年,大模型语音交互始终存在一个明显短板:对话不够自然。无论是早期的Siri等语音助手,还是后来的ChatGPT语音模式,本质上仍然遵循“你说一句、我答一句”的轮次式交互逻辑,中间不可避免地出现停顿、等待甚至误打断。
OpenAI此次推出的GPT-Live,试图解决的正是这一问题。
从技术架构来看,GPT-Live最大的变化在于采用了全双工(Full Duplex)架构。简单来说,模型不再需要等待用户说完再开始处理信息,而是能够像真人一样实现“边听边说”。
我们用一个同声传译的案例考察了GPT-Live的这一能力,在这个场景下,GPT-Live需要在我说完所有内容之前,就开始输出翻译结果。
从下方案例可以看到,在我开始说话大概8秒钟之后,GPT-Live就输出了第一句英文翻译,同时,它也准确“听见了”我后续说的所有内容,基本实现了实时翻译。这种翻译质量和体验已经和一个真人同声传译译员没有明显差距了。
在实际对话过程中,GPT-Live会持续接收音频输入,并实时判断当前最合适的动作:继续倾听、插入回应、暂停等待、打断补充,或者调用工具执行任务。
比如,在下方这个案例时,当我停顿思考时,模型不会急于抢话;当我想要补充内容时,也可以随时插话打断;讨论过程中,GPT-Live还会通过“嗯”、“明白了”、“对”等自然语气词表达正在认真倾听。
此次,OpenAI还在语音交互的UI画面上做了创新。如今,在与用户语音对话的同时,ChatGPT可以展示天气、股票、体育等话题的视觉卡片。
我们尝试了下,在询问天气这个场景,ChatGPT准确给出了旧金山的天气卡片,但在给出北京的天气卡片时出现了错误,发送成东京的天气信息。
从评测结果来看,在衡量对话愉悦度和流畅度的人工评测中,GPT-Live-1、GPT-Live-1-mini的均高于旧版ChatGPT高级语音模式。也就是说,GPT-Live在处理交替对话、打断等复杂场景的表现,以及整体的质量都有了明显提升。
OpenAI为GPT-Live重新制作了ChatGPT中的九个不同语音。这些语音的风格都比较自然轻松,不过在中文场景有时会出现一些发音不准确或者错误。

02.
拆分对话与推理能力
通用基准测试得分提升明显


在GPT-Live中,OpenAI的另一大创新是将对话能力和推理能力进行了拆分,可以并行进行,而不是像传统的级联式架构那样必须依次串行处理。
分工上,GPT-Live本身负责实时交流,而当用户提出需要搜索、深度推理或复杂任务执行的问题时,它会将任务后台委派给更强大的基础模型处理。目前这一角色由GPT-5.5承担。
因此,即使模型正在执行搜索、推理任务,用户也无需等待漫长的推理过程结束。GPT-Live可以继续保持对话,并在后台结果生成后,自然地将答案带回当前交流之中。
我们对比了一下旧版ChatGPT语音交互与GPT-Live在深度搜索场景的区别。
在旧版ChatGPT语音交互中,当我问及GPT-5.5的用户反馈信息时,模型需要等待大概10多秒才能给出回复,完全打断了对话节奏。
而在与GPT-Live讨论同一个话题时,它能立刻开始回复,并且用语气词填补了搜索带来的停顿空白。
OpenAI用一个演示形象地呈现了GPT-5.5和GPT-Live的协作模式,可以看到,GPT-5.5的搜索和推理与GPT-Live的回复是有部分重叠的,也就是说GPT-Live在GPT-5.5给出完整回答之前就已经开口了。
同时,GPT-Live系列模型还支持思考强度的选择,用户可以自定义低中高三档思考强度,最低档可以获得更快的相应,而在中高档中模型会花更多时间思考,然后再给出回复。
上述能力也让GPT-Live-1在通用基准测试中,取得了优于旧版ChatGPT高级语音模式的成绩。
比如,在考察科学推理能力的GPQA、考察搜索的BrowseComp、测试Agent能力的τ³-Voice Telecom中,GPT-Live-1、GPT-Live-1-mini都断层领先于旧版ChatGPT高级语音模式。

03.
结语:语音交互
大模型的下一个核心入口?


纵观目前业界主流的语音模型,全双工架构、实时反馈、自然打断、多模态交互、后台推理协同等能力,正在成为厂商的共识。

GPT-Live的此次更新,或许可以进一步扩展ChatGPT在陪伴聊天、实时翻译、信息查询、移动办公等轻量化、高频场景中的应用边界,让用户与AI之间的交流更接近人与人之间的自然沟通。
随着模型实时理解、多任务协同和情感化表达能力持续提升,语音交互也有望从大模型产品中的一个附属功能,逐渐演变为新的核心入口之一。
图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198627