社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

谷歌Gemini 3.5 Pro被曝7月17日发布;腾讯混元发布并开源 Hy3 模型; ChatGPT for PPT面向全球所有用户开放

学术AI大模型 • 1 周前 • 58 次点击  
每日AI快讯 | 一分钟速览
01 谷歌Gemini 3.5 Pro被曝7月17日发布:据爆料,谷歌计划于7月17日发布旗舰模型Gemini 3.5 Pro,支持200万Token超长上下文窗口,并引入全新“深度思考”推理模式。泄露测试显示,其在SVG生成和界面设计等前端任务上表现优于Anthropic的Claude Fable 5,但在复杂推理和工程任务上仍有差距。
02 腾讯混元发布并开源 Hy3 模型:腾讯混元发布并开源了 Hy3 大模型正式版,该模型总参数295B,激活参数21B,支持 256K 上下文。官方称其性能比肩参数规模大2-5倍的旗舰模型,幻觉率较预览版大幅降低,已在腾讯云API、元宝等上线。

03 ChatGPT for PowerPoint上线,面向全球所有用户:OpenAI宣布ChatGPT for PowerPoint正式面向全球所有用户上线,用户可直接在 PowerPoint 中创建、编辑、理解和润色演示文稿。目前已上线测试版。

04 阿里千问升级Fun-ASR-Realtime实时语音识别模型:阿里于2026年7月6日升级实时语音识别大模型Fun-ASR-Realtime,单模型支持30种语言和16种方言,识别准确率接近离线模型,首字延迟在百毫秒级别。该模型已成功应用于影视飓风100小时荒岛直播,全程提供实时字幕支持。

05 OpenAI 发布 GPT-Realtime-2.1 与 2.1-mini 语音模型:OpenAI 发布 GPT-Realtime-2.1 及 GPT-Realtime-2.1-mini 两款实时音频模型。GPT-Realtime-2.1显著改善了字母数字信息的处理,GPT-Realtime-2.1-mini 首次在mini系列引入推理与工具调用能力。
06 xAI正式更名为SpaceXAI,官方账号同步启用:xAI 宣布正式更名为 SpaceXAI,其 X 平台官方账号已变更为 @SpaceXAI,同时更换了新的 Logo。
07 OfficeCLI为Agent设计的开源Office套件:OfficeCLI是全球首个专为Agent设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成“渲染→查看→修复”的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。
08 Claude Code v2.1.202发布:Anthropic于7月6日发布Claude Code v2.1.202版本更新,重点修复了远程控制和工作流的稳定性问题。新版本在/config中新增“动态工作流大小”设置,支持控制智能体规模,工作流派生的智能体现可发射Open Telemetry属性便于追踪。

主要日讯解读
01 谷歌Gemini 3.5 Pro被曝7月17日发布:

7月7日消息,据科技博主@HarshithLucky3在X平台爆料,谷歌计划于2026年7月17日正式发布其“超大杯”旗舰模型——Gemini 3.5 Pro。

该模型定位为面向复杂智能体工作流的高阶系统,旨在承担动作执行、多模态生成与长时程任务等高级推理角色。

核心升级方面,Gemini 3.5 Pro将支持高达200万Token的上下文窗口,并引入全新的“深度思考”推理模式。据流传的LMSYS Chatbot Arena截图及对比视频显示,在生成“极简等距刷卡机”SVG图形及前端界面设计任务中,Gemini 3.5 Pro被指具备更精致的界面品味和更强的生成能力,表现优于Anthropic的Claude Fable 5。

不过,此次泄露也揭示了该模型的“偏科”现象。尽管前端能力亮眼,但在仓储级软件工程和长链路推理等硬核任务上,Gemini 3.5 Pro仍被指落后于Claude Fable 5和OpenAI的GPT-5.6。

此次发布距谷歌I/O大会已推迟两个月,据称是因团队选择推倒重来、进行了全新的预训练。

02 腾讯混元发布并开源 Hy3 模型:

腾讯混元团队正式发布 Hy3 大模型。该模型为 MoE 架构,总参数 295B、激活参数 21B,支持 256K 上下文窗口,并已以 Apache 2.0 协议开源。

图片

官方称,Hy3 在后训练数据质量与 RL 算力规模上显著提升,Agent 能力、推理与长上下文表现可比肩参数规模为其 2-5 倍的更大尺寸旗舰模型。

在内部 270 位专家盲测中得分 2.67/4,优于 GLM5.1,且工具调用稳定性、抗幻觉及多轮意图保持等体验指标大幅改善,幻觉率从 12.5% 降至 5.4%。

图片

目前,元宝已接入 Hy3 并免费向用户提供文件生成、数据分析与网页制作等功能。

腾讯云API 价格为每百万 tokens 输入1元,输出4元。同时在 OpenRouter、Nous Portal和CodeBuddy等多平台提供两周限时免费体验。

03 阿里千问升级Fun-ASR-Realtime实时语音识别模型:

2026年7月6日,阿里千问正式升级实时语音识别大模型Fun-ASR-Realtime,相关API已上线阿里云百炼平台。该模型作为一款流式语音识别模型,首字延迟控制在百毫秒级别,话音刚落即可呈现文字,流式识别准确率接近离线模型水平,实现了实时性与高精度的统一。

在语言覆盖能力上,Fun-ASR-Realtime单模型支持30种语言和16种方言。在覆盖八大方言区的16种方言识别测试中,模型字符准确率平均达88.62%,在12类方言上领先火山与腾讯相关产品。

在实际应用场景中,Fun-ASR-Realtime在7月2日结束的影视飓风“重返荒岛”100小时直播节目中全程提供实时字幕支持,累计识别字幕6万余条、共计132万字。多人频繁切换说话、暴雨等复杂环境下,模型表现稳定,还具备上下文理解纠错能力。

支持影视飓风100小时荒岛直播!阿里升级Fun-ASR-Realtime实时识别:精度比肩离线模型

此外,模型面向泰语等东亚、东南亚多语言场景进行了专项优化,识别准确率提升20%,可广泛应用于出海客服、国际会议等场景。其离线版本Fun-ASR-Flash在AI评测平台Artificial Analysis上以1.7%的字错率位列全球第一。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198529