01 谷歌Gemini 3.5 Pro被曝7月17日发布:据爆料,谷歌计划于7月17日发布旗舰模型Gemini 3.5 Pro,支持200万Token超长上下文窗口,并引入全新“深度思考”推理模式。泄露测试显示,其在SVG生成和界面设计等前端任务上表现优于Anthropic的Claude Fable 5,但在复杂推理和工程任务上仍有差距。02 腾讯混元发布并开源 Hy3 模型:腾讯混元发布并开源了 Hy3 大模型正式版,该模型总参数295B,激活参数21B,支持 256K 上下文。官方称其性能比肩参数规模大2-5倍的旗舰模型,幻觉率较预览版大幅降低,已在腾讯云API、元宝等上线。03 ChatGPT for PowerPoint上线,面向全球所有用户:OpenAI宣布ChatGPT for PowerPoint正式面向全球所有用户上线,用户可直接在 PowerPoint 中创建、编辑、理解和润色演示文稿。目前已上线测试版。
04 阿里千问升级Fun-ASR-Realtime实时语音识别模型:阿里于2026年7月6日升级实时语音识别大模型Fun-ASR-Realtime,单模型支持30种语言和16种方言,识别准确率接近离线模型,首字延迟在百毫秒级别。该模型已成功应用于影视飓风100小时荒岛直播,全程提供实时字幕支持。
05 OpenAI 发布 GPT-Realtime-2.1 与 2.1-mini 语音模型:OpenAI 发布 GPT-Realtime-2.1 及 GPT-Realtime-2.1-mini 两款实时音频模型。GPT-Realtime-2.1显著改善了字母数字信息的处理,GPT-Realtime-2.1-mini 首次在mini系列引入推理与工具调用能力。06 xAI正式更名为SpaceXAI,官方账号同步启用:xAI 宣布正式更名为 SpaceXAI,其 X 平台官方账号已变更为 @SpaceXAI,同时更换了新的 Logo。
07 OfficeCLI为Agent设计的开源Office套件:OfficeCLI是全球首个专为Agent设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成“渲染→查看→修复”的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。08 Claude Code v2.1.202发布:Anthropic于7月6日发布Claude Code v2.1.202版本更新,重点修复了远程控制和工作流的稳定性问题。新版本在/config中新增“动态工作流大小”设置,支持控制智能体规模,工作流派生的智能体现可发射Open Telemetry属性便于追踪。
01 谷歌Gemini 3.5 Pro被曝7月17日发布:7月7日消息,据科技博主@HarshithLucky3在X平台爆料,谷歌计划于2026年7月17日正式发布其“超大杯”旗舰模型——Gemini 3.5 Pro。

该模型定位为面向复杂智能体工作流的高阶系统,旨在承担动作执行、多模态生成与长时程任务等高级推理角色。
核心升级方面,Gemini 3.5 Pro将支持高达200万Token的上下文窗口,并引入全新的“深度思考”推理模式。据流传的LMSYS Chatbot Arena截图及对比视频显示,在生成“极简等距刷卡机”SVG图形及前端界面设计任务中,Gemini 3.5 Pro被指具备更精致的界面品味和更强的生成能力,表现优于Anthropic的Claude Fable 5。

不过,此次泄露也揭示了该模型的“偏科”现象。尽管前端能力亮眼,但在仓储级软件工程和长链路推理等硬核任务上,Gemini 3.5 Pro仍被指落后于Claude Fable 5和OpenAI的GPT-5.6。

此次发布距谷歌I/O大会已推迟两个月,据称是因团队选择推倒重来、进行了全新的预训练。
腾讯混元团队正式发布 Hy3 大模型。该模型为 MoE 架构,总参数 295B、激活参数 21B,支持 256K 上下文窗口,并已以 Apache 2.0 协议开源。

官方称,Hy3 在后训练数据质量与 RL 算力规模上显著提升,Agent 能力、推理与长上下文表现可比肩参数规模为其 2-5 倍的更大尺寸旗舰模型。
在内部 270 位专家盲测中得分 2.67/4,优于 GLM5.1,且工具调用稳定性、抗幻觉及多轮意图保持等体验指标大幅改善,幻觉率从 12.5% 降至 5.4%。

目前,元宝已接入 Hy3 并免费向用户提供文件生成、数据分析与网页制作等功能。
腾讯云API 价格为每百万 tokens 输入1元,输出4元。同时在 OpenRouter、Nous Portal和CodeBuddy等多平台提供两周限时免费体验。
03 阿里千问升级Fun-ASR-Realtime实时语音识别模型:
2026年7月6日,阿里千问正式升级实时语音识别大模型Fun-ASR-Realtime,相关API已上线阿里云百炼平台。该模型作为一款流式语音识别模型,首字延迟控制在百毫秒级别,话音刚落即可呈现文字,流式识别准确率接近离线模型水平,实现了实时性与高精度的统一。
在语言覆盖能力上,Fun-ASR-Realtime单模型支持30种语言和16种方言。在覆盖八大方言区的16种方言识别测试中,模型字符准确率平均达88.62%,在12类方言上领先火山与腾讯相关产品。
在实际应用场景中,Fun-ASR-Realtime在7月2日结束的影视飓风“重返荒岛”100小时直播节目中全程提供实时字幕支持,累计识别字幕6万余条、共计132万字。多人频繁切换说话、暴雨等复杂环境下,模型表现稳定,还具备上下文理解纠错能力。

此外,模型面向泰语等东亚、东南亚多语言场景进行了专项优化,识别准确率提升20%,可广泛应用于出海客服、国际会议等场景。其离线版本Fun-ASR-Flash在AI评测平台Artificial Analysis上以1.7%的字错率位列全球第一。