AI 早报 2026-07-24
概览
要闻
- ChatGPT 桌面应用推出 ChatGPT Voice,支持语音控制电脑并协调多个Agent
#1 - Anthropic 更新 Claude 语音模式,支持更强模型并可调用第三方应用
#2
模型发布
- Black Forest Labs 发布 FLUX 3 多模态模型
#3 - Ant Ling 发布 Ling-3.0-flash 模型,多平台限时免费开放
#4 - inclusionAI 发布 LLaDA2.2-flash 面向 Agent 的扩散语言模型
#5 - KwaiKAT 发布 KAT-Coder-V2.5-Dev 开源权重
#6
- PaddlePaddle 发布 HPD-Parsing 模型,主打高吞吐文档解析
#7 - SpaceXAI 宣布 Grok 4.5 模型全面上线多平台
#8 - 微软宣布MAI-Image-2.5-Pro与MAI-Voice-2-Flash进入公测阶段
#9
开发生态
- OpenAI 宣布 Codex 支持多文件夹配置项目及站点分析公测
#10 - MiMo Code 将于 7 月 26 日结束免费使用阶段
#11 - Runway 推出 Runway Media Router,自动匹配生成式媒体模型
#12
产品应用
- OpenAI 面向美国成年用户推出 ChatGPT Health 功能
#13 - Google 向美国 Google AI Pro 订阅者推出 Gemini Spark
#14
行业动态
- 马斯克呼吁 AI 公司发布前沿模型前互相审查,政府干预应为最后手段
#15 - 字节跳动Seed团队启动Seed STEM科学家计划
#16 - AI芯片初创公司Etched完成3亿美元C轮融资 估值翻倍至103亿美元
#17 - 有关部门回应白宫指责月之暗面:反对科技经贸问题政治化
#18 - 北京四部门联合印发加快智能体引领发展若干措施
#19
ChatGPT 桌面应用推出 ChatGPT Voice,支持语音控制电脑并协调多个Agent #1
OpenAI在ChatGPT桌面应用中正式推出ChatGPT Voice功能,支持特定付费用户通过语音在Chat、Work和Codex中直接控制电脑并协调多个Agent。同时,iOS端也可通过配对远程访问在Codex中使用语音。语音对话使用独立的、按
滚动五小时窗口计量的配额限制,配额取决于订阅方案。
OpenAI宣布,ChatGPT Voice功能已在 ChatGPT 桌面应用中上线。
该功能由GPT-Live驱动,目前已向ChatGPT Plus、Pro、Business、Edu和Enterprise订阅方案用户开放。
用户可在macOS和Windows桌面应用中开启语音对话,实现自然的多轮交流,并在对话中发布任务、检查进度或改变方向。
同时,iOS用户也可通过配对远程访问在Codex中使用语音,Android支持据称即将推出。
同一时间内,整个ChatGPT桌面应用只能有一个活跃的语音聊天。
语音对话使用独立的、按滚动五小时窗口计量的配额限制,配额取决于订阅方案。
https://learn.chatgpt.com/docs/features/voice
https://x.com/OpenAI/status/2080378182469857576
Anthropic 更新 Claude 语音模式,支持更强模型并可调用第三方应用 #2
Anthropic 为 Claude 的语音模式推送更新,即日起用户可在语音对话中使用 Opus 和 Sonnet 等更强模型,并能在对话中途调用邮箱和日历等第三方工具。
Anthropic 宣布 Claude 语音模式迎来更新。
用户现在可以在语音对话中使用 Opus 和 Sonnet 模型,而非此前的 Haiku 默认模型。
同时,该语音模式还能在对话中途连接 Gmail、Google Calendar、
Slack、Canva 和 Notion 等第三方应用来执行更新会议、起草邮件等操作。
语音模式目前已支持 十余种语言,但需要用户手动指定对话语言。
本次更新以公开测试版形式向所有用户推出,覆盖移动端、桌面端和网页端。
免费用户将仅限使用 Haiku 模型且只能连接 一个 第三方应用。
https://x.com/claudeai/status/2080376094939603366
Black Forest Labs 发布 FLUX 3 多模态模型 #3
Black Forest Labs 发布多模态模型 FLUX 3,在统一架构下联合学习图像、视频和音频。根据官方初步评估数据,FLUX 3 在视频生成对比中,偏好率稍微领先于
Gemini Omni Flash 和 Seedance 2.0。FLUX 3 Video 已开放抢先体验,FLUX 3 Image 计划在未来几周内进入抢先体验,FLUX 3 Dev 开放权重版本也在推出计划中。
Black Forest Labs 正式发布多模态基础模型 FLUX 3,该模型基于 Self-Flow 方法,在统一架构下联合学习图像、视频和音频,同时支持机器人动作预测。
FLUX 3 可单次生成最长 20 秒 带原生音频的视频,并具备图像合成与编辑能力。
根据官方初步评估数据,FLUX 3 在视频生成对比中分别以最高 69% 和 60% 的偏好率略微领先于 Gemini Omni Flash 和 Seedance 2.0。
目前
FLUX 3 Video 已开放抢先体验,FLUX 3 Image 计划在未来几周内进入抢先体验,FLUX 3 Dev 开放权重版本也在推出计划中。
https://bfl.ai/blog/flux-3
https://bfl.ai/models/flux-3
https://bfl.ai/blog/flux-3-mimic
Ant Ling 发布 Ling-3.0-flash 模型,多平台限时免费开放 #4
蚂蚁百灵发布 Ling-3.0-flash。该模型总参数为 124B,激活参数 5.1B。官方称其多数基准测试表现达到或超越自家
1T 旗舰模型,目前该模型已在多个平台上线并开放 限时免费使用。
蚂蚁集团百灵大模型团队发布了混合推理 MoE 模型 Ling-3.0-flash,专为生产级 Agent 工作负载设计。
该模型总参数为 124B,每 token 仅激活 5.1B。
官方称其在多数展示的基准测试中,表现达到或超越了该团队此前的 1T 旗舰模型。
模型原生支持 256K 上下文并可扩展至 1M。
目前已上线 OpenRouter、Vercel AI Gateway 等多个平台并开放限时免费使用。
https://x.com/AntLingAGI/status/2080351022028095681
https://vercel.com/changelog/ling-3-0-flash-is-now-available-on-ai-gateway
inclusionAI 发布 LLaDA2.2-flash 面向 Agent 的扩散语言模型 #5
inclusionAI 发布 LLaDA2.2-flash 扩散语言模型。该模型引入 Levenshtein Editing 机制,支持 128K 上下文,已在 Hugging Face 和 ModelScope 上线。
蚂蚁集团inclusionAI 发布了 LLaDA2 系列中的 Agent 导向 MoE 扩散语言模型 LLaDA2.2-flash。
通过引入 Levenshtein Editing(含 DELETE 和 INSERT 控制标记)实现扩散解码过程中的序列结构编辑与纠错。
模型总非嵌入参数量为
100B,上下文窗口扩展至 128K。
引入 Block Routing 将 MoE 专家激活限制在扩散块级别,以支持高效长上下文 Agentic 工作负载。
模型已在 Hugging Face 和 ModelScope 上线,许可为 Apache License 2.0。
SGLang 部署支持即将推出。
https://huggingface.co/inclusionAI/LLaDA2.2-flash
https://modelscope.cn/models/inclusionAI/LLaDA2.2-flash
KwaiKAT 发布 KAT-Coder-V2.5-Dev 开源权重 #6
快手 KwaiKAT 团队发布 KAT-Coder-V2.5-Dev 模型权重,该模型基于 Qwen3.6‑35B‑A3B 后训练,在多个 Agentic Coding 基准测试上取得同参数量级的领先结果。
快手 KwaiKAT 已将 KAT‑Coder‑V2.5‑Dev 的模型权重在 Hugging Face 开源。
该模型基于 Qwen3.6‑35B‑A3B 进行后训练,总参数 350 亿、激活参数 30 亿。
在 SWE‑bench Verified、Multilingual、Pro 和 Terminal‑Bench 2.1 等 Agentic Coding 基准测试中均取得当前同参数量级的领先结果。
使用 Apache 2.0 许可。
仅包含语言模型权重,不包含视觉/多模态组件,支持通过 vLLM、SGLang 等框架部署。
https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev
https://arxiv.org/pdf/2607.05471
PaddlePaddle 发布 HPD-Parsing 模型,主打高吞吐文档解析 #7
PaddlePaddle发布1B参数文档解析模型HPD-Parsing。它基于InternVL3.5-1B,引入分层并行解码与渐进式多词元预测技术,破解长文档解码瓶颈。该模型在OmniDocBench v1.6基准取得94.91%准确率。
百度PaddlePaddle 目前在 Hugging Face 上发布了 HPD-Parsing,这是一个 1B 参数的轻量级高吞吐量文档解析模型。
该模型基于 InternVL3.5-1B 骨干网络,引入了分层并行解码范式与渐进式多词元预测技术,将传统的单页自回归生成重构为全局协调的局部并行解码。
官方数据显示,HPD-Parsing 在 OmniDocBench v1.6 基准测试中达到 94.91% 的总体准确率,同时实现了每秒 4752 个令牌的峰值吞吐量。
目前用户可通过 Hugging Face 平台获取该模型的权重,官方也同步提供了在线演示。
https://huggingface.co/PaddlePaddle/HPD-Parsing
https://huggingface.co/spaces/hugging-apps/hpd-parsing
https://arxiv.org/abs/2607.18839
SpaceXAI 宣布 Grok 4.5 模型全面上线多平台 #8
SpaceXAI 官方宣布 Grok 4.5 模型目前已在 grok.com、X 以及 iOS 和 Android 应用中全面上线。
SpaceXAI 官方宣布 Grok 4.5 模型现已全面登陆 grok.com、X 及 iOS 和
Android 应用平台。
根据官方说明,Grok 4.5 是其目前最强大的模型,能更好地理解用户提问并跟踪更长对话。
此外,该模型提升了推理效率以更快给出答案,并能承担处理电子表格、转换幻灯片和提取长PDF要点等知识工作。
SpaceXAI 还指出,用户可通过 Microsoft 365 加载项在 Word、Excel 等软件中直接使用该模型。
https://x.ai/news/grok-4-5-everywhere
微软宣布MAI-Image-2.5-Pro与MAI-Voice-2-Flash进入公测阶段 #9
Microsoft AI 宣布,其 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 两款模型已进入公测阶段。这两款模型已为必应图片创建器和PowerPoint 等多项微软产品提供支持。
微软人工智能部门宣布旗下两款自研模型 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 进入公测阶段。
官方称这两款模型已经在微软的多项核心产品中投入生产。
为必应图片创建器、PowerPoint 的图片生成与编辑、OneDrive 的图片编辑以及 Dynamics 365客服中心的语音智能体提供支持。
此外,
MAI-Transcribe-1.5转录模型现支持 58 种语言。
正用于医疗笔录解决方案 Dragon Copilot。
https://microsoft.ai/news/introducing-mai-image-2-5-pro-and-mai-voice-2-flash/
OpenAI 宣布 Codex 支持多文件夹配置项目及站点分析公测 #10
OpenAI 开发者账号宣布,Codex 本地项目现已支持读取和写入多个文件夹的代码与文件,并保留一个主文件夹作为 Git 根目录。同时,用于查看 Codex 发布站点基本性能指标的 Sites Analytics 功能已进入公开测试。
OpenAI 开发者账号宣布对
Codex 进行两项功能更新。
首先,Codex 本地项目现已支持包含来自多个文件夹的相关代码、文档和参考文件,Codex 能够跨这些文件夹进行读取和写入。
在这一机制下,其中一个主文件夹将作为 Git 根目录,负责处理 Git 操作、审查、pull requests、AGENTS.md 以及技能发现。
其次,名为 Sites Analytics 的新功能现已进入公开测试阶段,为用户使用 Codex 发布的站点提供基本的性能指标。
https://x.com/OpenAIDevs/status/2080383045472075856
https://x.com/OpenAIDevs/status/2080390328880951299
MiMo Code 将于 7 月 26 日结束免费使用阶段 #11
小米MiMo团队宣布,MiMo Code 将于 7 月 26 日 18:00 结束免费阶段。此后用户需订阅 Token Plan 才能继续使用,首次订阅可享 88 折优惠。
小米MiMo团队宣布,MiMo Code 的免费使用阶段即将结束,自 7 月 26 日 18:00 起正式生效。
限免结束后,用户需要前往 MiMo 开放平台订阅 Token Plan 才能继续享用 MiMo Code。
目前首次订阅 Token Plan 的用户可以享受 88 折优惠。
https://platform.xiaomimimo.com/token-plan
Runway 推出 Runway Media Router,自动匹配生成式媒体模型 #12
Runway 宣布推出 Runway Media Router。该功能是内置于 Runway Dev 平台的生成式媒体模型路由,可自动为视频、图像或音频请求选择最佳模型。
Runway 在
Runway Dev 平台推出并上线了 Runway Media Router。
作为官方所称的“世界首个”面向生成式媒体的偏好优化路由,它能根据用户设定的成本、延迟和质量偏好,自动为视频、图像或音频生成请求匹配合适的模型。
用户可以在平台门户中设置价格上限,并配置允许或拒绝的提供商与模型名单,系统会据此筛选并调用得分最高的模型。
该功能目前已面向 Runway Dev 用户开放,支持视频、图像和音频模型。
https://runway.com/news/company-news/introducing-runway-media-router
OpenAI 面向美国成年用户推出 ChatGPT Health 功能 #13
OpenAI 宣布
ChatGPT 的 Health 功能目前已向 美国 18 岁及以上用户推出。用户可连接 Apple Health 和医疗记录,在对话中结合个人健康数据获取更个性化的参考。
OpenAI 正式向美国 18 岁及以上的 ChatGPT 用户推出 Health 功能,覆盖网页端和 iOS 端的 Free、Go、Plus 和 Pro 套餐。
该功能允许用户安全连接 Apple Health、部分美国医院系统及 One Medical 等支持的医疗记录,ChatGPT 将在获得用户许可后,结合这些数据回答健康问题、追踪指标变化并提供上下文参考。
根据官方说明,用户连接的医疗数据和生成的相关对话不会被用于训练 OpenAI 的基础模型或定向投放广告。
目前该功能尚不支持
Codex,且根据用户反馈,暂不支持直接连接 Google Health 或 Fitbit。
https://openai.com/index/health-in-chatgpt/
https://x.com/OpenAI/status/2080339982288568709
Google 向美国 Google AI Pro 订阅者推出 Gemini Spark #14
Google 正向美国 Google AI Pro 订阅用户推出 Gemini Spark。官方称 Gemini Spark 很快将扩展至更多国家的 AI Pro 订阅用户。
Google 目前正开始向美国境内的
Google AI Pro 订阅者推出个人 AI agentGemini Spark,当前版本为英语。
官方称 Gemini Spark 是一款在后台全天候运行、按用户指示完成任务的助手,且用户可让其帮忙设置首项技能和任务。
此前,Gemini Spark 已向更多国家和语言的 Google AI Ultra 订阅者推出。
Google 表示,很快将把 Gemini Spark 带给更多国家的 AI Pro 订阅者。
https://x.com/GeminiApp/status/2080401074083799229
https://support.google.com/gemini/answer/17171264?hl=zh-CN
马斯克呼吁 AI 公司发布前沿模型前互相审查,政府干预应为最后手段 #15
马斯克提议,领先 AI 公司发布前沿模型之前应互相审查。他建议竞争对手定期沟通安全问题以互相监督,将政府干预作为最后手段。
埃隆·马斯克在接受采访时提议,OpenAI、Anthropic 和 SpaceXAI 等前沿 AI 公司应在发布最先进模型前互相审查。
他表示政府缺乏足够的技术深度,因此政府干预应仅作为公司拒绝修复安全问题时才启用的最后手段。
马斯克强调此机制应立即实施,并愿意为此搁置与 OpenAI 首席执行官的个人分歧。
目前,这些公司虽通过前沿模型论坛共享漏洞信息,但并未共享未发布的模型。
https://fortune.com/article/elon-musk-says-rival-ai-labs-should-peer-review-frontier-models-before-release-with-government-as-last-resort/
字节跳动Seed团队启动Seed STEM科学家计划 #16
字节跳动 Seed团队启动 Seed STEM 科学家计划,邀请 100 位前沿科学学者共同合作。首期约持续
6 个月,现已开放申请。
字节跳动Seed团队正式启动Seed STEM科学家计划,邀请 100位 前沿科学领域学者围绕真实科研问题展开合作。
该计划面向STEM相关领域已获或正在攻读博士学位及同等研究水平人员,提供科学家顾问与博士实习生两种参与方式。
参与者可获得充足算力资源、专业团队协作机会及竞争性薪酬。
首期计划约持续 6个月,需在办公现场协作,目前工作地点确认在北京海淀区。
申请者需通过飞书账号提交包含简历的申请材料,申请截止时间为 2026年9月30日。
https://seed.bytedance.com/zh/seedstem
https://bytedance.larkoffice.com/share/base/form/shrcnvPJHbfgPhEo10goHD7I0IQ
AI芯片初创公司Etched完成3亿美元C轮融资 估值翻倍至103亿美元 #17
专注加速 AI 推理的芯片初创公司 Etched 宣布完成 3 亿美元C 轮融资,估值达 103 亿美元。公司称新资金将加速其定制芯片及推理系统的生产,目前系统仅供投资方与早期客户测试。
致力于研发加速 AI 推理系统的芯片初创公司 Etched 完成 3 亿美元C 轮 融资。
由 Sequoia 领投。
估值达 103 亿美元。
公司称这是 Sequoia 领投的 C 轮 中估值最高的一次。
该轮融资将用于加速其推理集群的生产与交付。
Etched 从头设计了针对推理预填充阶段的 低压芯片 以及用于生成解码阶段的
集群级内存。
称其系统能运行包括 DeepSeek 在内的任何 AI 模型。
尽管公司已获 10 亿美元 订单。
但联合创始人承认硬件目前仅供投资者和早期客户测试使用。
距离大规模量产交付仍有距离。
https://x.com/Etched/status/2080307393699987849
有关部门回应白宫指责月之暗面:反对科技经贸问题政治化 #18
针对 白宫官员 指责月之暗面一事,有关部门发言人作出回应。他表示,中方一贯反对将科技经贸问题政治化、工具化,这种行径只会干扰全球人工智能的发展进程,不符合任何一方利益。
针对 白宫官员 指责 月之暗面 一事,有关部门发言人 在例行记者会上回应了关于 白宫高级官员 指责中国公司
月之暗面 蒸馏 Anthropic 模型的提问。
他表示,中国人工智能的发展得益于秉持共商共建共享理念,中方一贯反对将科技经贸问题政治化、工具化。
他强调,这种行径只会干扰全球人工智能的发展进程,不符合任何一方的利益。
https://mp.weixin.qq.com/s/jjyiEECaDLwwGxKKw3RjGQ
北京四部门联合印发加快智能体引领发展若干措施 #19
北京市发改委等四部门正式印发 《北京市关于加快智能体引领发展的若干措施》 ,提出十条措施覆盖 基础模型、原生应用、终端融合、Token经济 与 安全治理 等方向。
北京市发展和改革委员会等四部门联合制定 《北京市关于加快智能体引领发展的若干措施》。
文件提出十条措施,旨在推动代理式人工智能技术创新,率先培育智能经济新形态,加快建设全球人工智能创新高地。
措施覆盖从基础模型能力提升到终端产品融合、从创新创业新模式到Token经济培育的完整链条。
并将符合条件的智能体终端新产品纳入家电以旧换新及数码和智能产品购新范围。
https://www.beijing.gov.cn/zhengce/zhengcefagui/202607/t20260723_4781085.html
提示:内容由AI辅助创作,可能存在幻觉和错误。
作者橘鸦Juya,视频版在同名哔哩哔哩。欢迎点赞、关注、分享。