▍智驾·智舱
· 特斯拉车机首接豆包大模型
7月31日起,特斯拉中国分批推送车机更新,首次接入字节豆包大模型作为语音助手:以独立App形式存在,长按方向盘右滚轮唤醒,支持“万事通”“故事会”等对话角色,另新增自定义宠物模式。
这家一贯软件自研到近乎偏执的外资头部车企而言,在座舱AI上选了本土供应商,对字节火山引擎的汽车业务来说,这比任何一张自主品牌订单都更有说服力。
· 零跑7月交付101267台,六年从月销879台走到十万,成首家单月破十万的新势力
8月1日,零跑公布7月全球交付101267台、同比增长102%,是中国造车新势力中第一家单月交付破十万的公司。从月销879台走到十万台,整整用了六年。
零跑还预告8月推出新车型A05、9月开技术发布会讲智能辅助驾驶的进展。
· 奇瑞单月出口破20万辆,比亚迪海外销量翻倍
奇瑞集团7月海外销量202533辆、同比增长70.1%,成为国内第一家单月出口突破20万辆的车企,集团整体276820台、同比增23.3%。
比亚迪7月总销419211辆,其中乘用车加皮卡的海外交付179841台、同比增长124.3%,创历史新高。
吉利7月250161辆,出口10.7万辆创单月新高,其中新能源出口62604辆、同比增长616%。
三家的共同点是国内基本盘增速平平,海外却高速增长。这意味着2026年下半年中国车企之间真正的胜负手,可能不在国内智驾功能的军备竞赛,而在海外渠道与本地化产能的铺设速度。
· 高端阵营同时失速:理想是头部里唯一同比负增长的,鸿蒙智行同比只剩13.7%
理想7月交付30468辆,同比下滑0.86%、环比下滑1.38%,是头部新势力中唯一负增长的一家。鸿蒙智行7月交付45046台,1-7月累计28.6万台、同比增长13.7%,虽然仍是增势,但在这份普遍三位数增长的榜单里已经明显掉队。
其余各家:蔚来35934台、同比增71%,极氪35837辆、同比增111%刷新品牌纪录,小鹏38027台但同比仅增4%,小米官宣连续第四个月超三万台,极狐23517台、同比增150.45%,岚图13189辆。
理想与鸿蒙智行恰好分别代表“理想系”与“华为系”两套最强势的高端产品叙事,同时在量上放缓,说明30万元以上市场的增量正在见底。而这个价位段,正是智驾功能溢价最集中的地方。
· 乐道L90上市一周年累计交付破6万台
蔚来旗下乐道品牌官宣,L90上市一周年累计交付突破6万台,称其为30万级纯电大型SUV销冠。2026款车型搭载自研神玑NX9031芯片与蔚来世界模型NWM。
对持续承压的蔚来体系而言,乐道站稳一个细分市场销冠,是其多品牌战略里少数拿得出手的确定性。
▍
大模型
· DeepSeek小模型重训之后,反超了自家更大的预览版
7月31日,DeepSeek将V4-Flash正式版(0731)API转入公测。
模型结构与尺寸与预览版相同、仅经过重新训练,agent能力大幅提升,多项指标反超尺寸更大的V4-Pro预览版。原生支持Responses API并适配Codex。
“小模型重训后反超大模型预览版”是这次最值得玩味的信号:DeepSeek把迭代重心押在了agentic后训练,而不是堆参数。
· MiniMax发布全模态生成模型H3,声称数天内开放权重
7月31日,MiniMax发布通用全模态生成模型H3:统一理解文本、图像、视频、音频上下文,输出原生立体声音视频,最长15秒、最高2K分辨率。
官方称2K档每秒生成成本不到主流旗舰模型的三分之一,并计划未来几天开放模型权重,这将是其首个开源的多模态生成模型。
把旗舰生成模型直接开权重,在全球范围内都属激进动作。考虑到闭源视频生成的商业化本就艰难,此举更像是用开源换生态位。
· 字节Seedance 2.5上线:单次生成30秒视频、支持50个参考素材
7月31日,字节Seed团队午后发布视频生成模型Seedance 2.5:单次生成30秒高质量视频并支持多轮高保真延长,参考素材上限扩到50个(30张图、10段视频、10段音频),新增白模/绿幕参考与视频局部编辑(可精准修改背景、商品、人物),原生支持十余种语言,将陆续上线即梦AI与豆包专业版,API近期接入火山方舟。
同日官宣的首批行业客户里有徐工集团、小鹏汽车,还有灵初智能、微分智飞、穹彻智能三家具身公司。视频生成模型被具身智能团队当数据引擎用,是比消费级创作更值得盯的用途——机器人缺的从来不是算法,是真实交互数据。
· OpenAI首次把模型滥用与东南亚诈骗园区写进威胁情报
8月1日,OpenAI发布了一份威胁情报报告,封禁了一个“极可能源自柬埔寨”的协同ChatGPT账号网络,线索由WhatsApp团队移交。
这个犯罪组织把大模型当成人力资源系统在用。把投资诈骗、杀猪盘、赌博和冒充执法机构四类骗术混着用——先用交友人设建立信任,再把受害者导向加密货币和现货黄金的假投资标的,另一路则冒充执法机构索要“罚款”。
诈骗方不只用ChatGPT写话术,还用它处理内部行政:起草通知、在不同母语的员工间做翻译、记录招募与移民身份、劳动条件乃至员工惩戒。
▍芯片·算力
· 韩国7月半导体出口410亿美元、同比涨178.8%,官方直接归因于AI数据中心投资
韩国7月半导体出口410.1亿美元,同比增长178.8%,连续两个月站上400亿美元;总出口988.9亿美元、同比增62.8%,为史上第二高。官方口径直接归因于“大型科技公司的AI数据中心投资项目”。电脑类出口更暴增404%至47.9亿美元,驱动力是AI基建用的固态硬盘。
这条消息对冲了一个正在成型的叙事。7月29日全球芯片股单日蒸发逾万亿美元市值,理由是“AI基建支出见顶快于预期”,三天后的海关数据显示,出货端并未见顶。不过7月环比确实是回落的(6月为1022.5亿美元的历史新高)。
▍前沿论文速览
· 千问团队:一个模型,同时会用手机、电脑、网页和搜索框
GUI(图形用户界面)是“让AI真的替人操作电脑”绕不开的一层。自动化脚本需要软件方开放接口,屏幕上有什么它就能用什么。而GUI智能体则是直接看屏幕、动鼠标、点按钮替人操作软件的模型。
难点不在看懂界面,而在跨平台之后动作空间完全不同:手机是点和滑,桌面是光标、快捷键和右键菜单,网页是滚动和表单。在一类环境里练出来的模型换个平台通常就废了,所以此前的GUI智能体大多是单平台demo。
Qwen团队这篇论文做的是一个同时覆盖手机、桌面、Web、搜索四类环境的基础智能体,移动端基准SOTA。
· Metis:让模型自己记住,而不是每次去翻笔记
现在所谓的“模型记忆”,基本是一个外挂的档案柜:把对话存进检索库,需要时搜出来、再塞回提示词里。模型本身什么都没记住,每次都是现翻笔记,搜错了就答错,笔记越厚,塞回去的成本越高。
MemTensor这篇把记忆写进架构本身。信息的压缩与检索在推理期完成,不需要梯度更新,也就是不必为了记住新东西去重训模型。
如果记忆能从外挂变成原生能力,改变的不只是长对话体验,更是agent的形态。一个连续跑几周的agent,不必再拖着一个越来越长的上下文。
· PhiZero:先算出会发生什么,再把它画出来
世界模型是让AI预测“接下来会怎样”的模型,如杯子推下桌沿,是弹一下还是碎。目前主流做法是直接预测像素:猜下一帧画面长什么样。问题是画得像不等于算得对,水会倒流、物体会穿模,模型学到的是外观的统计规律,不是物理。
这篇把两件事拆开:先把物理动态编码成一串离散的“物理语言”、在这个空间里完成推演,再据此渲染画面。相当于先写好分镜脚本再开拍,而不是一帧一帧即兴发挥。
拆开之后,物理一致性就从“喂更多数据、指望它自己涌现”,变成了一件可以单独检查、单独约束的事。这对机器人和自动驾驶的仿真,比对好看的视频更重要。
· HiFi-UMI:不用机器人,也能采到教机器人干活的数据
机器人学操作靠的是演示数据,标准采法是遥操作——人拿控制器驱动一台真机器人把动作做一遍,全程录下来。这是具身领域最贵的一道工序,一个技能几十上百小时,换个本体数据还未必能用。
UMI是另一条路:人手持一个带相机的夹爪,自己把活干一遍就算采集完成,不需要机器人在场,成本和速度是另一个量级。代价是人手采的数据与机器人自己看到、感觉到的对不上,通常还得拿真机微调一轮来补这个差。
新晋团队Simple AI这篇的主张是,这一轮可以省掉:只要演示数据保真度够高(相机与夹爪信号做到微秒级同步),不经真机微调也能训出可直接部署的操作策略。团队同时开源了2000小时的HiFi-UMI-2K数据集。
如果“纯人类演示→可部署策略”成立,具身数据的成本结构就被改写了:采数据不再需要机器人,任何一个拿着手持夹爪的人都是数据源。
▍编者按
这期的动态合起来指向同一件事:竞争的重心正从“能不能做到”,转向“用多大成本做到”。
当能力开始富余,稀缺的就是成本结构。
衡量一项技术是否真的成了基础设施,不是看它最高光的演示,要看它最无聊的用法——起草通知、跨语种行政翻译、管理员工档案。这一次的样本来自一个犯罪组织,它提醒我们:基础设施化是中性的,它降低所有人的成本。