01 大模型:新一代GPT-5.6推理模型与ChatGPT Work代理及桌面应用正式发布;OpenAI推出GPT-Live全双工语音模型,实现边听边说的自然对话
02 工具:Rowboat:开源AI协作者,自动构建工作知识图谱,背景代理实现全自动工作流;对话歌歌AI创始人:从零预训练华语音乐大模型,与字节合作百万用户
03 编码:Bun从Zig重写为Rust,Claude Fable 5在11天内完成百万行代码;深度分析AI编码中LLM输出方差问题
04 智能体:华人团队打造通用生物医学AI Agent Biomni登《Science》,能力接近人类专家;清华等提出MemSlides:记忆驱动Agent实现个性化PPT多轮修改
05 技术:腾讯混元开源HiLS-Attention:分块稀疏注意力机制实现高效长上下文建模;清华AIR团队AIM智能体辅助量子算法研究,84页论文展示人机协同新范式
06 本地部署:colibri纯C推理引擎让744B参数GLM-5.2在消费级CPU上运行;llama.cpp新增DFlash投机解码支持,本地模型推理再提速
07 评测:Databricks基准测试:GLM 5.2编码能力媲美Opus 4.8,成本低一半;MIT提出FrontierOR基准:评估大模型在工业级优化问题上的算法设计能力
08 安全:OpenAI升级生物漏洞赏金计划,奖励翻倍至5万美元;Bing清除90K页AI垃圾网站,ChatGPT引用量遭重创
09 具身智能:1X发布25自由度肌腱驱动机器人手,年产目标1万只,NEO机器人上手拧灯泡拉拉链;UMA发布首个类人机器人设计 引入实时学习架构支持演示学习
10 硬件:国产首个十万卡AI超集群曙光8000正式落成,光合组织发布Token谱系计划;SemiAnalysis称英伟达Kyber NVL144机架延迟超12个月至2028年
11 训练:Perplexity CEO透露自研编排器:基于GLM 5.2后训练,必要时升级至Opus
12 视频:Seedance 2.0可将故事板一键转为4K产品广告,几分钟完成;AI 创作者 el.cine 展示将概念转化为外星科技视频
13 3D:Grok 4.5与Grok Build在UE5.8中36分钟自动生成3D赛博朋克场景,API成本仅12美元
14 设计:Drafted 发布 V2 版本:更精准 AI 家居平面图生成与实时 3D 更新
15 活动:蚂蚁集团第三届InTech奖开放申报,图灵奖得主与两院院士坐镇,面向AGI等四大方向青年学者;Google AI智能体挑战赛2026获奖者揭晓:家庭医疗与AI记忆成焦点
16 案例:马斯克分享Grok 4.5演示:一小时内借助Grok Build和Cursor创建FPS游戏;上海科学智能研究院发布Golab科研工厂,打通AI物质科学干湿闭环
17 资源:HuggingFace 开源专业级图像编辑轨迹数据集;吴恩达发布3小时AI工程师实战课程,聚焦2026年Agentic AI与提示工程
18 分享:阿里云百炼网关用RocketMQ LiteTopic重构限流,限流比降低10倍;个人创业者展菲:用AI放大多项目管理半径,阿里云托举产品从验证到增长
19 观点:《AI 2040: Plan A》发布:前OpenAI团队续写超级智能正面愿景;SemiAnalysis发布Meta超级智能一年进展:RL创业涌现,算力扩张空前
20 问题:求助:使用LLM进行长期研究项目的标准模式;开发者寻找替代AI新闻源,Hackaday等老牌站点获推荐
21 其他:GitHub仓库ra-port在技术社区被分享;lithosai.com链接在技术社区获6分关注
新一代GPT-5.6推理模型与ChatGPT Work代理及桌面应用正式发布【9.5分】
OpenAI推出GPT-5.6系列推理模型,包括旗舰款Sol、均衡款Terra和快速廉价款Luna,Sol专为复杂任务设计,覆盖编码、科研、网络安全等领域,仅向付费用户开放。同步发布ChatGPT Work代理,可长期运行、整合文件与插件,生成文档、报表、演示文稿和网站,支持定时任务和触发器,定价与Codex一致。
相关链接:https://x.com/btibor91/status/2075335905599271268
OpenAI推出GPT-Live全双工语音模型,实现边听边说的自然对话【8.8分】
OpenAI正式推出GPT-Live语音模型,采用全双工架构实现边听边说,彻底告别传统回合制交互。模型每秒做出大量交互决策,学会适时垫话和安静等待,具备强大抗环境噪音能力。采用前后台解耦设计,前台负责流畅对话,后台可调用GPT-5.5等模型进行深度推理,推理期间保持自然互动。视觉卡片功能可在对话中弹出图文信息,即日起陆续推送给所有ChatGPT用户。
相关链接:https://openai.com/index/introducing-gpt-live/
GPT-Live全双工语音正式上线,奥特曼表态:聊天AI时代要变了【8.5分】
OpenAI于7月8日正式推出新一代语音模型GPT-Live,替换ChatGPT原有语音模式。该模型采用全双工架构,实现用户和AI同时听说的自然对话,支持实时打断和“嗯”“对”等搭腔回应,彻底改变了过去“回合制”语音交互的生硬感。GPT-Live负责前台实时交互,复杂推理任务则自动转给后台的GPT-5.5处理,用户几乎感知不到切换延迟。
蚂蚁灵波开源LingBot-Video:全球首个具身智能MoE视频模型,30B参数仅激活3B【8.3分】
蚂蚁灵波(Robbyant)开源全球首个面向具身智能的MoE视频基础模型LingBot-Video,总参数量30B,仅激活3B。该模型旨在解决具身智能训练数据稀缺问题,通过互联网视频与超7万小时具身数据(含VLA、VLN、第一视角等)混合训练,采用五阶段渐进式训练从192p到1080p,最终实现物理准确的视频生成。
相关链接:https://github.com/robbyant/lingbot-video
Rowboat:开源AI协作者,自动构建工作知识图谱,背景代理实现全自动工作流【7.9分】
Rowboat是一款开源AI协作者,被定位为“第二大脑”产品。其核心是通过背景代理自动索引用户的邮件、会议记录和笔记,构建持续更新的工作知识图谱。它提供多个工作表面:邮件客户端、会议笔记工具、浏览器和代码模式,用户可与AI协作完成实际工作。亮点在于自动化能力:例如客户邮件请求产品变更时,背景代理会自动触发Claude Code编写功能代码。
相关链接:https://x.com/akshay_pachaar/status/2075149126954783164
对话歌歌AI创始人:从零预训练华语音乐大模型,与字节合作百万用户【7.9分】
智东西深度对话歌歌AI创始人龙勇。龙勇是资深音乐制作人,2019年便开始构思AI音乐,2022年创立音律闪动,四年后推出全栈自研的十亿级端到端AI音乐大模型。该模型采用DiT架构,从零预训练,专注华语音乐审美,单张H系GPU约10秒即可生成一首完整歌曲。旗下应用歌歌AI写歌已积累百万用户、十几万付费会员。歌歌AI已与字节跳动签订非独家版权分成合作,曲库全量入驻抖音、剪映等字节系产品。
Research Radar:本地化论文筛选工具,自动按兴趣打分并深度阅读【7.8分】
一位开发者在技术社区开源了Research Radar工具,用于自动筛选arXiv上的新论文。该工具每天通过RSS和API获取指定分类的新论文,利用轻量模型对摘要按用户编写的兴趣文件进行1-10分打分,再对高分论文进行全文深度阅读,生成摘要、关键见解、局限性和与自身工作的关联。支持本地化运行,打分和深度阅读可混合使用OpenAI兼容后端(Ollama/vLLM/llama.cpp等)。
相关链接:https://reddit.com/r/ollama/comments/1usoh2a/every_day_my_local_agent_reads_all_new_arxiv/
Paperclip:用公司化管理协调Claude Code、Codex等AI代理协作的开源工具【7.8分】
Paperclip是一个开源的多代理协调工具,将自己定位为“公司”,管理Claude Code、Codex、Cursor等AI代理。它通过定义角色、汇报线、预算和心跳机制,让各代理像员工一样协作完成任务,支持目标对齐、工单系统、版本控制和审计日志。开发者只需npx一键命令即可本地部署,无需注册账号。作者认为该工具解决了多个AI窗口管理混乱的问题,推动“一人公司”模式发展。
Bun从Zig重写为Rust,Claude Fable 5在11天内完成百万行代码【7.6分】
JavaScript运行时工具Bun宣布从Zig语言完全重写为Rust,项目代码量超过100万行,开发周期仅11天。此次重写由Anthropic的Claude Fable 5模型主导完成,利用其强大的代码生成与推理能力,大幅加速了语言迁移过程。Bun团队表示,Fable 5在代码重构、类型转换和兼容性处理上表现出色,使原本繁琐的手动重写变为AI主导的自动化任务。
相关链接:https://the-decoder.com/bun-ditches-zig-for-rust-with-help-from-claude-fable-5-writes-over-a-million-lines-of-code-in-11-days/
深度分析AI编码中LLM输出方差问题【7.3分】
Dan Luu发表深度技术文章,系统分析大型语言模型(LLM)在代码生成任务中的方差问题。文章指出,同一模型多次生成相同代码可能产生显著不同的结果,这种不一致性严重影响了AI编码工具在专业开发中的可靠性。作者通过大量实验数据展示不同温度设置、提示措辞微小变化对输出的影响,并讨论了方差对代码审查、测试覆盖率和团队协作的潜在风险。
相关链接:https://danluu.com/ai-coding/#llm-variance
GitHub Mobile 改进 Copilot 会话过滤与排序功能【6.5分】
GitHub Mobile 近日更新,为 Copilot 会话列表引入了改进的过滤与排序功能。用户现在可以根据活跃状态(未归档)、仓库类型、代理类型等轻量级筛选条件快速定位会话,并支持按最近、最早、活跃优先或需关注等顺序排列。排序操作会保留当前筛选上下文,无需重置。该功能已面向 iOS 和 Android 的最新生产版本推送,旨在提升移动端管理大量会话的效率。
相关链接:
https://apps.apple.com/us/app/github/id1477376905
Cognition发布SWE-1.7,AI编程助手迎来重大升级【5.5分】
Cognition公司在其官方博客上发布了SWE-1.7版本的更新。作为一款专注于软件开发的AI编程助手,SWE-1.7在性能、准确性和开发效率方面进行了显著改进。该版本进一步优化了代码生成、调试和重构能力,旨在帮助开发者更快地完成复杂任务。Cognition此前提出的以工程师小时衡量AI Agent价值的方法,此次更新也体现了其在提升实际生产力方面的持续投入。目前该版本已开放使用。
相关链接:https://cognition.com/blog/swe-1-7
华人团队打造通用生物医学AI Agent Biomni登《Science》,能力接近人类专家【8.5分】
今日,华人科学家黄柯鑫团队在《Science》发表通用生物医学AI Agent Biomni。Biomni不依赖固定工作流模板,可自主拆解任务、调用工具,完成遗传学、基因组学、药理学等研究。在通用生物医学基准上优于多种基线;在真实科研任务中接近人类专家,分析速度更快。真实案例显示,Biomni可解读多模态数据、优化蛋白质稳定性、协调湿实验操作并生成可验证方案。
相关链接:https://www.science.org/doi/10.1126/science.adz4351
清华等提出MemSlides:记忆驱动Agent实现个性化PPT多轮修改【7.8分】
来自清华大学、上海交通大学和北京邮电大学的研究团队提出了MemSlides,一个面向个性化幻灯片生成和多轮局部修改的记忆驱动Slides Agent框架。该框架通过结构化拆解记忆,区分长期记忆(用户画像)和工作记忆(临时偏好),并引入工具记忆保障修改稳定性。实验显示,MemSlides的闭环完成率达96.3%,严格验证通过率53.4%,首次正确编辑时间缩短至242.5秒。
腾讯混元开源HiLS-Attention:分块稀疏注意力机制实现高效长上下文建模【7.9分】
腾讯混元团队在GitHub开源了HiLS-Attention,一种分块稀疏注意力机制。与传统的块稀疏注意力需要全量QK计算不同,HiLS-Attention通过压缩块键估计块质量代理,并将注意力分解为跨块和块内两部分softmax,实现了基于下一词预测损失的端到端学习。该仓库提供了基于OLMo3-7B架构继续训练的7B参数检查点。
相关链接:https://reddit.com/r/LocalLLaMA/comments/1uspqed/tencenthilsattention7b_hugging_face/
清华AIR团队AIM智能体辅助量子算法研究,84页论文展示人机协同新范式【7.8分】
清华大学智能产业研究院(AIR)刘洋教授团队发布面向数学研究的智能体系统AIM,与以往只解数学题的Agent不同,AIM能参与科研早期阶段:帮助研究者发散思路、组织定理、生成证明草稿并交人类审查。研究团队与求真书院合作,利用AIM完成了一项量子算法研究——符号嵌入量子算法(Sign Embedding Quantum Algorithms),形成84页论文。
Grok 4.5构建4维球面数学反例,推翻超压缩性猜想【7.5分】
Grok 4.5成功构建了4维球面上Poisson半群(拉普拉斯-贝尔特拉米算子的平方根)超压缩性的一个显式反例,推翻了2021年一项研究认为该性质在所有维度下成立的结论。这一结果展示了Grok在高级数学推理方面的能力。研究者和数学家Paata Ivanisvili公布了该发现,表明xAI的Grok模型不仅擅长编码和语言,还具备解决深层次数学难题的潜力。
相关链接:https://x.com/elonmusk/status/2075387178511700426
NVIDIA用AI Agent驱动OpenFold3,实现大规模生物分子结构预测与协同折叠【7.4分】
NVIDIA近日介绍了基于OpenFold3的生物分子结构预测方案。OpenFold3已能进行结构预测和协同折叠,成为药物发现和蛋白质设计的主流大规模工作负载。NVIDIA强调AI Agent在端到端驱动整个流程中的作用,需实现多序列比对(MSA)生成、协同折叠推理、服务部署以及多GPU扩展等步骤的快速可扩展,以满足大规模计算需求。该方案旨在加速生物医药领域的研发进程。
相关链接:https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
colibri纯C推理引擎让744B参数GLM-5.2在消费级CPU上运行【8.3分】
colibri项目发布了一个纯C编写的推理引擎,其核心创新在于将GLM-5.2(744B参数MoE模型)的约17B密集部分以int4精度常驻内存,而将2万多个路由专家压缩后存储在本地NVMe磁盘上,按需流式读取,从而让仅约25GB内存、无GPU的消费级机器也能运行前沿超大模型。该项目没有Python、BLAS或GPU依赖,主要代码集中在一个约1300行的C文件里。
llama.cpp新增DFlash投机解码支持,本地模型推理再提速【7.0分】
llama.cpp开发团队近日公开介绍了新增的DFlash投机解码支持,进一步丰富了其投机解码技术栈。投机解码通过辅助模型快速生成候选词元,再由目标模型验证,可显著加速本地模型推理。此前llama.cpp已集成MTP、Eagle3及多种基于n-gram的投机解码方法。此次更新特别感谢NVIDIA团队及Ruixiang Wang的贡献。
相关链接:https://x.com/huggingface/status/2075622614509207983
LLM量化系列第二部分:你需要更大的显存【6.6分】
一篇技术文章深入探讨了LLM量化对显存的影响,作为系列第二部分,文章指出随着模型规模和量化精度变化,显存需求差异显著,并基于实际测试给出硬件配置建议。文章强调,在追求更低比特量化时,需要权衡模型质量与显存占用,同时考虑推理框架的优化支持。对于计划本地运行大模型的开发者,该内容提供了实用的显存估算参考和量化方法选择指南。
相关链接:https://www.lttlabs.com/articles/2026/07/10/llm-quantization-part-2-youre-gonna-need-a-bigger-vram
Databricks基准测试:GLM 5.2编码能力媲美Opus 4.8,成本低一半【8.3分】
Databricks发布编码智能体基准测试,在自家百万行代码库上对比多款模型。结果显示,采用纯bash命令的最小工具策略的编码智能体成本比其他方案低至2倍,且通过率更高。GLM 5.2在编码任务上超过GPT-5.5的高推理和超高级推理模式,与Opus 4.8高级推理模式持平。用户反馈GLM 5.2在多数编码任务中感觉与Opus 4.6/4.8相当,但通用对话稍弱。
相关链接:https://reddit.com/r/LocalLLaMA/comments/1usrek0/according_to_databricks_picodingagent_is_2x/
MIT提出FrontierOR基准:评估大模型在工业级优化问题上的算法设计能力【8.0分】
来自麻省理工学院等机构的研究者提出了FrontierOR,这是一个面向大规模优化算法设计能力的LLM评测基准,旨在评估大模型能否像真正的运筹优化(OR)工程师一样,针对复杂问题结构设计出可扩展、高质量且高效的算法,而非仅仅调用求解器。FrontierOR从1992-2025年间20余家OR期刊的180篇论文中选取真实工业级问题,采用两段式评测流程(小实例预筛、大实例评估)。
前沿模型解码真实科学仪器数据能力实测:声学相机原始录音生成热力图【7.8分】
一项公开测试评估了当前前沿模型处理真实科学仪器数据的能力。测试使用一台具有1024个麦克风的声学相机,将原始录音提供给四个前沿模型,要求它们生成显示声源位置的热力图。该测试旨在检验模型在真实科学场景下的数据解码与空间推理能力,而非仅依赖常见图像或文本任务。结果尚未公布,但该实验展示了AI在科学仪器数据分析领域的潜在应用,也反映出当前模型在处理多通道原始传感器数据时面临的挑战。
相关链接:https://x.com/paulg/status/2075501503243034952
量化对Qwen 3.6智能体性能影响显著,知识性能几乎不受影响【7.7分】
大学HPC集群管理员分享了Qwen 3.6量化基准测试结果。测试使用GPQA Diamond衡量知识能力、Terminal‑Bench 2衡量智能体性能,发现不同量化精度下知识得分几乎无变化,但低精度量化(如FP4/FP8)导致智能体性能显著下降。与官方FP8分数存在差异,原因是官方使用固定3小时超时,而测试采用Harbor默认10分钟至1小时的动态超时。
相关链接:https://reddit.com/r/LocalLLaMA/comments/1usclcz/qwen_36_q2fp8_terminal_bench_2_and_gpqa_scores/
OpenAI升级生物漏洞赏金计划,奖励翻倍至5万美元【7.3分】
OpenAI宣布将其生物漏洞赏金计划(Bio Bug Bounty)从一次性活动升级为持续进行的私人项目,并将最高奖励翻倍至5万美元。该计划邀请在AI红队、安全或生物安全领域有经验的研究者,尝试寻找能够击败OpenAI前沿模型的通用越狱方法,以强化高级AI能力在生物学领域的防护措施。此前OpenAI已发布过类似生物安全挑战,此次升级显示了其对模型安全的高度重视。
相关链接:https://openai.com/index/bio-bug-bounty
Bing清除90K页AI垃圾网站,ChatGPT引用量遭重创【7.0分】
Glenn Gabe近日更新了一起备受关注的案例:一个在Google中毫无可见性、但凭借Bing排名在ChatGPT中被疯狂引用的网站,如今已被Bing完全从索引中删除。该网站此前有近9万个URL被收录,现已全部消失。Gabe指出,该网站在ChatGPT中被引用超过16.7万次,而Google的算法则始终正确判断其内容质量低下。
相关链接:https://x.com/gaganghotra_/status/2075560043811152133
研究:通过Reddit操纵AI搜索结果轻而易举【6.5分】
一项最新研究发现,利用Reddit操纵AI搜索结果极其简单。研究者通过在Reddit上发布特定内容,成功影响了多个AI搜索引擎的返回结果,引发对AI搜索系统可靠性的担忧。该研究指出,恶意行为者可低成本操纵AI搜索,生成误导性答案。Reddit作为AI搜索的重要数据源,其内容治理面临新挑战。目前相关平台尚未公布有效应对措施。
相关链接:https://www.404media.co/it-is-trivially-easy-to-use-reddit-to-manipulate-ai-search-research-suggests/
Anthropic发表双用途能力关闭开关研究【5.5分】
Anthropic发表了一篇名为「Off-Switch for Dual-Use」的研究文章,聚焦AI模型中双用途能力(即可同时用于有益和有害目的的能力)的关闭机制。该研究探讨了如何识别并移除模型中的这类能力,以提升部署安全性。文章在技术社区引起少量关注,但尚未公布具体技术细节或实验数据。这是继Anthropic此前与AE Studio合作提出GRAM训练方法后。
相关链接:https://www.anthropic.com/research/off-switch-dual-use
1X发布25自由度肌腱驱动机器人手,年产目标1万只,NEO机器人上手拧灯泡拉拉链【8.6分】
1X Technologies推出全新机器人手,装配于NEO人形机器人。该手采用25自由度准直驱肌腱传动,传动比5:1至15:1,实现力透明、可反驱,指尖峰值屈曲力45N,定位精度±0.2mm。全指尖触觉传感器可感知法向力、接触位置和剪切力,腕关节通过200万次循环测试,具备IP68防水等级。手部能完成拧灯泡、拣螺丝、拉拉链、倒茶、插USB-C、打手语等精细操作。
UMA发布首个类人机器人设计 引入实时学习架构支持演示学习【7.8分】
物理AI公司UMA在Machina Summit上首次公开其类人机器人设计,并推出名为Real-Time Learning的实时学习架构。该架构使机器人能够通过观察人类演示直接学习新任务,无需传统的手动编程。这一技术突破有望大幅降低机器人部署门槛,加速物理AI在工业和服务场景的应用。目前UMA尚未公布机器人的具体参数和上市时间。
相关链接:https://www.digitimes.com/news/a20260708PR200/design-robot-industrial-capacity-labor.html
Robbyant发布LingBot-VA 2.0:具身原生基础模型,双手操作成功率93.6%【7.8分】
Robbyant发布LingBot-VA 2.0,称其为第一个面向物理世界的具身原生基础模型。该模型并非从视频生成器微调而来,而是从头构建,专为机器人物理交互设计。LingBot-VA 2.0在双手操作任务上达到93.6%的成功率,支持150Hz的单GPU推理,仅需20个演示样本即可适应新任务。与传统机器人仅对眼前环境做出反应不同,该模型具备预测能力,能在动作发生前预判物理走向。
相关链接:https://x.com/heyshrutimishra/status/2075371204597465390
台湾研发四足消防机器狗通过功能验证,将投入火场救援应用【7.6分】
台湾自主研发的四足机器人平台成为当地首个通过功能验证的消防救援机器狗,为未来火场应用奠定基础。该机器狗由工业技术研究院(ITRI)与本土产业伙伴共同开发,已与台湾电力公司及消防署等机构完成多项现场应用验证。该平台于2026年7月8日正式发布,消防署副署长钱万瑶出席支持。机器狗能够在烟雾、高温及100摄氏度天花板环境下作业,具备实地救援能力。
相关链接:https://www.digitimes.com/news/a20260709PD234/robot-fire-itri-taiwan-nvidia.html
国产首个十万卡AI超集群曙光8000正式落成,光合组织发布Token谱系计划【8.3分】
在今日光合组织2026智能计算应用大会上,中国首个全国产十万卡AI超集群曙光8000(登峰)正式落成并接入国家超算互联网。该集群已在蛋白质折叠模拟、万亿原子级水分子动力学模拟等高负载AI4S场景实现规模化运行,标志着国产AI算力从建设期进入应用兑现期。与此同时,光合组织推出“开放计算Token谱系”计划,覆盖算力生产、调度流转和应用价值转化三个环节,旨在将算力更高效地转化为科研和产业生产力。
SemiAnalysis称英伟达Kyber NVL144机架延迟超12个月至2028年【7.8分】
分析机构SemiAnalysis发布报告指出,英伟达在GTC上演示的Kyber NVL144服务器机架遭遇重大挫折,已延迟超过12个月,预计推迟至2028年。该机架是英伟达面向AI超级集群的高密度服务器方案,此前曾因传闻延迟引发市场关注,英伟达官方曾否认延迟超过12个月。SemiAnalysis的此次报告再次引发对英伟达下一代服务器路线图的讨论。
相关链接:https://x.com/rwang07/status/2075412076907110415
第二代豆包手机外观曝光:橙色AI按键、蓝色机身,7月17日WAIC亮相【7.8分】
努比亚联合字节跳动打造的第二代豆包手机外观曝光,采用橙色AI按键、蓝色机身,搭载定制AI系统,将于7月17日WAIC 2026首次亮相。该机为量产旗舰机,有望搭载第五代骁龙8至尊版处理器,屏幕供应商或换为京东方。文章回顾了第一代Obric UI在过去216天的迭代:豆包手机助手的记忆能力显著提升,可自动识别收藏内容并形成长期记忆库;手机操作能力增强,实时展示执行步骤与任务进度;语音唤醒成功率提高。
SemiAnalysis深度解析英伟达Vera Rubin NVL72:协同架构与量产突破【7.6分】
分析机构SemiAnalysis发布专题报告,详细拆解英伟达Vera Rubin NVL72的极致协同系统架构。该芯片得益于深度协同设计,首款大规模生产Token(FASPT)即将问世。报告还解析了Vera Rubin NVL72的架构创新与最新制造工艺突破,展示了英伟达在AI超级计算领域的持续领先。这一分析有助于洞察下一代AI芯片的技术方向。
相关链接:https://x.com/rwang07/status/2075338370272887019
Perplexity CEO透露自研编排器:基于GLM 5.2后训练,必要时升级至Opus【5.5分】
Perplexity CEO Aravind Srinivas在社区回复中透露了公司自研编排器的技术细节。该编排器对GLM 5.2进行了后训练,并在需要时升级至Opus作为顾问模型。他表示团队正在获取更多计算资源以快速优化质量,并称赞Grok 4.5和Opus Fast同样表现出色。这一技术方向显示了Perplexity在模型编排与后训练上的自主投入,旨在通过混合模型策略提升智能体任务表现。
相关链接:https://x.com/AravSrinivas/status/2075677595006562712
Seedance 2.0可将故事板一键转为4K产品广告,几分钟完成【5.5分】
AI创作者el.cine展示了Seedance 2.0的新能力:只需一个提示词即可将故事板(storyboard)转换为4K分辨率的产品广告视频,整个流程可在几分钟内完成。该教程和提示词已发布在Arcads平台。这一功能极大降低了视频广告制作的门槛,尤其适用于电商和营销场景。Seedance 2.0此前已支持3D场景构建、与CapCut集成等,此次演示进一步突出了其在商业视频创作中的实用价值。
相关链接:https://x.com/EHuanglu/status/2075429406252863537
AI 创作者 el.cine 展示将概念转化为外星科技视频【5.2分】
创作者 el.cine 分享了一段 AI 生成的视频,展示了将普通创意转化为如同外星科技般的逼真视觉效果。视频中可能通过输入提示或草图,利用 AI 视频生成工具制作出具有未来感的外星科技产品动画。该片段体现了 AI 在影视特效和概念可视化方面的应用潜力,无需复杂建模即可快速产出高质量视觉内容。el.cine 此前多次演示 AI 快速制作广告和短片,此次延续其专注 AI 视频创作的主题。
相关链接:https://x.com/EHuanglu/status/2075595990653194317
Grok 4.5与Grok Build在UE5.8中36分钟自动生成3D赛博朋克场景,API成本仅12美元【7.5分】
开发者在虚幻引擎5.8中利用Grok 4.5和Grok Build从零构建了一个赛博朋克L形街道场景,包含霓虹灯墙面、雨景、招牌和行人。整个端到端过程消耗10.75M tokens,耗时36.5分钟,API定价仅约12.4美元。令人印象深刻的不仅是最终渲染效果,更是编码代理以多小步自主构建、保存30多个地图检查点、验证场景并迭代修复问题的过程。
相关链接:https://x.com/elonmusk/status/2075481886500012390
Drafted 发布 V2 版本:更精准 AI 家居平面图生成与实时 3D 更新【6.6分】
设计工具 Drafted 发布了 V2 版本,主要升级包括更精准的 AI 生成家居平面图、新增设计控制选项以及实时 3D 更新。该工具依然对所有用户免费开放,无需付费即可使用全部功能。此次更新提升了设计精度和交互实时性,适用于室内设计、建筑规划等场景,帮助用户快速生成和调整家居布局方案。
相关链接:https://www.testingcatalog.com/drafted-released-a-major-v2-upgrade-to-its-ai-home-design-tool/
蚂蚁集团第三届InTech奖开放申报,图灵奖得主与两院院士坐镇,面向AGI等四大方向青年学者【6.6分】
蚂蚁集团宣布启动第三届InTech奖,分为面向青年学者的科技奖(每人20万元)和面向在读博士生的奖学金(每人5万元),两类各有最多10个名额,另设Future奖鼓励潜力人才。奖项聚焦通用人工智能、具身智能、数字医学、数据处理与安全隐私四大方向,需由两院院士或高级职称同行专家提名。评审阵容包括2021年图灵奖得主Jack Dongarra、统计机器学习奠基人Michael I. Jordan等顶尖学。
Google AI智能体挑战赛2026获奖者揭晓:家庭医疗与AI记忆成焦点【6.5分】
Google for Startups正式公布2026年AI智能体挑战赛的获胜团队。这些先锋团队从设想家庭医疗新模式到解决AI“遗忘”问题,推动了行业从静态代码向声明式、生产级自主智能体的转变。挑战赛旨在鼓励初创企业利用AI智能体技术解决实际问题,获胜者展示了在家庭医疗和AI记忆领域的创新方案。
相关链接:https://x.com/googledevs/status/2075656300562620743
SK集团推迟2026年AI峰会至2027年,与NVIDIA GTC对齐【6.2分】
SK集团宣布推迟原定于2026年下半年举办的SK AI峰会,新日期调整至2027年上半年。SK AI峰会是SK集团展示AI与半导体发展的年度旗舰技术活动。行业分析认为,此次调整旨在使峰会时间与NVIDIA每年3月举办的GTC大会更好对齐,实现高效协同。
相关链接:https://www.digitimes.com/news/a20260709PD249/sk-group-ai-nvidia-gtc-technology-2027.html
DeepMind英国员工正式成立工会,争取更大话语权【6.0分】
Google DeepMind英国员工正式成立工会,成为该AI研究机构员工组织化的重要里程碑。工会旨在为员工在薪酬、工作条件及公司决策中争取更大话语权,反映科技行业对劳动权益和技术伦理的日益关注。此次工会成立是DeepMind员工首次集体行动,可能影响其他科技公司员工的类似组织趋势。尽管DeepMind在AI领域地位举足轻重,但内部员工关于AI安全和社会影响的争议由来已久。
相关链接:https://www.theguardian.com/us-news/2026/may/04/google-deepmind-uk-workers-union
马斯克分享Grok 4.5演示:一小时内借助Grok Build和Cursor创建FPS游戏【7.6分】
马斯克分享了一个Grok 4.5的应用案例:在Grok Build环境中,仅用不到一小时就创建了一款第一人称射击游戏。演示过程非常简洁——首先指令模型撰写游戏设计文档并从网络拉取免费素材,随后生成一个包含实现阶段的TODO.md,最后通过循环迭代逐步完成每个开发阶段。该案例展示了Grok 4.5在代码生成、项目规划和自动化执行方面的实际能力,结合了xAI的模型能力和Cursor的协作训练。
相关链接:https://x.com/elonmusk/status/2075371558588055670
上海科学智能研究院发布Golab科研工厂,打通AI物质科学干湿闭环【7.5分】
上海科学智能研究院联合格物智研发布Golab物质科学智能研发工厂,成功跑通国内领先的“AI计算—自动实验—数据回流—模型自进化”干湿闭环全流程。该系统以燧人物质科学大模型为大脑,通过自驱动实验室实现无人介入的自动合成、提纯与验证,浑天绫平台负责任务调度。在百题马拉松直播中,任务编排合理性达100%,工具调用成功率超95%。
相关链接:https://pubs.acs.org/doi/10.1021/acscatal.2c01970
SOL Ultra生成《星际穿越》风格电影,14分钟程序化完成全部内容【7.2分】
一位开发者使用SOL Ultra模型(可能为Sol 5.6)生成了一段《星际穿越》风格的电影短片。该短片在14分钟内程序化完成,包括音乐、对话、场景等所有元素,并以一镜到底方式在Three.js中呈现。强调模型没有加入“愚蠢的安全限制”,并希望开发者重置使用限制以便进行更多测试。该演示展示了Sol模型在多模态生成上的一致性和强大能力,所有内容均为程序化生成,无需外部素材。
相关链接:https://x.com/chetaslua/status/2075444103438069955
德国电信与OpenAI合作:打造AI原生电信,变革客户服务与网络运营【6.8分】
德国电信宣布与OpenAI合作,致力于成为AI原生电信公司。合作将利用OpenAI的大模型技术全面改造客户服务体系,例如引入智能客服;优化员工工作流程,通过AI辅助提升效率;并推动网络运营智能化,实现故障预测与自动化运维。此外,双方还将探索语音交互的未来形态。这一合作标志着传统电信巨头全面拥抱AI,从基础设施到业务层进行深度重构,有望为行业树立标杆。
相关链接:https://openai.com/index/deutsche-telekom
HuggingFace 开源专业级图像编辑轨迹数据集【7.4分】
设计团队 ben the dream 在 HuggingFace 上开源了一套图像编辑轨迹数据集,旨在为 AI 模型提供专业级编辑推理数据。数据集包含 14 个完整设计轨迹、294 个逐步骤标注的专家动作,以及第一人称设计师的推理文字记录。每条轨迹均配有屏幕录制、Photoshop MCP 工具调用、键盘快捷键、菜单路径和坐标点击等可执行锚定信息。
相关链接:https://x.com/huggingface/status/2075673093553500446
吴恩达发布3小时AI工程师实战课程,聚焦2026年Agentic AI与提示工程【7.1分】
吴恩达最新主讲了一门3小时的实用AI课程,面向2026年AI工程师技能提升。课程从基础到进阶,重点帮助学习者从新手成长为'AI Power User',内容涵盖Agentic AI系统构建、提示工程以及快速应用开发。在Agentic AI部分,课程讲解了AI如何进行长思考、多步推理和创意生成,对比了新手提问与专家级任务的区别。提示技巧部分教授渐进式大纲写作、研究假设验证、多模态输入输出等实战方法。
Google生成式AI推出社交平台属性性能报告新方法【6.8分】
Barry Schwartz分享了一种利用Google生成式AI针对新社交平台属性进行性能报告的方法。该方法旨在帮助开发者和营销人员评估AI生成内容在社交平台上的表现,包括搜索排名、内容可见性等关键指标。报告可能涉及新的数据维度和分析视角,为优化AI内容在社交渠道的传播效果提供了实用工具。具体细节可参考seroundtable上的相关文章。
相关链接:https://www.seroundtable.com/google-ai-performance-reports-platform-properties-41663.html
微调PaliGemma 2实现目标检测实战教程【6.5分】
开发者发布了一篇详细教程,介绍如何微调Google的PaliGemma 2视觉语言模型(VLM)以用于自定义目标检测任务。教程指出,当前VLM在OCR、图像描述和视频理解等任务上表现优秀,但在目标检测的极端定制场景下仍面临挑战。文章从数据集准备、模型配置到训练推理给出了完整流程,并针对真实用例进行演示,帮助开发者掌握用PaliGemma 2解决特定目标检测需求的方法。
相关链接:https://debuggercafe.com/fine-tuning-paligemma-2-for-object-detection/
阿里云百炼网关用RocketMQ LiteTopic重构限流,限流比降低10倍【7.5分】
阿里云百炼网关团队分享了面向大模型推理场景的精细化限流系统重构经验。面对百万级租户、GPU稀缺和突发尖峰挑战,传统单网关限流器无法支撑。团队采用RocketMQ LiteTopic构建分布式漏桶矩阵:每个User+Model拥有独立物理隔离的队列,消费侧通过Suspend机制实现毫秒级独立调速。方案上线后限流比降低10倍,限流导致的用户可感知异常大幅收敛。
个人创业者展菲:用AI放大多项目管理半径,阿里云托举产品从验证到增长【7.4分】
InfoQ深度报道了个人创业者展菲的实践案例。展菲原是智能家居芯片工程师兼社区运营者,他利用AI Agent辅助理解新业务、搭建产品并嵌入审核流程,同时借助阿里云ECS和OSS等基础设施,一人同时推进智能眼镜、机器人解决方案和活动管理平台“展菲汇”三个不同领域的项目。AI放大了他的管理半径和执行力,云服务降低了产品从验证到持续运营的成本。
GLM 5.2开源权重模型的企业级部署指南【7.4分】
Scott Logic博客发布了一篇关于GLM 5.2开源权重模型的企业级部署指南。文章从企业团队的实际需求出发,系统分析了引入GLM 5.2时需重点关注的几个维度:模型性能与闭源旗舰的对比、开源协议与合规要求、私有化部署的基础设施成本、以及如何在现有技术栈中集成。GLM 5.2作为当前性能比肩闭源模型的开源方案,正在吸引越来越多企业关注。
相关链接:https://blog.scottlogic.com/2026/07/08/glm-5-2-considerations-for-enterprise-teams-starting-out-with-open-weight-models.html
AI生图频繁翻车?从四个常见错误拆解提示词优化方法【7.2分】
本文深入分析了AI生图模型在生成图片时常见的四种翻车现象:注意力分配失衡导致主体被忽略、视角与可见性冲突造成逻辑矛盾、空间与连接关系失败使物体位置混乱、组合与约束过载让结构松散。以扩散模型工作原理为起点,说明提示词不等于硬指令,模型容易出现灾难性忽略、机位歧义、遮挡错误等问题。文中针对每种场景展示了典型错误案例与修正后的提示词写法,强调先定机位、再摆关系、后加细节的写作顺序。
《AI 2040: Plan A》发布:前OpenAI团队续写超级智能正面愿景【8.0分】
前OpenAI研究员Daniel Kokotajlo领衔团队发布《AI 2040: Plan A》,作为《AI 2027》的正面愿景。报告逐月推演2027至2040年人类如何应对比自身更强的AI,核心方案是通过国际联合核查实现'验证的减速':中美将算力数据中心建在对方军事可及第三国,互保算力毁灭;2030年代用许可证收入向全民发放公民分红,每人在2040年可获得千万美元年收入。
SemiAnalysis发布Meta超级智能一年进展:RL创业涌现,算力扩张空前【7.9分】
分析机构SemiAnalysis发布Meta超级智能项目一年进展更新报告。报告指出,顶级强化学习环境创业公司凭空涌现,Meta正进行史上最激进的算力扩张计划,规模横跨2000公里以上。报告还对Google DeepMind提出了相关建议。该报告延续了SemiAnalysis对Meta超级智能计划的持续追踪,揭示了RL生态的快速演进与基础设施层面的重大突破。
相关链接:https://x.com/dylan522p/status/2075399298125045797
西湖大学吴泰霖创立原力引擎,用AI加速核聚变多物理场仿真【7.8分】
西湖大学特聘研究员吴泰霖(MIT物理学博士、斯坦福博士后)近日接受深度采访,介绍其创立的原力引擎公司及AI for Engineering愿景。该公司以生成式仿真、智能控制和多智能体系统为核心,致力于将传统需要数小时甚至数周的复杂物理仿真压缩至秒级,首先切入可控核聚变领域。吴泰霖此前提出'AI物理学家'算法,能从观测数据中发现简洁物理规律,并开发了通用多Agent工程建造平台BuildArena。
IDC调查:台湾企业AI Agent采用率达57%,远超亚太平均水平【7.8分】
IDC最新调查报告显示,台湾地区企业在AI Agent部署方面进展迅速,57%的受访企业已实际采用AI Agent,远超亚太地区36%的平均水平。报告指出,这一速度超出市场预期,预示着智能体AI可能在全球范围内加速重塑企业运营、治理和竞争格局。调查覆盖多个行业,反映出企业对自动化决策和智能协作的强烈需求。
相关链接:https://www.digitimes.com/news/a20260710PD209/google-cloud-ai-agent-governance-business-taiwan.html
求助:使用LLM进行长期研究项目的标准模式【6.6分】
一位开发者在技术社区发帖,询问是否有使用大语言模型进行长期研究或非编码数据收集项目的标准模式。他分享了自己的经历:受一篇社区文章启发,为了收集芝加哥无坚果餐厅信息,他使用了GitHub Copilot作为接口,不断输入文章、评论、邮件、电话记录等数据,让AI帮助整理和组织。他坦言这种工作方式似乎很普遍,但还未见到成熟的格式或模板。
相关链接:https://github.com/joshuabremer/chicago-allergy-eats
开发者寻找替代AI新闻源,Hackaday等老牌站点获推荐【6.2分】
一位开发者公开表示对当前充斥AI公司宣传内容的文章感到厌倦,希望找到更多以用户为中心、减少OpenAI/Anthropic等巨头推广的“人在环路”式报道。帖文推荐了Hackaday、Lobste.rs以及支持排除AI内容的Hcker.news等替代网站。相关讨论也在社区引起共鸣,认为现有技术聚合平台内容过于偏向大型AI企业。作者强调希望看到更接地气、更具实践导向的内容。
工业片材表面缺陷检测求助:新手请教相机照明与检测方法选择【5.8分】
一位刚接触计算机视觉与工业缺陷检测的新手在社区分享了自己的项目:检测片状材料表面的划痕、污渍、褶皱等缺陷,并附上三张样本图像。他遇到三个主要问题:相机位置与视野——材料未能完全覆盖图像,边缘露出明亮背景;照明不均——中心亮两侧暗,导致低对比度缺陷难以辨认;检测方法——目前使用传统OpenCV的阈值、滤波、形态学与轮廓检测,但速度慢且对照明变化敏感。
相关链接:https://reddit.com/r/computervision/comments/1usb7gt/beginner_question_how_should_i_improve_the/
计算机系学生求助LLM安全监控毕业设计:如何避免过度依赖API【5.6分】
一名计算机专业高年级学生在社区发帖,介绍其毕业设计初步构想:构建LLM安全监控系统,用于检测提示注入、越狱攻击、有害提示和幻觉。但导师认为项目过于依赖现有API,缺乏原创实现。该学生遂调整方向,计划使用开源模型和数据集自行微调分类器,检测各类风险提示并生成解释,同时考虑加入对抗样本生成、检索验证、持续学习及风险监控仪表盘等功能。
相关链接:https://reddit.com/r/LanguageTechnology/comments/1usos12/need_feedback_on_a_final_year_btech_llm_project/
1. 一个名为ra-port的GitHub仓库被分享至技术社区,获得2个点赞和1条评论。该仓库由用户dk8827创建,当前页面仅包含基础链接信息,未提供具体功能描述或项目文档。社区反响平淡,关注度较低。
相关链接:https://github.com/dk8827/ra-port
2. 一个指向lithosai.com的链接在技术社区获得6个评分,目前暂无评论。该域名可能涉及AI或编程相关的工具或文章,但具体内容尚未在社区公开。此次分享获得有限关注,可能反映社区对其兴趣一般或内容尚未广泛传播。后续若有更多讨论,将有助于判断其实际价值。该链接的出现或预示着新资源的发布,但需更多信息确认。
3. 艾玛·沙夫曼宣布正式加入HuggingFace,担任机器学习研究工程师,隶属于科学团队(Science Team)。她表示,目标是弥合研究人员与HuggingFace工具之间的鸿沟,通过与研究者合作,让科学界更便捷地使用开源数据和模型。她同时呼吁从事AI与科研交叉领域工作、或希望壮大AI4Science社区的人联系交流。
相关链接:https://x.com/huggingface/status/2075669768741212282
截至发稿共收录249条AI资讯,本期早报精选69条。以上为果比AI早报精选,更多AI资讯请移步www.guobi.ai