社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

AI的下一个“ChatGPT时刻”会在哪里爆发?

财富FORTUNE • 1 月前 • 79 次点击  

躲猫猫不只是孩童的游戏,也是他们最早建立“物体恒存”认知的方式之一。当你捂住脸再突然露出,一句“躲猫猫!”换来孩子咯咯的笑声,也会帮助孩子实现认知成长。


当前的人工智能系统难以预测后续发展。研究人员希望改变这一现状。图片来源:Illustration by Max-O-Matic for Fortune


这种能力的形成并非依靠记忆。相反,婴儿通过观察,开始在大脑中构建关于世界运行规律的简单内部模型。大约在一岁时,他们就能够明白,滚到沙发后的球并没有消失,即使脱离视线,它仍然存在。


当今的人工智能系统尽管在对话和模式匹配方面表现出色,却无法可靠地掌握这一基本认知。它们可以描述眼前的事物,却难以理解隐藏的概念,也无法预判一连串行为后续会发生什么。


该领域的众多顶尖研究者认为,“世界模型”是破解这一难题的关键所在。这类人工智能系统的设计目标不再局限于识别文本或图像中的模式,而是模拟物理世界的运行规律。通过数百万小时的视频训练,这些模型能够构建出关于世界运作机制(包括物理规律在内)的精确内部图景——这是众多技术的核心能力,无论是帮助自动驾驶汽车预判儿童突然冲到马路上的后果,协助家用机器人学习如何折叠衣服,还是在医生下刀前模拟手术过程。


明星力量



为满足“物理人工智能”应用场景的系统构建需求,世界模型已经从冷门科研方向,一跃成为人工智能领域的研发重心。谷歌近期发布了名为“Project Genie”的研究预览,该系统可以根据简单提示词生成逼真的交互式虚拟环境,还能预测这些世界的演变过程,并响应用户的操作。


与此同时,“人工智能教母”李飞飞和“人工智能教父”杨立昆各自为专攻世界模型研发的新创企业筹集约10亿美元的资金。斯坦福大学教授李飞飞于2024年创立World Labs,致力于赋予人工智能更丰富的三维空间感知能力,使其可以精准地理解物体的存在方式与交互逻辑。Meta的前首席人工智能科学家杨立昆则在今年3月创立AMI Labs,旨在突破大语言模型的局限。


杨立昆在近期的一次演讲中表示:“现有的系统能够操控语言,让大众误以为它们很聪明,但实际上,这些系统在面对物理世界时束手无策。”


这一发展势头反映了研究人员对智能的认知不断革新。当今的许多世界模型研究都可以追溯到戴维·哈和于尔根·施米德胡贝在2018年发表的论文。数十年来,人工智能系统主要通过响应数据或蛮力试错来学习。该论文提出了全新方法:人工智能要做出智能决策,首先需要通过模拟环境来学习世界的运行规律。


戴维·哈后来与他人联合创立了日本人工智能研发公司Sakana,他对《财富》杂志表示,这些系统可以让人工智能在其模拟的现实场景中(他描述为“幻觉梦境”)开展训练,智能体可以在现实世界中采取行动之前,在上述场景中进行练习和提前规划。


在英伟达旗下Cosmos Lab担任副总裁的刘洺堉给出了更形象的说法,他类比了电影《黑客帝国》的设定——主角在虚拟世界中学习功夫。


刘洺堉将世界模型比作“生成式训练基地”,他说:“这里有反馈和指导,让人工智能可以不断提升自身技能。”

第四维度



除了李飞飞和杨立昆这些最受关注的项目外,多家新创企业正沿不同技术路线研发世界模型。


以Niantic Spatial为例,这是一家从《精灵宝可梦GO》背后的增强现实和地图技术分拆出来的新创企业。这家总部位于旧金山的公司利用超过300亿张实景照片和三维扫描数据,打造其所谓的大型地理空间模型,能够以三维形式解读现实世界环境,数据主要来自《精灵宝可梦GO》玩家多年的活动记录以及其Scaniverse应用程序。


总部位于以色列特拉维夫的Decart则致力于将世界模型推向实时应用,其打造的系统不仅能够模拟环境,还可以随着用户与环境的交互而持续生成和更新环境。通过自研优化系统,它能够以足够快的速度生成视频,逐帧匹配用户的操作。


“这才是关键突破。”Decart的研究科学家及创始成员之一克菲尔·阿贝尔曼指出,挑战不在于单纯生成视频,而在于以足够快的速度生成视频以实现即时响应。这一技术已经应用于虚拟试穿(使衣物贴合身形并自然摆动),以及主播实时切换直播背景等场景。


在某些世界模型中,时间元素是不可或缺的,构成了第四维度。例如,由自动驾驶领域先驱奥利弗·卡梅伦和杰夫·霍克创立的Odyssey公司,专注于构建能够预测世界随着时间的推移而演变的世界模型——直接从视频中学习物理规律、人类行为以及因果关系。该公司总部位于美国加利福尼亚州帕洛阿尔托。


“我们曾经觉得这个想法简直不可思议——你能够预测未来。”卡梅伦说道,“如果我们可以让这一能力应用于机器人、游戏、教育、医疗保健和国防等通用领域,会带来怎样的变革?”

“ChatGPT时刻”



尽管前景可期,但构建世界模型依然面临巨大的技术和经济障碍。训练可以模拟真实世界的系统所需要的算力远超如今的语言模型,因为它们不仅需要处理文本,还需要处理高分辨率的视频。


比如,卡梅伦曾经表示,通过应用程序接口访问其Odyssey 2模型的每位用户,都需要占用一块英伟达的高性能H200人工智能芯片。而单块H200芯片的售价最高可达4万美元。


数据是另一项制约因素。大语言模型能够依托从互联网海量文本中爬取的数据来完成训练,而世界模型高度依赖视频素材,视频数据采集、标注与规模化训练的难度远超文本。


但这些挑战并未浇灭世界模型研发者的热情。随着研究人员不断推进可以理解并与物理世界交互的系统,业界普遍认为突破性进展可能近在咫尺。


“当前的物理人工智能领域正在迎来前所未有的热潮和投资。”英伟达的刘洺堉表示,并补充道,该领域的“ChatGPT时刻”即将到来。他个人的终极目标是:让机器人仅通过几个示例——甚至从未见过的示例——就可以学会新技能,并能够持续运用。


“我相信,人们正在逐步摸索出正确的技术路线。”刘洺堉说。(财富中文网)






·技术范式革新:从语言模型走向物理世界模拟:AI正从文本处理演进至能理解物理规律、预测环境变化的“世界模型”,世界模型能力边界的拓展,有望重塑自动驾驶、具身机器人及医疗等实体产业的底层竞争格局。


·顶级资本与学术领军人物齐聚新赛道:以李飞飞和杨立昆为代表的AI领军人物分别下场创立公司,英伟达等算力巨头亦全力布局,预示着全球AI产业的下一波爆发点将聚焦于空间感知与物理交互能力。


·算力与数据壁垒揭示真实商业门槛:世界模型对视频数据与实时算力的要求远超大语言模型,这表明物理AI爆发的前夕仍面临高昂的硬件与计算成本考验。


财富中文网对原文有删减和调整


编辑:魏雨彤


《财富》榜单

诚邀各领域优秀企业参与申报



Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199742