社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

【AI系列深度14期】深度学习如何开启AI第一次爆发?

东吴汽车黄细里团队 • 4 天前 • 35 次点击  

未经许可,不得转载或者引用。

投资要点

投资要点:

AI第一次爆发的本质,是连接主义路线在数据、算力与可训练深层网络算法共同成熟后的复兴。本篇所称“AI第一次爆发”,主要指2012年前后深度学习由学术突破走向规模化应用的技术周期。不同于传统机器学习依赖人工设计特征,深度学习通过多层向量表示自动学习世界结构;AlexNet在ImageNet上将top-5错误率由约26%降至约15%,成为AI1.0时代由学术验证进入产业扩散的标志性拐点。

我们以“七阶段—三大阶段”复盘深度学习架构演进,并据此建立“学术瓶颈—产品落地”的判断框架:架构通常先经历思想提出与基础架构搭建,再进入训练优化、结构改进、任务扩展,最后转向轻量化部署与复兴性迭代;对应可归并为范式确立、成长扩展、成熟高峰三大阶段。当高引用成果开始向轻量化、部署和复兴性改进集中,同时新增基础架构型突破减少,往往意味着既有架构进入短期学术瓶颈,产业应用窗口反而可能打开。

从CNN复盘看,AI1.0的主线是视觉感知能力的规模化成熟。LeNet奠定卷积、权值共享、池化与反向传播的工程组合,AlexNet以深层CNN、GPU、ReLU、Dropout和数据增强形成技术共振,VGG、Inception、ResNet进一步推动网络深度化和结构优化;2017年后,MobileNet、EfficientNet、ConvNeXt等成果更偏向轻量化、部署和现代化回潮,印证CNN在2016—2017年前后进入成熟与高峰阶段。

从RNN复盘看,语言序列建模也在同一时间窗口触及递归范式上限。Jordan/Elman确立隐藏状态记忆思想,BPTT奠定训练基础,LSTM/GRU缓解长程依赖,Seq2Seq与Bahdanau Attention推动机器翻译工程化;但串行计算、长距离衰减和固定向量瓶颈限制了规模化扩张。2017年Transformer以自注意力替代循环,正对应RNN成熟后下一代架构切换的历史节点。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

1

复盘AI第一次爆发:深度学习如何开启AI1.0时代

1.1

AI第一次爆发是传统机器学习到深度学习的跨越

早期人工智能主要沿两条路线演进:一是以逻辑推理和知识表示为核心的符号主义,二是以神经网络和数据驱动学习为核心的连接主义。深度学习的兴起,本质上是连接主义在数据、算力和算法条件成熟后的再度繁荣。传统AI更强调由人类预设符号与规则并据此推理,深度学习则转向让机器从数据中学习高维表示,并在可学习的向量空间中完成推理与判断。

深度学习的核心在于通过多层向量表示学习复杂世界结构,而非依赖人工设计特征。以图像识别为例,传统机器学习通常需要工程师先设计边缘、角点、纹理、形状等特征,再交由分类器识别;深度学习则直接从原始数据中逐层学习表示:底层捕捉边缘,中层学习局部形状与物体部件,高层形成对完整物体的抽象刻画,即表示学习。下表对两者的根本差异进行概括。

因此,深度学习的成功并非单一变量驱动,而是大数据、强计算能力与可训练深层网络算法三项条件同步成熟的结果。

从技术演进脉络看,深度学习体系的成熟并非单点突破,而是多项跨架构底层技术长期迭代的结果。本报告梳理1974—2019年深度学习领域的核心技术成果:反向传播算法奠定端到端训练机制;沿时间反向传播、梯度消失与爆炸问题的系统性论证,以及长程依赖瓶颈的提出,共同刻画了深层网络与循环网络的关键训练难题;随后,LSTM门控机制、无监督预训练范式、ReLU激活函数、Xavier/He参数初始化方法、AdaGrad/Adam/AdamW等优化器、Dropout正则化、Batch/Layer/RMSNorm等归一化技术、注意力机制、ResNet残差连接及Transformer自注意力架构陆续落地,持续改善深层网络的训练效率与收敛表现。上述成果具有较强跨架构适配性,可应用于MLP、CNN、RNN、Transformer等主流网络形态,共同构成深度学习技术体系的公共底座。我们按技术重要性对相关成果进行时间维度梳理。其中,核心成果在2010年后密集出现,为深度学习的规模化爆发与产业应用扩展提供了关键技术支撑。

1.2

2012年AlexNet发布标志着深度学习第一次爆发

2012年,AlexNet在涵盖约100万张图像、1000个类别的ImageNet数据集上取得突破,将ILSVRC口径下的top-5错误率由约26%降至约15%,成为深度学习在视觉任务上实现代际跃迁的标志性拐点。此后,CNN快速确立其在图像识别、目标检测、图像分割、人脸识别等主流视觉任务中的核心地位。该性能突破来自算力、算法与训练方法的协同优化,主要体现在四方面:GPU并行训练显著提升算力利用效率,为深层网络规模化训练扫清工程障碍;ReLU激活函数缓解深层网络梯度衰减问题,加快模型收敛;Dropout正则化降低过拟合风险,改善泛化表现;数据增强通过样本形变扩充训练集规模,提升模型鲁棒性。

AlexNet的突破,是算法体系、算力支撑与数据基础长期积累后在2012年形成技术共振的结果。算法层面,反向传播理论(1974/1986)、梯度消失问题系统分析(1991)、无监督预训练范式(2006)、ReLU激活函数(2010)等成果持续迭代,逐步解决深层网络“能否训练”与“训练是否有效”的核心问题;算力层面,GPU算力沿工程化路径持续落地:2004年GPU初步用于神经网络计算,2006年GPU加速CNN卷积运算与CUDA架构发布,确立GPU通用并行计算平台定位,2009年GPU支撑大规模深度无监督学习,2011年快速GPU-CNN方案推出,使深层模型规模化训练具备工程可实现性;数据层面,2009年ImageNet大规模层级化人工标注图像数据库发布,为视觉领域提供统一的超大规模训练与评测基准。三项要素此前逐步汇聚,并最终共同促成AlexNet引爆深度学习。

2

AI1.0时代典型架构复盘

在AI1.0时代,CNN作为旗帜性架构引领了深度学习第一轮爆发,主要体现在三个维度。其一,技术验证维度:2012年ImageNet大规模视觉识别挑战赛中,CNN方案以显著性能优势超越传统手工特征方法,首次在大规模视觉识别任务中验证深层卷积网络的代际差异,推动深度学习路线获得学术界与产业界共识。其二,范式确立维度:CNN构建“端到端训练、层级化表示学习”的核心范式,应用场景从基础图像分类快速延伸至目标检测、语义分割、人脸识别、医学影像、自动驾驶等视觉赛道,成为计算机视觉领域通用骨干网络。其三,产业带动维度:CNN技术成熟落地同步拉动GPU算力(以英伟达为代表)、深度学习开发框架、数据标注服务等上下游环节成长,奠定AI1.0时代的产业基础设施格局。

基于对CNN与RNN论文的系统复盘,深度学习架构演进大体可划分为七个阶段:①思想提出,②基础架构,③训练和优化赋能,④结构精细化改进,⑤任务扩展,⑥轻量化与部署,⑦复兴性改进。上述七个阶段进一步可归并为三大阶段:①②对应范式确立阶段,③④⑤对应成长与扩展阶段,⑥⑦对应成熟与高峰阶段。

若某一架构在若干年份内的高引用论文中,成熟与高峰阶段(轻量化与部署、复兴性改进)论文占比显著提升,通常说明该架构在学术进展上进入短期瓶颈期。这一节点具有两层含义:一方面,架构逐步成熟,产品落地窗口有望开启;另一方面,既有架构的新增突破趋缓,需关注学术界是否出现下一代架构,并可能带来任务解决能力的跨越式提升。

2.1

CNN技术发展复盘

为复盘CNN从兴起到Transformer时代的关键指引信号,我们系统梳理了1980—2022年CNN领域30篇核心论文。在此基础上,我们将CNN的发展阶段概括为:生物视觉启发→Neocognitron→LeNet→ImageNet/AlexNet爆发→VGG/Inception/ResNet深度化→DenseNet/SENet/ResNeXt结构创新→MobileNet/EfficientNet轻量化→FCN/U-Net/R-CNN/YOLO等任务扩展→ConvNeXt等与新技术结合的现代CNN回潮。

CNN的核心发展节点及代表论文中,LeNet(LeCun,1989/1998)、AlexNet、VGG、GoogLeNet/Inception与ResNet五项成果,均为CNN领域里程碑论文:LeNet首次将卷积、权值共享、池化与反向传播工程化,并应用于字符识别;AlexNet以深层CNN+GPU+ReLU+Dropout在ImageNet上将top-5错误率由约26%降至约15%,直接引爆深度学习;VGG验证了“加深网络”的有效性;GoogLeNet通过多尺度Inception结构提升计算利用率;ResNet以残差连接破解深层退化难题,并成为后续视觉骨干乃至Transformer的重要基础范式。

从学术派系演进看,CNN从1962年生物视觉启发到2022年现代CNN回潮的演进。其主线可概括为:生物视觉启发→层级网络原型→可训练CNN→大数据爆发→深度化→结构创新→轻量化→多任务扩展→现代CNN回潮,清晰呈现各派系之间的师承关系、数据与思想支撑以及跨线衔接。

高引用的基础架构与训练类论文集中在2012—2016年,构成范式确立与成长扩展阶段高峰;2017年后,论文重心明显向轻量化/部署、结构精细化及复兴/后继迁移,且这些“成熟与高峰阶段”论文的引用量整体回落。当架构高引用论文向成熟与高峰阶段集中,且新增高引用基础架构论文减少时,意味着CNN在2016—2017年前后进入短期学术瓶颈:一方面,CNN走向成熟,并推动人脸支付、安防、手机影像等应用密集落地;另一方面,2017年Transformer出现,也提示下一代架构已经开始成为新的关注重点。

2.2

RNN技术发展复盘

RNN技术发展复盘的思路与CNN部分类似。为复盘RNN从兴起到Transformer时代的关键指引信号,我们系统梳理了1943—2023年RNN领域30篇核心论文。在此基础上,我们将RNN的发展阶段概括为:神经反馈与动态记忆思想萌芽→循环动力系统与联想记忆→Simple RNN序列建模成型→训练算法建立与长程依赖瓶颈→LSTM/GRU门控机制突破→深层化/双向化/端到端序列识别→Seq2Seq/Attention-RNN推动NLP爆发→Transformer替代与循环记忆思想融合。

我们梳理了RNN的核心发展节点及代表论文。其中,以红色加粗标注的Jordan Network、Elman Network、BPTT、长期依赖学习困难、LSTM、Seq2Seq、Bahdanau Attention与GNMT八篇论文,均为RNN领域里程碑成果:Jordan/Elman确立Simple RNN的序列建模范式;BPTT奠定循环网络训练基础,Bengio等系统揭示长程依赖瓶颈;LSTM以门控记忆机制破解该瓶颈,使长期依赖建模走向实用;Seq2Seq与Bahdanau Attention开创序列到序列与注意力范式;GNMT代表RNN+Attention机器翻译的工程化高峰,也是Transformer出现前的主流路线。

从学术派系演进看, RNN从1943年神经反馈思想到2023年状态空间模型复兴的演进主线为:神经反馈思想→动力系统与联想记忆→Simple RNN→训练算法与长程依赖瓶颈→LSTM/GRU门控突破→深层化/双向化/端到端识别→Seq2Seq/Attention-RNN→Transformer替代与记忆融合,直观展现门控、注意力与递归记忆思想的传承及跨源渗透。

我们对RNN重要论文的发表年份与引用量进行统计。高引用基础架构成果集中在1997年(LSTM)与2014年(Seq2Seq、Bahdanau Attention)两个高峰;2016年后,论文重心转向GNMT等工程化部署,以及Transformer-XL、S4、RWKV、Mamba等复兴/后继方向,引用量整体下移。这表明RNN在2016—2017年前后同样进入成熟与瓶颈阶段:Attention-RNN翻译走向工程化高峰的同时,2017年Transformer直接以self-attention取代循环,成为新一代主流架构。RNN的发展历程也一定程度证明了“成熟与高峰阶段论文占比提高→架构进入瓶颈→下一代架构带来跨越”的规律。

3

AI第一次爆发的落地局限

虽然AI1.0时代的技术出现了一定突破,但在产品落地方面仍有局限。我们认为,AI1.0使其模型能力主要停留在“单点感知能力提升”,尚未形成通用智能系统所需的理解、推理、交互和行动能力。因此,其输出通常需嵌入既有业务流程才能产生价值,难以独立成为用户反复使用的交互入口,天然限制0→1新品类的创造。具体则表现为落地场景过于垂直或附属于已有产品,例如安防中的识别场景或人脸识别支付场景。

4

风险提示

技术迭代不及预期的风险:数字 AI、物理 AI 技术进展低于预期,任务或应用场景拓宽速度低于预期。

大模型厂商 ARR 增速放缓的风险:若客户增长、续费率或客单价不及预期,模型厂商 ARR 增速可能放缓。

云服务商资本开支不及预期的风险:若自由现金流承压,或 AI 算力需求及投资回报低于预期,云服务商可能下调资本开支。

智能驾驶及机器人商业化落地不及预期的风险:若产品可靠性、成本下降或用户需求低于预期,相关产品商业化进程可能放缓。

最新代表报告

《【AI系列深度12期】从模块化到端到端》20260804

《【AI系列深度10期】预训练与后训练如何塑造大模型?》20260803

《【AI系列深度09期】从LLM到VLM再到VLA意味着什么?》20260803

东吴汽车团队介绍

团队荣誉

2025年证券时报(新财富)最佳分析师汽车行业第一名;

2024年证券时报(新财富)最佳分析师汽车行业第一名;

第二十一届新财富最佳分析师汽车和汽车零部件板块第二;

第二十届新财富最佳分析师汽车和汽车零部件板块第二;

第十九届新财富最佳分析师汽车和汽车零部件板块第三;

第十五届卖方分析师水晶球汽车及零部件板块第二;

第五届新浪财经金麒麟最佳分析师汽车行业第二;

第四届新浪财经金麒麟最佳分析师汽车行业第二;

第三届新浪财经金麒麟最佳分析师汽车行业第三;

Wind第十二届金牌分析师汽车板块第一;

Wind第十一届金牌分析师汽车板块第一;

Wind第十届金牌分析师汽车板块第一;

Wind第九届金牌分析师汽车板块第二;

上海证券报最佳分析师汽车板块第一;

黄细里 团队负责人

华中科技大学企业管理学士,上海交通大学企业管理硕士;

负责投资策略+汽车智能化主线,曾任职长江证券汽车分析师等,13年汽车行业研究工作经验

工作邮箱:huangxl@dwzq.com.cn

孟璐 团队成员

同济大学金融本硕;

聚焦全球化乘用车,5年汽车行业研究经验

工作邮箱:mengl@dwzq.com.cn

郭雨蒙 团队成员

中国海洋大学本科,北京航空航天大学硕士

聚焦零部件+机器人,2025年加入东吴证券,此前就职于民生证券、天风证券,5年汽车行业研究经验

工作邮箱:guoym@dwzq.com.cn

孙仁昊 团队成员

同济大学本科,香港中文大学(深圳)硕士

聚焦智能化零部件+客车,4年汽车行业研究经验

工作邮箱:sunrh@dwzq.com.cn

童明祺 团队成员

上海财经大学金融本硕

聚焦智能化乘用车,2025年加入东吴证券

工作邮箱:tongmq@dwzq.com.cn

公众号| 东吴汽车黄细里团队

请扫关注我们

免责声明:

本公众订阅号(微信号:东吴汽车黄细里团队)由东吴证券研究所汽车团队设立,系本研究团队研究成果发布的唯一订阅号。

本公众号所载的信息仅面向专业投资机构,仅供在新媒体背景下研究观点的及时交流。

本订阅号不是东吴证券研究所汽车团队研究报告的发布平台,所载内容均来自于东吴证券研究所已正式发布的研究报告或对已发布报告进行的跟踪与解读,如需了解详细的报告内容或研究信息,请具体参见东吴证券研究所已发布的完整报告。

本订阅号所载内容不构成对具体证券在具体价位、具体时点、具体市场表现的判断或投资建议,不能够等同于指导具体投资的操作性意见。本订阅号所载内容仅供参考之用,接收人不应单纯依靠本资料的信息而取代自身的独立判断,应自主做出投资决策并自行承担风险。东吴证券研究所及本研究团队不对任何因使用本订阅号所载任何内容所引致或可能引致的损失承担任何责任。

本订阅号对所载内容保留一切法律权利。订阅人对本订阅号发布的所有内容(包括文字、图片、影像等)未经书面许可,禁止复制、转载;经授权进行复制、转载的,需注明出处为“东吴证券研究所”,且不得对本订阅号所截内容进行任何有悖原意的引用、删节或修改。

特别声明:《证券期货投资者适当性管理办法》、《证券经营机构投资者适当性管理实施指引(试行)》于2017年7月1日起正式实施。通过新媒体形式制作的本订阅号推送信息仅面向东吴证券客户中的专业投资者,请勿在未经授权前进行任何形式的转发。若您非东吴证券客户中的专业投资者,为保证服务质量、控制投资风险,请取消关注本订阅号,请勿订阅、接收或使用本订阅号中的任何推送信息。因本订阅号难以设置访问权限,若给您造成不便,烦请谅解!感谢您给予的理解和配合。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199501