Py学习  »  机器学习算法

深度学习最常见的5种模型创新路线,Baseline跑通后可以这样改

AI算法科研paper • 13 小时前 • 11 次点击  

很多人做深度学习,Baseline跑通了,结果也有了,然后就不知道怎么改了。搞最后就只剩下几个老思路:加Attention、换卷积、堆Transformer……

其实模型创新没那么难,很多工作本质上都可以归到几个比较稳定的改造位置。总结一下其实就是深度学习最常见的5条创新路线。

不过,知道从哪里创新,和知道具体怎么改完全两回事。所以我在整理这5条路线的时候,也把对应的366个即插即用模块一起整理了出来,大多来自相关顶会工作,并按照创新位置进行了分类。无偿分享!

扫描下方二维码添加小享
回复【366即用】无偿获取

具体用法也很简单:找到你的任务痛点,选一个对口模块,插进去,跑实验,写论文。

下面就按照这5条路线展开:

① 模型增强,先看特征是不是没学好

这是最常见的一条路线。改注意力、改融合,成本低、见效快,是论文创新的基本盘,核心都是解决原模型提取到的特征还不够好的问题。

所以如果你的Baseline已经比较成熟,通常可以先从特征表达能力入手。

这条路线我配备了96个即插即用模块,包含:

  • 注意力机制
  • 特征融合
  • 特征增强
  • ......

随便挑一个插进去,就是一篇论文的创新点。

② 结构创新,直接改“怎么提特征”

比如卷积结构、特征提取、下采样、网络分支等。这类方法不是简单加一个模块,而是重新考虑:原来的特征提取方式是不是存在瓶颈?

如果论文想做得更像一个完整的方法创新,这条路线就很适合,会比单纯换个Attention更值得深入。

这部分我准备了92个即插即用模块,包含:

  • 卷积模块
  • 特征提取
  • 多尺度融合
  • ......

从卷积核到骨干网络,改哪里都能涨点。

③ 前沿技术融合:从传统到新范式

常见的一种路线就是传统网络+新技术。这类方向的优势是比较容易产生新的研究组合,但也最容易出现一个问题:为了蹭热点而融合,最后只是把两个东西拼起来。

真正值得做的是先找到传统方法的痛点,再思考新技术能不能解决这个问题。

这条路线我梳理了50个即插即用模块,包含:

  • LLM
  • 扩散模型
  • Mamba
  • ......

让你不用从头训大模型也能蹭上热点。

④ 效率优化:不只追求精度

轻量化、低计算量、低参数量、快速推理……如果你的模型已经很难继续刷精度,就可以换个问题:能不能在性能基本不掉的情况下,让模型更快、更小?

这类创新也比较适合有部署需求的任务。

这部分我梳理了26个即插即用模块,包含:

  • 轻量化
  • 上采样
  • 下采样

让你的论文既有创新又有落地价值。

⑤ 特定任务场景:针对任务本身下手

这条路线很多人容易忽略。比如时序、图像分割、目标检测、多模态等,不同任务本身就存在不同的痛点。

与其无脑给模型加模块,不如先问:这个任务最特殊的问题是什么?然后围绕任务设计结构。

这条路线我准备了99个即插即用模块,包含:

  • 语义分割
  • 图像生成
  • AI+医学
  • ......

任务专用,覆盖几十个方向。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200649