社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

JCP26||DeepONet神经算子给共轭梯度法"指路"——混合深度学习和迭代方法加速不可压Navier-Stokes方程求解(附代码数据)

AI4CFD • 3 月前 • 163 次点击  
Image

审稿/投稿宣传联系邮箱:xiongxiongnwpu@mail.nwpu.edu.cn

HyDEA:让 DeepONet 给共轭梯度法"指路"——混合深度学习加速不可压 NS 方程求解

代码数据

https://github.com/HMB9666/HyDEA

BAI H M, BIAN X. Hybrid deep learning and iterative methods for accelerated solutions of viscous incompressible flow[J]. Journal of Computational Physics, 2026: 114747.


封面:HyDEA混合深度学习加速NS方程求解
封面:HyDEA混合深度学习加速NS方程求解

导读

今天给大家推荐一篇发表在 Journal of Computational Physics 上的新工作。论文要解决的问题,做过不可压缩流动数值模拟的人都不陌生:用分步法(fractional step method)推进 Navier-Stokes 方程时,每一个时间步都要解一次压力 Poisson 方程(pressure Poisson equation,简称 PPE),而这一步往往是整个时间推进里最费时的环节。传统做法是上共轭梯度法(CG)或它的各种预条件变体,稳健是稳健,但收敛快慢被系数矩阵的条件数卡着,高雷诺数、细网格的时候动辄要几百次迭代。

那能不能让神经网络来加速?过去几年大家试过很多,但纯数据驱动的网络有两个绕不过去的坎:一是谱偏差(spectral bias)——网络擅长拟合解里平滑的低频成分,却很难刻画高频的小尺度细节;二是泛化差——换个雷诺数、换个边界、加个障碍物,在流场数据上训出来的模型就容易失灵,复杂流动里甚至直接发散。

这篇论文的作者 Heming Bai 和 Xin Bian(通讯作者,bianx@zju.edu.cn)来自浙江大学工程力学系、流体动力与机电系统国家重点实验室。他们给出的答案叫 HyDEA(Hybrid Deep lEarning line-search directions and iterative methods for Accelerated solutions)。这套方法最关键的一个想法,是不再把神经网络当成"端到端的求解器",而是把它降格使用——只让 DeepONet 在每一步迭代里预测一个"线搜索方向",然后和 CG 类方法交替执行:DeepONet 负责快速压低低频误差,CG 负责干净地消掉高频误差。二者在频域上正好互补,于是在顶盖驱动腔流(Re=1000~10000)、含固体结构的流固耦合、移动边界等一系列基准问题上,HyDEA 用一套固定不变的网络权重就把 PPE 的迭代次数从 250 次量级压到 10 次量级,还展示了从   训练网格直接外推到  高分辨率的"超分辨率"能力。代码也已经开源(GitHub 仓库 HMB9666/HyDEA)。


AI 智能体审稿意见(供参考)

下面这段是用 AI 智能体,按 ICLR / NeurIPS / JCP 这类顶会顶刊的尺度,对论文做的一次独立评审,分核心贡献、引文完整性、核心不足三块来说。

一、核心贡献

论文真正立得住的创新点有四个。第一,它把 DeepONet 的输出明确定位成线搜索方向,而不是直接预测压力场——这一步看似只是换了个说法,实则把混合求解器放进了经典线搜索方法的理论框架里,每一步的最优步长  都有严格的下降保证。第二,提出 DLSM(Deep Learning Line-Search Method),并把它和 CG 类方法交替组合成 HyDEA,利用神经网络与迭代法在频域上的互补性来加速。第三,训练数据不来自任何流场,而是直接从 PPE 系数矩阵  的近似特征向量里"伪造"出来,这是它能跨几何、跨雷诺数泛化的根本原因。第四,借助解耦浸没边界投影法(DIBPM)扩展到流固耦合时,PPE 的系统矩阵结构保持不变,于是同一套网络权重能直接用到含/不含障碍物的所有算例上,不需要重训。

二、引文完整性(联网核查结果)

我们逐条核对了论文的参考文献,并联网检索了相关方向最重要的几篇工作,结论是:论文对最直接的竞争者(DCDM、HINTS、Kopaničáková 的 DeepONet 预条件、Lan 等人的神经预条件 Poisson 求解器)都已经引用,引文基础是扎实的。但有两篇高度相关的工作确实没有出现在参考文献里,值得补上讨论:

  1. Rudikov 等人,"Neural operators meet conjugate gradients: The FCG-NO method for efficient PDE solving",ICML 2024。这篇把神经算子当作 flexible CG 的非线性预条件子,而且它的训练数据正是取自 Krylov 子空间里的残差向量、并支持跨分辨率复用——和 HyDEA"用系数矩阵伪造低频偏置训练样本""低分辨率训练高分辨率推理"的思路非常接近。论文 未引用,这是最该补的一篇。

  2. "Neural Preconditioning Operator (NPO)",arXiv:2502.01337,2025 年 2 月。它把代数多重网格原理嵌进 Transformer 架构做神经预条件,同样主打"不依赖具体物理场的训练"和"跨分辨率、跨区域泛化"。时间上早于本文,主张也高度重合,却未被引用

  3. Lan 等人的 Neural-Preconditioned Poisson Solver(ICML 2024):论文其实引用了它(编号[52]),但只是借用了它的损失函数形式,没有把它当作竞争方法做性能对比。考虑到这篇工作场景几乎一样(不可压流动里的 PPE),缺一个正面 benchmark 会让实验说服力打些折扣。

总的判断:这些遗漏不动摇 HyDEA 的核心原创性——它的真正新意在于"线搜索方向预测 + CG 交替"这个范式,而 FCG-NO、NPO 走的都是"神经预条件"的路子,技术定位本质不同。但补上 FCG-NO 的讨论是必要的,因为两者在训练数据构造上太像了。

三、核心不足

第一,实际加速没有迭代次数那么漂亮。迭代次数确实降了约 ,但墙钟时间(wall-time)的加速只有 ~。原因是 DLSM 每一步都要在 GPU 上跑一次 DeepONet 推理,外加 GPU-CPU 之间来回传数据,单步代价远高于一次 CG 迭代。对本来就有高效预条件(比如多重网格 MGPCG)的问题,加速比只有 。论文很坦诚地承认了这点,但没给出解决路径。

第二,目前只验证了二维均匀笛卡尔网格。DeepONet 的 branch 网络是基于卷积的 U-Net,天然要求输入是规则网格图像,三维或非结构网格需要重新设计架构。

第三,前期训练成本不低且不够透明 分辨率要训 18 小时, 要 41 小时;构造数据集时依赖 Lanczos 迭代估计特征向量, 时光这一步就要 3138 秒。对真正的大规模三维问题,这些前期投入要仔细权衡。

第四,交替策略是固定的、缺乏自适应。每一轮固定 3 步 CG + 2 步 DLSM(),论文在附录里也承认这两个数对性能影响显著,但没有根据残差的实时频谱去动态切换。


一、问题背景:PPE 为什么是瓶颈

先把不可压 NS 方程写出来,无量纲形式是

这里  是速度,  是压力, 是雷诺数。难点在于压力和速度通过不可压约束  隐式耦合在一起。分步法的做法是把这个耦合系统做块 LU 分解,拆成三步顺序求解:先解一个对流-扩散方程得到中间速度 ,再解压力增量、最后投影校正让速度无散。论文用交错网格上的有限差分离散,对流项走二阶 Adams-Bashforth 显式格式,扩散项走 Crank-Nicolson 隐式格式,整套流程基于开源求解器 PetIBM 实现。

三步里最贵的就是中间那一步——压力 Poisson 方程,论文把它写成紧凑形式

其中  是 Laplace 算子的离散近似,稀疏、对称、正定  是要求的压力增量, 是源项。这是一个大型稀疏对称正定线性系统,也正是整个时间推进里计算量最大的部分。用 CG 及其预条件变体(不完全 Cholesky 的 ICPCG、Jacobi 的 JPCG、多重网格的 MGPCG)都能稳定求解,但收敛快慢取决于  的条件数;雷诺数一高、网格一密,迭代次数就上去了。

这里有个很关键的观察,也是 HyDEA 全部设计的出发点:神经网络和传统迭代法在频域上的行为恰好相反。神经网络擅长捕捉解的低频(大尺度)成分,对高频细节无能为力;而 CG 这类迭代法正好相反,高频误差衰减很快,低频误差衰减极慢。既然一个管低频、一个管高频,那把它们拼起来,是不是就能把全频段的误差一起快速压下去?


二、核心思想:把神经网络当"线搜索方向预测器"

求解 ,等价于最小化一个二次函数

线搜索方法的套路是:在第  步,沿某个方向 、以步长  更新当前解,

其中  是当前残差。方向  怎么选,决定了方法属于哪一类:取  就是最速下降法;CG 则是通过 Gram-Schmidt 正交化构造一组关于  互相共轭( -正交)的方向。

论文真正的洞察在这句话:理论上,如果某一步的搜索方向恰好等于当前的迭代误差,那么一步就能精确收敛。当然  是未知的(知道它就等于知道答案了),但我们可以退一步——用 DeepONet 去预测这个误差的近似值 ,把它当搜索方向用。只要方向大致对,线搜索的最优步长公式会自动算出该走多远。这就是 DLSM(深度学习线搜索方法)的全部精神。

白板图:把神经网络当线搜索方向预测器
白板图:把神经网络当线搜索方向预测器

具体做法是把 PPE 改写成残差形式 ,让 DeepONet 学习从归一化残差  到误差  的映射。DLSM 的迭代流程(论文 Algorithm 1)很简洁:算初始残差  ;只要  还大于容差 ,就用网络预测方向 ,按  算最优步长,更新 ,再更新残差,如此往复。

值得一提的是,Kaneda 等人此前提出的 DCDM 其实是 DLSM 的一个特例——它额外对网络给出的方向做了一遍 Gram-Schmidt 正交化。论文在后面用实验说明:只要网络训得好,这步正交化是多余的,DLSM 和 DCDM 在 HyDEA 框架内表现几乎一样。


三、HyDEA:CG 与 DLSM 交替

DLSM 单独用会出问题:因为谱偏差,它压不住高频误差,迭代到后面高频分量会累积、振荡。所以论文把 DLSM 和 CG 类方法交替起来跑,这就是 HyDEA。一轮"混合算法"是这样的:先让 CG 类方法连做最多  步(默认 3 步),把高频误差清干净、得到一个"平滑过"的残差;再让 DLSM 连做最多  步(默认 2 步),把低频误差快速压下去。两者轮流,直到残差的  范数降到收敛阈值  以下。

论文 Figure 1:HyDEA 的工作流程
论文 Figure 1:HyDEA 的工作流程

图源论文 Figure 1:HyDEA 的工作流程。 是 CFD 时间步, 是当前时间步内求解 PPE 的迭代序号,atol 是预设的绝对收敛容差,每个时间步用上一步的结果  作初值。

这里有个细节值得注意:从 DLSM 切回 CG 时,CG 的内部状态(共轭方向那一套)是完全重启的,只把 DLSM 给出的当前解拿来当新的初值。另外,"谁先上"是有讲究的。论文给了两个版本:版本 I 是 CG 先行,版本 II 是 DLSM 先行。绝大多数算例都用版本 I,原因很实在——初始残差  是任意的,未必偏向  的低频段,直接喂给网络效果不好;先让 CG 跑几步把残差"平滑"一下,使它更接近训练数据的频域分布,DeepONet 才能给出更靠谱的方向。论文在移动圆柱那个复杂算例里做了正面对比,确认版本 I 收敛更快、更稳。


四、DeepONet 的网络架构

DLSM 里那个网络用的是 unstacked 版本的 DeepONet,由 Branch 网络和 Trunk 网络两部分组成。

论文 Figure 3:DeepONet 架构
论文 Figure 3:DeepONet 架构

图源论文 Figure 3:DeepONet 架构。Branch 网络是 U-Net 接一个前馈网络(FNN),Trunk 网络是标准 FNN,两者输出做点积。

因为计算域是均匀笛卡尔网格,残差场  可以自然地当成一张"图像"——每个网格点就是一个像素,残差值就是像素值。于是 Branch 网络用计算机视觉里很成熟的 U-Net(编码器-解码器加跳跃连接的卷积结构)来做多尺度特征提取,后面再接一个 FNN;默认通道基数  ,U-Net 深度 Trunk 网络则是个简单的 FNN,输入空间坐标 。最后 Branch 与 Trunk 的输出做点积,得到预测的搜索方向 


五、训练数据:来自矩阵,而不是流场

这是 HyDEA 泛化能力的命门所在,也是它和大多数数据驱动方法最不一样的地方。训练数据完全不依赖任何具体流场,而是直接从 PPE 系数矩阵  里"造"出来。

白板图:在矩阵上训练,而不是在流场上训练
白板图:在矩阵上训练,而不是在流场上训练

具体分两步。先对  做 Lanczos 迭代,把它约化成低维三对角矩阵,从而拿到  的一组近似特征向量(Ritz 向量),它们能代表  的整个频谱。然后把这些特征向量随机组合,构造出偏向低频的训练样本:

意思是:排在前面(低频)的那些特征向量,组合系数被放大 9 倍。超参数 (默认 )控制低频偏置的强弱, 越小、低频占比越高。为什么要偏向低频?因为这正是 CG 的软肋——CG 收敛慢恰恰是因为低频误差衰减慢,所以让网络专门去学低频,正好补上 CG 的短板。

损失函数也很干净:

注意它直接用了  和  的差,比 DCDM 的损失更简洁(论文也指出这个形式和 Lan 等人[52]的接近)。训练配置上:数据集大小固定 54000(和 CFD 分辨率无关),batch size 取 20,跑 1000 个 epoch、每个 epoch 1000 次迭代,用 Adam 配合 SAM(sharpness-aware minimization),余弦学习率从  起调,SAM 的扰动幅度也设为 

正因为训练只盯着矩阵  的频谱、不碰流场,同一套网络权重才能跨雷诺数、跨几何、加不加障碍物都直接用,无需重训或微调。这一点在后面的流固耦合实验里得到了很有说服力的验证。


六、谱互补性:为什么交替就能快一个数量级

光说"互补"还不够,论文用一个一维 Poisson 方程做了实打实的验证。它取一个频率成分已知、可控的人造解(由  一直叠到  的多个频率组成),在 2000 个节点上离散,分别用纯 CG 和 HyDEA(CG+DLSM)从零初值求解到 ,并把每一步迭代误差的功率谱密度(PSD)画出来。

论文 Figure 6:迭代误差的功率谱密度演化
论文 Figure 6:迭代误差的功率谱密度演化

图源论文 Figure 6:HyDEA(CG+DLSM)中误差的功率谱密度。(a) PSD 随迭代整体演化(灰条标出 DLSM 活跃区段);(b) 低波数  处的 PSD 演化曲线;(c)(d) DLSM↔CG 切换前后的 PSD 细节。

白板图:谱互补性原理
白板图:谱互补性原理

结果非常清楚。从 DLSM 切到 CG 时:CG 对低波数误差几乎没贡献,但能利落地把高波数误差的振荡压掉。 从 CG 切回 DLSM 时:DLSM 大幅降低低波数误差,但代价是会激起高波数误差的增长和振荡。一个负责低频、一个负责高频,两者轮番上阵,就能在短短几十步里把全频段的误差一起扫干净——这就是 HyDEA 比单一方法快一个数量级的根源。


七、核心代码与计算流程

论文代码开源在 GitHub 仓库 HMB9666/HyDEA。从工程实现看,它是个异构系统的拼接:DLSM 和 DeepONet 用 Python + PyTorch 写,部署在一块 NVIDIA RTX 4090 上CG 类方法直接调 PETSc 库(C 语言)的实现,通过 petsc4py 接口在 Python 里调用;CFD 求解器是开源的 PetIBM,PetIBM 和 Python 之间用 Pybind11 打通;所有 CG 计算跑在 Intel Xeon Silver 4210R 这块 CPU 上。

整个 HyDEA 求解 PPE 的计算流程,按"输入→处理→输出"可以这样概括:输入是系数矩阵 、源项 、初值 (取上一时间步的结果)和容差 处理是 CG 阶段与 DLSM 阶段交替迭代;输出是收敛后的压力增量 。用伪代码写出来是这样:

# HyDEA 核心迭代(CG 先行版本,版本 I)
dp = dp0                       # 初值,取上一时间步的 delta p
r  = S - M @ dp                # 初始残差
while norm(r, 2) > eps:
    # 阶段一:CG 类方法连做 Num_CG 步,清掉高频误差
    for _ in range(Num_CG):
        dp, r = cg_step(M, dp, r, preconditioner)   # 标准 CG / PCG
        if norm(r, 2) <= eps: break
    if norm(r, 2) <= eps: break
    # 阶段二:DLSM 连做 Num_DLSM 步,压低频误差
    for _ in range(Num_DLSM):
        e_nn  = deeponet(r / norm(r, 2))            # GPU 上推理出搜索方向
        alpha = (r @ e_nn) / (e_nn @ (M @ e_nn))    # 线搜索最优步长
        dp = dp + alpha * e_nn
        r  = S - M @ dp
        if norm(r, 2) <= eps:  break

如果 CFD 网格比训练分辨率高(超分辨率场景),只需要在 DLSM 这一步前后各加一次双线性插值:把高分辨率残差下采样到网络的训练分辨率喂进去,再把网络输出上采样回高分辨率。

# SR-HyDEA 里的 DLSM 步骤
r_low    = bilinear_downsample(r / norm(r, 2), size=(128128))
e_nn_low = deeponet(r_low)
e_nn     = bilinear_upsample(e_nn_low, size=(512512))

八、实验结果

8.1 二维顶盖驱动腔流 Re=1000

在  网格上( ,数据构造 268 秒、训练 18 小时,),把 HyDEA 和单独的 CG 类方法做对比。

论文 Figure 8:Re=1000 各时间步的迭代残差对比
论文 Figure 8:Re=1000 各时间步的迭代残差对比

图源论文 Figure 8:在第 10/100/1000 时间步求解 PPE 的迭代残差。(a)-(c) CG,(d)-(f) ICPCG,(g)-(i) JPCG,(j)-(l) MGPCG,每组都对比了 HyDEA 与对应的纯 CG 类方法。

最直观的是第 10 个时间步:纯 CG 要 250 多次迭代才到 ,HyDEA 只用 2 轮混合算法、合计 10 次迭代就收敛——迭代次数砍掉约 25 倍。随着流动趋于定常,需要的迭代越来越少(第 100 步 5 次、第 1000 步 4 次)。墙钟时间的加速比(连续推进 10000 个时间步统计)见下表:

方法
加速比
PPE 总计算时间 (s)
其中 DeepONet 推理 (s)
HyDEA (CG + DLSM-1)
×3.83
71
39
HyDEA (ICPCG + DLSM-1)
×1.88
83
38
HyDEA (JPCG + DLSM-1)
×3.56
75
39
HyDEA (MGPCG + DLSM-1)
×1.64
167
35

可以看到一个很诚实的现象:墙钟加速(~)远没有迭代次数缩减()那么夸张,因为 DeepONet 推理本身就吃掉了一半左右的时间(39s/71s),再加上 Python/PyTorch 的解释开销和 GPU-CPU 数据传输。论文明确说,本文重点是把算法框架和泛化能力立起来,效率优化留给将来。

8.2 二维顶盖驱动腔流 Re=3200

调到  网格(,数据构造 3138 秒、训练 41 小时),加速比反而更高:

方法
加速比
PPE 总计算时间 (s)
HyDEA (CG + DLSM-2)
×5.96
131
HyDEA (ICPCG + DLSM-2)
×2.82
162
HyDEA (JPCG + DLSM-2)
×5.64
134
HyDEA (MGPCG + DLSM-2)
×2.08
342

分辨率越高、加速越明显,这说明 HyDEA 对高分辨率模拟更有潜力。速度剖面和 Ghia 等人的经典基准吻合得很好,精度没有因为引入网络而打折。

8.3 超分辨率: 训练, 推理

这是论文最亮眼的能力之一。直接拿 8.1 节那个在  上训好的 DeepONet(不重训),通过双线性插值用到更高分辨率的 Re=10000 流动上:

  • (放大 ):有效加速
  • (放大 ):有效加速
  • 放大 ):仍然有效加速
  • (放大 ):性能开始退化

也就是说,放大倍数不超过  时超分辨率都管用,再激进就不行了——这暴露了低分辨率网络外推到高分辨率的固有上限。

论文 Figure 18:512×512 超分辨率下的速度场对比
论文 Figure 18:512×512 超分辨率下的速度场对比

图源论文 Figure 18:Re=10000、 网格在第 5000/10000 时间步的速度场。SR-HyDEA(只用  的 DeepONet)与高分辨率 ICPCG 的结果基本一致。

8.4 流固耦合:一套权重打通多种几何

接下来是泛化能力的硬核验证。用和 8.2 节 Re=3200 完全相同的 DeepONet 权重(DLSM-2,不重训不微调),开启 DIBPM,直接用到三个含固体结构的算例上:腔内一个固定圆柱、两个固定椭圆柱(长短轴比 4:3)、以及一个往复振荡的圆柱(Re=100、KC=5)。

结果是,HyDEA 在所有这些情形里都显著少于纯 ICPCG 的迭代次数。以含一个固定圆柱为例,HyDEA(ICPCG+DLSM-2) 在第 10/100/1000 步分别只要 15/9/4 次迭代;最难的振荡圆柱算例(几何在动),第 10/1000/3400 步分别要 48/16/16 次。关键在于这一切都用同一套网络权重完成——"基于矩阵训练"的策略确实赋予了跨场景的泛化能力。这背后的道理是:DIBPM 做完块 LU 分解后,PPE 的系统矩阵仍然保持  的结构不变,所以网络见到的线性系统"长得一样",自然能直接用。

8.5 一个重要对照:神经网络不能完全替代迭代法

在最难的移动圆柱算例里,论文把纯数据驱动的 DCDM、DLSM 单独拿出来和 HyDEA 比。结果很说明问题:DCDM 和 DLSM 一开始残差降得挺快,但很快就卡在平台上——DLSM 停在  量级下不去,DCDM 在  时甚至发散,都到不了  的目标容差。而 HyDEA 和纯 ICPCG 都能稳稳收敛,只是 HyDEA 用的迭代次数少得多。这个对照直接回答了一个本质问题:神经网络只能增强经典迭代器,不能替代它——混合方案不是锦上添花,而是必需的。


九、总结

核心贡献回顾

回头看,HyDEA 立起来的是一种新的混合求解范式:不是把神经网络当"预条件子"(这是 HINTS、NPO 那一派的路子),而是当"线搜索方向预测器"。这个定位有明确的数学依据——二次优化里的线搜索理论保证了每一步的步长  都让目标函数严格下降,所以网络方向哪怕不完美,整个迭代也不会崩。而训练数据取自系数矩阵  的 Lanczos 分解而非流场,是它泛化能力的根。

从工程角度,我们觉得最值得记住的一条启示是:在 CFD 里引入机器学习,不一定非要追求"端到端替代",完全可以在经典算法的框架里塞进一个学习组件,用经典方法兜底来保证收敛性和鲁棒性。

局限性

一是墙钟加速有限(~),瓶颈在 DeepONet 推理和 GPU-CPU 通信,对已有高效预条件的问题优势不明显;二是目前只验证了二维均匀笛卡尔网格,受限于 CNN 架构;三是前期训练和数据构造成本可观(18~41 小时训练、 时数据构造 3138 秒)。

未来展望与值得探索的空白

顺着这条线往下,有几个方向我们觉得很值得做,也是当前混合求解器领域的空白:

  1. 自适应交替策略。现在 HyDEA 用固定的 3+2 步交替,这显然不是最优。如果能根据残差的实时频谱动态决定什么时候切换、各做几步,应该还能再快一截——这本质是个调度/路由问题,可以借鉴强化学习的思路。

  2. 推理轻量化。DeepONet 推理占了 HyDEA 一半以上的时间。知识蒸馏、网络剪枝、TensorRT 部署,或者干脆换更轻的卷积架构(比如深度可分离卷积),都有希望把单步推理代价压下一个数量级——一旦 DLSM 单步代价能和一次 CG 迭代相当,那  的迭代缩减就能直接兑换成等比例的墙钟加速。这是工程优化问题,不是算法瓶颈。

  3. 非均匀网格与三维扩展。这是走向实用的关键一步。值得一提的是,同一团队(Bai、Zhang、Cai、Bian)已经在 arXiv:2604.01800 上放出了后续工作,专门把 HyDEA 推广到非均匀笛卡尔网格,说明这个方向确实是他们的下一步重点。再往后,用图神经网络或 PointNet 类架构处理真正的非结构网格,会是更大的挑战。

  4. 跨分辨率的"通用"网络。现在每种分辨率基本要单独训一个网络,超分辨率插值又有  的上限。能不能训一个真正跨分辨率的"基础模型"式 DeepONet,是降低部署门槛的关键。

  5. 无矩阵(matrix-free)训练。当前损失函数   需要显式的矩阵-向量乘 ,大规模三维问题里  的存储和计算都很贵。探索 matrix-free 的训练方式,是走向大规模应用绕不开的一关。

  6. 与区域分解/并行结合。对超大规模问题,子域内用 HyDEA、子域间用 Schwarz 等区域分解迭代,可能是实现真正大规模并行加速的可行路径,论文结论里也提到了这个想法。


我们的思考

这篇工作给我们最大的触动,其实是关于"混合"这件事的态度。过去几年 AI for Science 里有一种很强的倾向——想用端到端的深度学习把传统数值方法整个替换掉。但 HyDEA(以及更早的 HINTS)展示了一条更务实的路:让机器学习做它擅长的(全局、大尺度的模式识别),让经典方法做它擅长的(局部、高频的精细分辨),两者通过一个精心设计的接口协同。

而"线搜索方向预测"这个切入点尤其聪明。它等于在说:"CG 的共轭方向已经很好了,但我们能不能用学习的办法给出更好的方向?"——这是对经典算法的增强而非替代。这种思路在工业界可能更容易被接受,因为你随时可以退回纯 CG,最坏也不会比 baseline 差。从 8.5 节那个"纯网络会发散、混合才稳"的对照来看,这种"有兜底"的设计哲学,恰恰是它能在复杂流动里站住脚的原因。

当然,~ 的加速,对工业应用来说还是偏保守。但正如论文自己点出的,这更多是个实现层面的工程问题:迭代次数已经实打实降了 ,剩下的就看推理延迟能不能压下去。从这个角度看,HyDEA 更像是把一个有潜力的算法框架先立住了,真正的效率红利还在后面。



Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/197019