https://github.com/HMB9666/HyDEA
BAI H M, BIAN X. Hybrid deep learning and iterative methods for accelerated solutions of viscous incompressible flow[J]. Journal of Computational Physics, 2026: 114747.
封面:HyDEA混合深度学习加速NS方程求解
导读 今天给大家推荐一篇发表在 Journal of Computational Physics 上的新工作。论文要解决的问题,做过不可压缩流动数值模拟的人都不陌生:用分步法(fractional step method)推进 Navier-Stokes 方程时,每一个时间步都要解一次 压力 Poisson 方程 (pressure Poisson equation,简称 PPE),而这一步往往是整个时间推进里最费时的环节。传统做法是上共轭梯度法(CG)或它的各种预条件变体,稳健是稳健,但收敛快慢被系数矩阵的条件数卡着,高雷诺数、细网格的时候动辄要几百次迭代。
那能不能让神经网络来加速?过去几年大家试过很多,但纯数据驱动的网络有两个绕不过去的坎:一是 谱偏差 (spectral bias)——网络擅长拟合解里平滑的低频成分,却很难刻画高频的小尺度细节;二是泛化差——换个雷诺数、换个边界、加个障碍物,在流场数据上训出来的模型就容易失灵,复杂流动里甚至直接发散。
这篇论文的作者 Heming Bai 和 Xin Bian (通讯作者,bianx@zju.edu.cn)来自浙江大学工程力学系、流体动力与机电系统国家重点实验室。他们给出的答案叫 HyDEA (Hybrid Deep lEarning line-search directions and iterative methods for Accelerated solutions)。 这套方法最关键的一个想法,是不再把神经网络当成"端到端的求解器",而是把它降格使用——只让 DeepONet 在每一步迭代里预测一个"线搜索方向",然后和 CG 类方法交替执行:DeepONet 负责快速压低低频误差,CG 负责干净地消掉高频误差。 二者在频域上正好互补,于是在顶盖驱动腔流(Re=1000~10000)、含固体结构的流固耦合、移动边界等一系列基准问题上,HyDEA 用 一套固定不变的网络权重 就把 PPE 的迭代次数从 250 次量级压到 10 次量级,还展示了从
训练网格直接外推到 高分辨率的"超分辨率"能力。代码也已经开源(GitHub 仓库 HMB9666/HyDEA )。
AI 智能体审稿意见(供参考) 下面这段是用 AI 智能体,按 ICLR / NeurIPS / JCP 这类顶会顶刊的尺度,对论文做的一次独立评审,分核心贡献、引文完整性、核心不足三块来说。
一、核心贡献
论文真正立得住的创新点有四个。第一,它把 DeepONet 的输出明确定位成 线搜索方向 ,而不是直接预测压力场——这一步看似只是换了个说法,实则把混合求解器放进了经典线搜索方法的理论框架里,每一步的最优步长 都有严格的下降保证。第二,提出 DLSM(Deep Learning Line-Search Method),并把它和 CG 类方法交替组合成 HyDEA,利用神经网络与迭代法在频域上的互补性来加速。第三,训练数据不来自任何流场,而是直接从 PPE 系数矩阵 的近似特征向量里"伪造"出来,这是它能跨几何、跨雷诺数泛化的根本原因。第四,借助解耦浸没边界投影法(DIBPM)扩展到流固耦合时,PPE 的系统矩阵结构保持不变,于是同一套网络权重能直接用到含/不含障碍物的所有算例上,不需要重训。
二、引文完整性(联网核查结果)
我们逐条核对了论文的参考文献,并联网检索了相关方向最重要的几篇工作,结论是: 论文对最直接的竞争者(DCDM、HINTS、Kopaničáková 的 DeepONet 预条件、Lan 等人的神经预条件 Poisson 求解器)都已经引用,引文基础是扎实的。 但有两篇高度相关的工作确实没有出现在参考文献里,值得补上讨论:
Rudikov 等人,"Neural operators meet conjugate gradients: The FCG-NO method for efficient PDE solving",ICML 2024。 这篇把神经算子当作 flexible CG 的非线性预条件子,而且它的训练数据正是取自 Krylov 子空间里的残差向量、并支持跨分辨率复用——和 HyDEA"用系数矩阵伪造低频偏置训练样本""低分辨率训练高分辨率推理"的思路非常接近。论文
未引用 ,这是最该补的一篇。
"Neural Preconditioning Operator (NPO)",arXiv:2502.01337,2025 年 2 月。 它把代数多重网格原理嵌进 Transformer 架构做神经预条件,同样主打"不依赖具体物理场的训练"和"跨分辨率、跨区域泛化"。时间上早于本文,主张也高度重合,却 未被引用 。
Lan 等人的 Neural-Preconditioned Poisson Solver(ICML 2024) :论文其实引用了它(编号[52]),但只是借用了它的损失函数形式, 没有把它当作竞争方法做性能对比 。考虑到这篇工作场景几乎一样(不可压流动里的 PPE),缺一个正面 benchmark 会让实验说服力打些折扣。
总的判断: 这些遗漏不动摇 HyDEA 的核心原创性 ——它的真正新意在于"线搜索方向预测 + CG 交替"这个范式,而 FCG-NO、NPO 走的都是"神经预条件"的路子,技术定位本质不同。但补上 FCG-NO 的讨论是必要的,因为两者在训练数据构造上太像了。
三、核心不足
第一, 实际加速没有迭代次数那么漂亮 。迭代次数确实降了约 ,但墙钟时间(wall-time)的加速只有
~ 。原因是 DLSM 每一步都要在 GPU 上跑一次 DeepONet 推理,外加 GPU-CPU 之间来回传数据,单步代价远高于一次 CG 迭代。对本来就有高效预条件(比如多重网格 MGPCG)的问题,加速比只有 。论文很坦诚地承认了这点,但没给出解决路径。
第二, 目前只验证了二维均匀笛卡尔网格 。DeepONet 的 branch 网络是基于卷积的 U-Net,天然要求输入是规则网格图像,三维或非结构网格需要重新设计架构。
第三, 前期训练成本不低且不够透明 。
分辨率要训 18 小时, 要 41 小时;构造数据集时依赖 Lanczos 迭代估计特征向量, 时光这一步就要 3138 秒。对真正的大规模三维问题,这些前期投入要仔细权衡。
第四, 交替策略是固定的、缺乏自适应 。每一轮固定 3 步 CG + 2 步 DLSM( 、
),论文在附录里也承认这两个数对性能影响显著,但没有根据残差的实时频谱去动态切换。
一、问题背景:PPE 为什么是瓶颈 先把不可压 NS 方程写出来,无量纲形式是
这里 是速度,
是压力, 是雷诺数。难点在于压力和速度通过不可压约束 隐式耦合在一起。分步法的做法是把这个耦合系统做块 LU 分解,拆成三步顺序求解:先解一个对流-扩散方程得到中间速度 ,再解压力增量、最后投影校正让速度无散。论文用交错网格上的有限差分离散,对流项走二阶 Adams-Bashforth 显式格式,扩散项走 Crank-Nicolson 隐式格式,整套流程基于开源求解器 PetIBM 实现。
三步里最贵的就是中间那一步——压力 Poisson 方程,论文把它写成紧凑形式
其中 是 Laplace 算子的离散近似, 稀疏、对称、正定 ;
是要求的压力增量, 是源项。这是一个大型稀疏对称正定线性系统, 也正是整个时间推进里计算量最大的部分 。用 CG 及其预条件变体(不完全 Cholesky 的 ICPCG、Jacobi 的 JPCG、多重网格的 MGPCG)都能稳定求解,但收敛快慢取决于 的条件数;雷诺数一高、网格一密,迭代次数就上去了。
这里有个很关键的观察,也是 HyDEA 全部设计的出发点:神经网络和传统迭代法在频域上的行为恰好相反。 神经网络擅长捕捉解的低频(大尺度)成分,对高频细节无能为力;而 CG 这类迭代法正好相反,高频误差衰减很快,低频误差衰减极慢。 既然一个管低频、一个管高频,那把它们拼起来,是不是就能把全频段的误差一起快速压下去?
二、核心思想:把神经网络当"线搜索方向预测器" 求解 ,等价于最小化一个二次函数
线搜索方法的套路是:在第
步,沿某个方向 、以步长 更新当前解,
其中
是当前残差。 方向 怎么选,决定了方法属于哪一类 :取 就是最速下降法;CG 则是通过 Gram-Schmidt 正交化构造一组关于 互相共轭(
-正交)的方向。
论文真正的洞察在这句话:理论上,如果某一步的搜索方向恰好等于当前的 迭代误差
,那么一步就能精确收敛。当然 是未知的(知道它就等于知道答案了),但我们可以退一步—— 用 DeepONet 去预测这个误差的近似值 ,把它当搜索方向用。只要方向大致对,线搜索的最优步长公式会自动算出该走多远。 这就是 DLSM(深度学习线搜索方法)的全部精神。
白板图:把神经网络当线搜索方向预测器 具体做法是把 PPE 改写成残差形式
,让 DeepONet 学习从归一化残差 到误差 的映射。DLSM 的迭代流程(论文 Algorithm 1)很简洁:算初始残差
;只要 还大于容差 ,就用网络预测方向
,按
算最优步长,更新
,再更新残差,如此往复。
值得一提的是,Kaneda 等人此前提出的 DCDM 其实是 DLSM 的一个特例——它额外对网络给出的方向做了一遍 Gram-Schmidt 正交化。论文在后面用实验说明: 只要网络训得好,这步正交化是多余的 ,DLSM 和 DCDM 在 HyDEA 框架内表现几乎一样。
三、HyDEA:CG 与 DLSM 交替 DLSM 单独用会出问题:因为谱偏差,它压不住高频误差,迭代到后面高频分量会累积、振荡。所以论文把 DLSM 和 CG 类方法交替起来跑,这就是 HyDEA。一轮"混合算法"是这样的:先让 CG 类方法连做最多
步(默认 3 步),把高频误差清干净、得到一个"平滑过"的残差;再让 DLSM 连做最多 步(默认 2 步),把低频误差快速压下去。两者轮流,直到残差的 范数降到收敛阈值 以下。
论文 Figure 1:HyDEA 的工作流程
图源论文 Figure 1:HyDEA 的工作流程。 是 CFD 时间步, 是当前时间步内求解 PPE 的迭代序号,atol 是预设的绝对收敛容差,每个时间步用上一步的结果 作初值。
这里有个细节值得注意:从 DLSM 切回 CG 时,CG 的内部状态(共轭方向那一套)是 完全重启 的,只把 DLSM 给出的当前解拿来当新的初值。另外,"谁先上"是有讲究的。论文给了两个版本: 版本 I 是 CG 先行 ,版本 II 是 DLSM 先行。绝大多数算例都用版本 I,原因很实在——初始残差
是任意的,未必偏向 的低频段,直接喂给网络效果不好;先让 CG 跑几步把残差"平滑"一下,使它更接近训练数据的频域分布,DeepONet 才能给出更靠谱的方向。论文在移动圆柱那个复杂算例里做了正面对比,确认版本 I 收敛更快、更稳。
四、DeepONet 的网络架构 DLSM 里那个网络用的是 unstacked 版本的 DeepONet,由 Branch 网络和 Trunk 网络两部分组成。
论文 Figure 3:DeepONet 架构 图源论文 Figure 3:DeepONet 架构。Branch 网络是 U-Net 接一个前馈网络(FNN),Trunk 网络是标准 FNN,两者输出做点积。
因为计算域是均匀笛卡尔网格,残差场 可以自然地当成一张"图像"——每个网格点就是一个像素,残差值就是像素值。于是 Branch 网络用计算机视觉里很成熟的 U-Net (编码器-解码器加跳跃连接的卷积结构)来做多尺度特征提取,后面再接一个 FNN;默认通道基数
,U-Net 深度 。 Trunk 网络 则是个简单的 FNN,输入空间坐标 。最后 Branch 与 Trunk 的输出做点积,得到预测的搜索方向
。
五、训练数据:来自矩阵,而不是流场 这是 HyDEA 泛化能力的命门所在,也是它和大多数数据驱动方法最不一样的地方。 训练数据完全不依赖任何具体流场,而是直接从 PPE 系数矩阵 里"造"出来。
白板图:在矩阵上训练,而不是在流场上训练 具体分两步。先对
做 Lanczos 迭代,把它约化成低维三对角矩阵,从而拿到 的一组近似特征向量(Ritz 向量)
,它们能代表 的整个频谱。然后把这些特征向量随机组合,构造出 偏向低频 的训练样本:
意思是:排在前面(低频)的那些特征向量,组合系数被放大 9 倍。超参数 (默认 )控制低频偏置的强弱, 越小、低频占比越高。 为什么要偏向低频? 因为这正是 CG 的软肋——CG 收敛慢恰恰是因为低频误差衰减慢,所以让网络专门去学低频,正好补上 CG 的短板。
损失函数也很干净:
注意它直接用了 和 的差,比 DCDM 的损失更简洁(论文也指出这个形式和 Lan 等人[52]的接近)。训练配置上:数据集大小固定 54000(和 CFD 分辨率无关),batch size 取 20,跑 1000 个 epoch、每个 epoch 1000 次迭代,用 Adam 配合 SAM(sharpness-aware minimization),余弦学习率从
起调,SAM 的扰动幅度也设为 。
正因为训练只盯着矩阵 的频谱、不碰流场, 同一套网络权重才能跨雷诺数、跨几何、加不加障碍物都直接用,无需重训或微调。 这一点在后面的流固耦合实验里得到了很有说服力的验证。
六、谱互补性:为什么交替就能快一个数量级 光说"互补"还不够,论文用一个一维 Poisson 方程做了实打实的验证。它取一个频率成分已知、可控的人造解(由
一直叠到 的多个频率组成),在 2000 个节点上离散,分别用纯 CG 和 HyDEA(CG+DLSM)从零初值求解到 ,并把每一步迭代误差的 功率谱密度 (PSD)画出来。
论文 Figure 6:迭代误差的功率谱密度演化 图源论文 Figure 6:HyDEA(CG+DLSM)中误差的功率谱密度。(a) PSD 随迭代整体演化(灰条标出 DLSM 活跃区段);(b) 低波数 处的 PSD 演化曲线;(c)(d) DLSM↔CG 切换前后的 PSD 细节。
白板图:谱互补性原理 结果非常清楚。 从 DLSM 切到 CG 时 :CG 对低波数误差几乎没贡献,但能利落地把高波数误差的振荡压掉。
从 CG 切回 DLSM 时 :DLSM 大幅降低低波数误差,但代价是会激起高波数误差的增长和振荡。一个负责低频、一个负责高频,两者轮番上阵,就能在短短几十步里把全频段的误差一起扫干净——这就是 HyDEA 比单一方法快一个数量级的根源。
七、核心代码与计算流程 论文代码开源在 GitHub 仓库 HMB9666/HyDEA 。从工程实现看,它是个异构系统的拼接: DLSM 和 DeepONet 用 Python + PyTorch 写,部署在一块 NVIDIA RTX 4090 上 ; CG 类方法直接调 PETSc 库(C 语言)的实现 ,通过 petsc4py 接口在 Python 里调用;CFD 求解器是开源的 PetIBM,PetIBM 和 Python 之间用 Pybind11 打通;所有 CG 计算跑在 Intel Xeon Silver 4210R 这块 CPU 上。
整个 HyDEA 求解 PPE 的计算流程,按"输入→处理→输出"可以这样概括: 输入 是系数矩阵 、源项 、初值
(取上一时间步的结果)和容差 ; 处理 是 CG 阶段与 DLSM 阶段交替迭代; 输出 是收敛后的压力增量 。用伪代码写出来是这样:
# HyDEA 核心迭代(CG 先行版本,版本 I) dp = dp0 # 初值,取上一时间步的 delta p r = S - M @ dp # 初始残差 while norm(r, 2 ) > eps: # 阶段一:CG 类方法连做 Num_CG 步,清掉高频误差 for _ in range(Num_CG): dp, r = cg_step(M, dp, r, preconditioner) # 标准 CG / PCG if norm(r, 2 ) <= eps: break if norm(r, 2 ) <= eps: break # 阶段二:DLSM 连做 Num_DLSM 步,压低频误差 for _ in range(Num_DLSM): e_nn = deeponet(r / norm(r, 2 )) # GPU 上推理出搜索方向 alpha = (r @ e_nn) / (e_nn @ (M @ e_nn)) # 线搜索最优步长 dp = dp + alpha * e_nn r = S - M @ dp if norm(r, 2 ) <= eps:
break 如果 CFD 网格比训练分辨率高(超分辨率场景),只需要在 DLSM 这一步前后各加一次双线性插值:把高分辨率残差 下采样 到网络的训练分辨率喂进去,再把网络输出 上采样 回高分辨率。
# SR-HyDEA 里的 DLSM 步骤 r_low = bilinear_downsample(r / norm(r, 2 ), size=( 128 , 128 )) e_nn_low = deeponet(r_low) e_nn = bilinear_upsample(e_nn_low, size=( 512 , 512 )) 八、实验结果 8.1 二维顶盖驱动腔流 Re=1000 在 网格上(
、 ,数据构造 268 秒、训练 18 小时,
、 、 ),把 HyDEA 和单独的 CG 类方法做对比。
论文 Figure 8:Re=1000 各时间步的迭代残差对比 图源论文 Figure 8:在第 10/100/1000 时间步求解 PPE 的迭代残差。(a)-(c) CG,(d)-(f) ICPCG,(g)-(i) JPCG,(j)-(l) MGPCG,每组都对比了 HyDEA 与对应的纯 CG 类方法。
最直观的是第 10 个时间步: 纯 CG 要 250 多次迭代才到 ,HyDEA 只用 2 轮混合算法、合计 10 次迭代就收敛——迭代次数砍掉约 25 倍。 随着流动趋于定常,需要的迭代越来越少(第 100 步 5 次、第 1000 步 4 次)。墙钟时间的加速比(连续推进 10000 个时间步统计)见下表:
可以看到一个很诚实的现象: 墙钟加速( ~ )远没有迭代次数缩减( )那么夸张 ,因为 DeepONet 推理本身就吃掉了一半左右的时间(39s/71s),再加上 Python/PyTorch 的解释开销和 GPU-CPU 数据传输。论文明确说,本文重点是把算法框架和泛化能力立起来,效率优化留给将来。
8.2 二维顶盖驱动腔流 Re=3200 调到
网格( ,数据构造 3138 秒、训练 41 小时),加速比反而更高:
分辨率越高、加速越明显 ,这说明 HyDEA 对高分辨率模拟更有潜力。速度剖面和 Ghia 等人的经典基准吻合得很好,精度没有因为引入网络而打折。
8.3 超分辨率:
训练, 推理 这是论文最亮眼的能力之一。直接拿 8.1 节那个在
上训好的 DeepONet(不重训),通过双线性插值用到更高分辨率的 Re=10000 流动上:
也就是说, 放大倍数不超过 时超分辨率都管用,再激进就不行了 ——这暴露了低分辨率网络外推到高分辨率的固有上限。
论文 Figure 18:512×512 超分辨率下的速度场对比
图源论文 Figure 18:Re=10000、 网格在第 5000/10000 时间步的速度场。SR-HyDEA(只用 的 DeepONet)与高分辨率 ICPCG 的结果基本一致。
8.4 流固耦合:一套权重打通多种几何 接下来是泛化能力的硬核验证。用 和 8.2 节 Re=3200 完全相同的 DeepONet 权重 (DLSM-2,不重训不微调),开启 DIBPM,直接用到三个含固体结构的算例上:腔内一个固定圆柱、两个固定椭圆柱(长短轴比 4:3)、以及一个往复振荡的圆柱(Re=100、KC=5)。
结果是,HyDEA 在所有这些情形里都显著少于纯 ICPCG 的迭代次数。以含一个固定圆柱为例,HyDEA(ICPCG+DLSM-2) 在第 10/100/1000 步分别只要 15/9/4 次迭代;最难的振荡圆柱算例(几何在动),第 10/1000/3400 步分别要 48/16/16 次。 关键在于这一切都用同一套网络权重完成——"基于矩阵训练"的策略确实赋予了跨场景的泛化能力。 这背后的道理是:DIBPM 做完块 LU 分解后,PPE 的系统矩阵仍然保持 的结构不变,所以网络见到的线性系统"长得一样",自然能直接用。
8.5 一个重要对照:神经网络不能完全替代迭代法 在最难的移动圆柱算例里,论文把纯数据驱动的 DCDM、DLSM 单独拿出来和 HyDEA 比。结果很说明问题: DCDM 和 DLSM 一开始残差降得挺快,但很快就卡在平台上——DLSM 停在 量级下不去,DCDM 在 时甚至发散,都到不了
的目标容差。 而 HyDEA 和纯 ICPCG 都能稳稳收敛,只是 HyDEA 用的迭代次数少得多。这个对照直接回答了一个本质问题:神经网络只能 增强 经典迭代器,不能 替代 它——混合方案不是锦上添花,而是必需的。
九、总结 核心贡献回顾 回头看,HyDEA 立起来的是一种新的混合求解范式:不是把神经网络当"预条件子"(这是 HINTS、NPO 那一派的路子),而是当"线搜索方向预测器"。这个定位有明确的数学依据——二次优化里的线搜索理论保证了每一步的步长 都让目标函数严格下降,所以网络方向哪怕不完美,整个迭代也不会崩。而训练数据取自系数矩阵 的 Lanczos 分解而非流场,是它泛化能力的根。
从工程角度,我们觉得最值得记住的一条启示是: 在 CFD 里引入机器学习,不一定非要追求"端到端替代",完全可以在经典算法的框架里塞进一个学习组件,用经典方法兜底来保证收敛性和鲁棒性。
局限性 一是墙钟加速有限(
~ ),瓶颈在 DeepONet 推理和 GPU-CPU 通信,对已有高效预条件的问题优势不明显;二是目前只验证了二维均匀笛卡尔网格,受限于 CNN 架构;三是前期训练和数据构造成本可观(18~41 小时训练、 时数据构造 3138 秒)。
未来展望与值得探索的空白 顺着这条线往下,有几个方向我们觉得很值得做,也是当前混合求解器领域的空白:
自适应交替策略 。现在 HyDEA 用固定的 3+2 步交替,这显然不是最优。如果能根据残差的实时频谱动态决定什么时候切换、各做几步,应该还能再快一截——这本质是个调度/路由问题,可以借鉴强化学习的思路。
推理轻量化 。DeepONet 推理占了 HyDEA 一半以上的时间。知识蒸馏、网络剪枝、TensorRT 部署,或者干脆换更轻的卷积架构(比如深度可分离卷积),都有希望把单步推理代价压下一个数量级——一旦 DLSM 单步代价能和一次 CG 迭代相当,那 的迭代缩减就能直接兑换成等比例的墙钟加速。这是工程优化问题,不是算法瓶颈。
非均匀网格与三维扩展 。这是走向实用的关键一步。值得一提的是, 同一团队(Bai、Zhang、Cai、Bian)已经在 arXiv:2604.01800 上放出了后续工作,专门把 HyDEA 推广到非均匀笛卡尔网格 ,说明这个方向确实是他们的下一步重点。再往后,用图神经网络或 PointNet 类架构处理真正的非结构网格,会是更大的挑战。
跨分辨率的"通用"网络 。现在每种分辨率基本要单独训一个网络,超分辨率插值又有 的上限。能不能训一个真正跨分辨率的"基础模型"式 DeepONet,是降低部署门槛的关键。
无矩阵(matrix-free)训练 。当前损失函数
需要显式的矩阵-向量乘
,大规模三维问题里 的存储和计算都很贵。探索 matrix-free 的训练方式,是走向大规模应用绕不开的一关。
与区域分解/并行结合 。对超大规模问题,子域内用 HyDEA、子域间用 Schwarz 等区域分解迭代,可能是实现真正大规模并行加速的可行路径,论文结论里也提到了这个想法。
我们的思考 这篇工作给我们最大的触动,其实是关于"混合"这件事的态度。过去几年 AI for Science 里有一种很强的倾向——想用端到端的深度学习把传统数值方法整个替换掉。但 HyDEA(以及更早的 HINTS)展示了一条更务实的路: 让机器学习做它擅长的(全局、大尺度的模式识别),让经典方法做它擅长的(局部、高频的精细分辨),两者通过一个精心设计的接口协同。
而"线搜索方向预测"这个切入点尤其聪明。它等于在说:"CG 的共轭方向已经很好了,但我们能不能用学习的办法给出更好的方向?"——这是对经典算法的 增强 而非 替代 。这种思路在工业界可能更容易被接受,因为你随时可以退回纯 CG,最坏也不会比 baseline 差。从 8.5 节那个"纯网络会发散、混合才稳"的对照来看,这种"有兜底"的设计哲学,恰恰是它能在复杂流动里站住脚的原因。
当然, ~
的加速,对工业应用来说还是偏保守。但正如论文自己点出的,这更多是个实现层面的工程问题:迭代次数已经实打实降了 ,剩下的就看推理延迟能不能压下去。从这个角度看,HyDEA 更像是把一个有潜力的算法框架先立住了,真正的效率红利还在后面。