Py学习  »  机器学习算法

【阿姆斯特丹博士论文】终端设备上的高效深度学习推理

专知 • 1 年前 • 210 次点击  

深度学习(Deep Learning, DL)作为机器学习(Machine Learning, ML)一个强大分支,能够通过深度神经网络(DNNs)自动大规模数据集中提取层次特征,近年得到广泛应用。能力推动多个领域发展,包括医疗保健、计算视觉、自然语言处理以及自动系统等。然而,资源受限终端设备(智能手机设备)运行深度学习模型面临显著挑战,主要包括计算能力受限、控制以及延迟需求。

论文解决处理系统片(Heterogeneous Multi-Processing System-on-Chips, HMPSoCs)进行深度学习推理 问题。此类系统通常集成了 CPU 集群、GPU 神经网络处理单元(Neural Processing Units, NPUs),各自具有不同效、性能精度取舍。研究聚焦处理协同利用,提升推理延迟表现、电源效率吞吐量。准确性、性能功耗之间进行平衡,实现资源受限设备高效推理关键目标。

研究核心贡献如下:

1. 基于切换延迟化(Layer-Switching):

提出一种配置切换策略,深度学习模型每一分配能够最小整体推理延迟处理器(CPU 或 GPU)。方法特别适用增强现实(AR)虚拟 现实(VR)延迟高度敏感应用,确保牺牲性的前提实现理想性能。

2. 结合 DVFS 切换提升效:

为了解决满足延迟约束同时功耗问题,研究结合动态电压频率调整(Dynamic Voltage and Frequency Scaling, DVFS)配置的 CPU/GPU 切换方法。方案牺牲性能前提下,最大限度降低处理功耗,使深度学习模型能够电池供电设备功耗范围运行,维持目标延迟表现。

3. NPU 集成准确率、功耗、性能之间权衡:

深度学习设计的 NPU 显著提升性能,量化 操作可能引入精度损失。为此,提出一种选择量化方法,部分网络进行量化在 NPU 运行,其余保持精度。方法准确性、计算性能之间实现平衡。

4. 基于处理流水线执行吞吐量化:

提升系统吞吐量,研究设计一种基于流水线执行策略,预先模型划分至 CPU 集群、GPU 和 NPU 不同处理阶段,使得多个处理并行处理不同部分模型。这种方式支持视频处理吞吐量应用所需率(FPS),同时保持功耗延迟开销。

5. 框架实现发布:ARM-CO-UP

研究一个重要成果开发发布名为 ARM-CO-UP框架,框架支持在 HMPSoCs 高效执行深度学习推理。主要功能包括处理切换、流水线执行、DVFS 控制,以及执行时间功耗分析。ARM-CO-UP 支持 CPU、GPU 与 NPU 之间协同执行设计,一个灵活扩展工具,用于实验不同方案、切换策略执行模型,推动资源受限终端设备深度学习部署具有重要意义。

论文研究成果有助推动先进人工智能(AI)技术日常设备部署,使得深度学习模型能够资源受限环境高效运行。 提出集成框架领域持续探索提供实用扩展解决方案。



专知便捷查看,访问下面网址或点击最底端“阅读原文”

https://www.zhuanzhi.ai/vip/ab494cf9cec27c27e0c5c8dc75138089

图片

点击“阅读原文”,查看下载本文

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/182126