神经网络量化压缩方法、装置及存储介质与流程

    技术2026-07-18  10


    本公开涉及数据处理,尤其涉及神经网络量化压缩方法、装置及存储介质。


    背景技术:

    1、随着神经网络的发展,大型神经网络具有越来越多的层级和数据量,这为神经网络的部署带来了挑战。

    2、相关技术中,通过压缩、编码等方式减小网络规模。其中,量化是较为广泛采用的压缩方法之一。例如,将高精度的浮点数投影为低精度量化值,例如,将32位浮点数转化为8位定点数,采用8比特数据流来保存输入、输出数据以及权重等参数,以降低带宽需求。

    3、然而,目前的量化压缩方法,运行功耗,运行速度以及运行性能之间不能达到较好的平衡。


    技术实现思路

    1、为克服相关技术中存在的问题,本公开提供一种神经网络量化压缩方法、装置及存储介质。

    2、根据本公开实施例的第一方面,提供一种神经网络量化压缩方法,包括:获取待进行量化压缩的神经网络;基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置,并基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置;通过联合量化器对所述局部最优分段量化配置和所述局部最优混合精度量化配置进行联合优化,得到所述神经网络的最优量化配置;基于所述最优量化配置,对所述神经网络进行量化压缩。

    3、在一种实施方式中,所述基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置,包括:基于多个不同的比特位切分生成器,并行对所述神经网络进行不同比特位切分,得到用于量化压缩的多个比特位切分候选配置方案;将所述多个比特位切分候选配置方案,分别输入至各自的分段压缩量化器进行量化压缩,得到多个分段量化配置;基于判别器在所述多个分段量化配置中,确定最优分段量化配置作为所述神经网络的局部最优分段量化配置。

    4、在一种实施方式中,所述方法还包括:将所述最优量化配置反馈至所述最优量化配置对应的比特位切分生成器,以优化所述比特位切分生成器下一次对所述神经网络进行不同比特位切分采用的比特位。

    5、在一种实施方式中,所述多个不同的比特位切分生成器包括:随机比特位切分生成器、基于性能优先策略的不同比特位切分生成器、以及基于功耗优先策略的不同比特位切分生成器。

    6、在一种实施方式中,所述基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置,包括:通过随机比特位生成器,随机生成所述神经网络的不同神经元层集合的混合比特量化配置;对所述不同神经元层集合的混合比特量化配置,进行量化压缩;通过性能判别器,确定所述不同神经元层集合的混合比特量化配置的性能;将所述性能与所述混合比特量化配置做帕累托最优判别,得到所述神经网络的局部最优混合精度量化配置。

    7、在一种实施方式中,所述基于所述最优量化配置,对所述神经网络进行量化压缩,包括:将所述最优量化配置发送至运行所述神经网络的端侧,由所述端侧基于所述最优量化配置对所述神经网络进行量化压缩。

    8、在一种实施方式中,所述方法还包括:确定执行所述神经网络量化压缩设备所支持的并行执行指令;基于所述并行执行指令,执行所述神经网络量化压缩方法。

    9、在一种实施方式中,所述神经网络为循环神经网络、长短期记忆递归神经网络、门控循环单元递归神经网络中的一种或多种。

    10、根据本公开实施例的第二方面,提供一种神经网络量化压缩装置,包括:获取单元,用于获取待进行量化压缩的神经网络;处理单元,用于在获取单元获取到神经网络时,基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置,并基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置;联合单元,用于通过联合量化器对所述局部最优分段量化配置和所述局部最优混合精度量化配置进行联合优化,得到所述神经网络的最优量化配置;量化单元,用于基于所述最优量化配置,对所述神经网络进行量化压缩。

    11、在一种实施方式中,所述处理单元采用如下方式基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置:基于多个不同的比特位切分生成器,并行对所述神经网络进行不同比特位切分,得到用于量化压缩的多个比特位切分候选配置方案;将所述多个比特位切分候选配置方案,分别输入至各自的分段压缩量化器进行量化压缩,得到多个分段量化配置;基于判别器在所述多个分段量化配置中,确定最优分段量化配置作为所述神经网络的局部最优分段量化配置。

    12、在一种实施方式中,所述装置还包括:反馈单元;所述反馈单元,用于将所述最优量化配置反馈至所述最优量化配置对应的比特位切分生成器,以优化所述比特位切分生成器下一次对所述神经网络进行不同比特位切分采用的比特位。

    13、在一种实施方式中,所述多个不同的比特位切分生成器包括:随机比特位切分生成器、基于性能优先策略的不同比特位切分生成器、以及基于功耗优先策略的不同比特位切分生成器。

    14、在一种实施方式中,所述处理单元采用如下方式基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置:通过随机比特位生成器,随机生成所述神经网络的不同神经元层集合的混合比特量化配置;对所述不同神经元层集合的混合比特量化配置,进行量化压缩;通过性能判别器,确定所述不同神经元层集合的混合比特量化配置的性能;将所述性能与所述混合比特量化配置做帕累托最优判别,得到所述神经网络的局部最优混合精度量化配置。

    15、在一种实施方式中,所述量化单元采用如下方法量化压缩:将所述最优量化配置发送至运行所述神经网络的端侧,由所述端侧基于所述最优量化配置对所述神经网络进行量化压缩。

    16、在一种实施方式中,所述处理单元还用于:确定执行所述神经网络量化压缩设备所支持的并行执行指令;基于所述并行执行指令,执行所述神经网络量化压缩方法。

    17、在一种实施方式中,所述神经网络为循环神经网络、长短期记忆递归神经网络、门控循环单元递归神经网络中的一种或多种。

    18、根据本公开的第三方面,提供了一种神经网络量化压缩装置,包括处理器;用于存储处理器可执行指令的存储器;其中,所述处理器被配置为:执行前述第一方面或者第一方面中任意一种实施方式中所述的方法。

    19、根据本公开的第四方面,提供了一种存储介质,存储介质存储有指令,所述指令由所述终端中的处理器执行时,使得所述终端执行第一方面或者第一方面中任意一种实施方式中的所述的方法。

    20、本公开的实施例提供的技术方案可以包括以下有益效果:通过本公开,神经网络通过分段均匀压缩量化判别器和混合精度压缩判别器以及联合量化压缩判别器能够全面、高效地进行量化压缩,使得量化压缩的运行功耗,运行速度以及运行性能达到较好的平衡。

    21、应当理解的是,以上的一般描述和后文的细节描述仅是示例性和解释性的,并不能限制本公开。


    技术特征:

    1.一种神经网络量化压缩方法,其特征在于,包括:

    2.根据权利要求1所述的方法,其特征在于,所述基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置,包括:

    3.根据权利要求2所述的方法,其特征在于,所述方法还包括:

    4.根据权利要求2或3所述的方法,其特征在于,所述多个不同的比特位切分生成器包括:

    5.根据权利要求1所述的方法,其特征在于,所述基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置,包括:

    6.根据权利要求1所述的方法,其特征在于,所述基于所述最优量化配置,对所述神经网络进行量化压缩,包括:

    7.根据权利要求1所述的方法,其特征在于,所述方法还包括:

    8.根据权利要求1所述的方法,其特征在于,所述神经网络为循环神经网络、长短期记忆递归神经网络、门控循环单元递归神经网络中的一种或多种。

    9.一种神经网络量化压缩装置,其特征在于,所述装置包括:

    10.根据权利要求9所述的装置,其特征在于,所述处理单元采用如下方式基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置:

    11.根据权利要求10所述的装置,其特征在于,所述装置还包括:反馈单元;

    12.根据权利要求10或11所述的装置,其特征在于,所述多个不同的比特位切分生成器包括:

    13.根据权利要求9所述的装置,其特征在于,所述处理单元采用如下方式基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置:

    14.根据权利要求9所述的装置,其特征在于,所述量化单元采用如下方法量化压缩:

    15.根据权利要求9所述的装置,其特征在于,所述处理单元还用于:

    16.根据权利要求9所述的装置,其特征在于,所述神经网络为循环神经网络、长短期记忆递归神经网络、门控循环单元递归神经网络中的一种或多种。

    17.一种神经网络量化压缩装置,其特征在于,包括:

    18.一种存储介质,其特征在于,所述存储介质存储有指令,所述指令由终端中的处理器执行时,使得所述终端执行权利要求1-8中任意一项所述的方法。


    技术总结
    本公开是关于一种神经网络量化压缩方法、装置及存储介质。神经网络量化压缩方法,应用于终端,神经网络量化压缩方法包括:获取待进行量化压缩的神经网络;基于分段均匀压缩量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优分段量化配置,并基于混合精度量化判别器对所述神经网络进行量化压缩,得到所述神经网络的局部最优混合精度量化配置;通过联合量化器对所述局部最优分段量化配置和所述局部最优混合精度量化配置进行联合优化,得到所述神经网络的最优量化配置;基于所述最优量化配置,对所述神经网络进行量化压缩。通过本公开,使得神经网络的量化压缩的运行功耗,运行速度以及运行性能达到较好的平衡。

    技术研发人员:罗博源
    受保护的技术使用者:北京小米移动软件有限公司
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-45494.html

    最新回复(0)