新智元忒修斯之船启发下的知识蒸馏新思路 | EMNLP 2020( 二 )


事实上 , Theseus压缩与知识蒸馏的思路有些类似 , 都是鼓励压缩模型模仿原始模型的行为 , 但 Theseus 压缩有很多独特的优势 。
首先 , Theseus压缩在压缩过程中仅使用任务特定的损失函数 。 而基于知识蒸馏的方法除了使用任务特定的损失函数外 , 还需加入繁琐的蒸馏损失函数作为优化目标 。
其次 , 与近期研究 TinyBERT等不同 , Theseus 压缩不使用 Transformer 特定特征进行压缩 , 这就为压缩广泛模型提供了可能性 。 与知识蒸馏仅使用原始模型执行推断不同 , 该方法允许前辈模型与压缩后的接替者模型共同训练 , 从而实现更深层次的梯度级交互 , 并简化训练过程 。
此外 , 混合了前辈模块和接替者模块的不同模块组合还添加了额外的正则化项(类似于 Dropout) 。 该方法基于课程学习(Curriculum Learning)方法来驱动模块替换 , 将模块替换概率从低到高逐渐增加 , 从而实现优异的BERT压缩性能 。
利用Theseus 压缩方法压缩得到的 BERT 模型运算速度是之前的1.94 倍 , 并且保留了原始模型超过 98% 的性能 , 优于其它基于知识蒸馏的压缩的基线方法 。
新智元忒修斯之船启发下的知识蒸馏新思路 | EMNLP 2020
本文插图
通过在预训练语言模型 BERT 上的成功实验 , 微软亚洲研究院的研究员们希望可以为模型压缩打开一种全新的思路 , 并希望看到这一方法在计算机视觉等领域的更广泛应用 。
【新智元忒修斯之船启发下的知识蒸馏新思路 | EMNLP 2020】


推荐阅读