新智元忒修斯之船启发下的知识蒸馏新思路 | EMNLP 2020( 二 )
事实上 , Theseus压缩与知识蒸馏的思路有些类似 , 都是鼓励压缩模型模仿原始模型的行为 , 但 Theseus 压缩有很多独特的优势 。
首先 , Theseus压缩在压缩过程中仅使用任务特定的损失函数 。 而基于知识蒸馏的方法除了使用任务特定的损失函数外 , 还需加入繁琐的蒸馏损失函数作为优化目标 。
其次 , 与近期研究 TinyBERT等不同 , Theseus 压缩不使用 Transformer 特定特征进行压缩 , 这就为压缩广泛模型提供了可能性 。 与知识蒸馏仅使用原始模型执行推断不同 , 该方法允许前辈模型与压缩后的接替者模型共同训练 , 从而实现更深层次的梯度级交互 , 并简化训练过程 。
此外 , 混合了前辈模块和接替者模块的不同模块组合还添加了额外的正则化项(类似于 Dropout) 。 该方法基于课程学习(Curriculum Learning)方法来驱动模块替换 , 将模块替换概率从低到高逐渐增加 , 从而实现优异的BERT压缩性能 。
利用Theseus 压缩方法压缩得到的 BERT 模型运算速度是之前的1.94 倍 , 并且保留了原始模型超过 98% 的性能 , 优于其它基于知识蒸馏的压缩的基线方法 。
本文插图
通过在预训练语言模型 BERT 上的成功实验 , 微软亚洲研究院的研究员们希望可以为模型压缩打开一种全新的思路 , 并希望看到这一方法在计算机视觉等领域的更广泛应用 。
【新智元忒修斯之船启发下的知识蒸馏新思路 | EMNLP 2020】
推荐阅读
- 登时间之船对话时尚之都,奏东西交响沉醉世界知音
- 普罗米修斯创造男人 宙斯创造女人 而她给了人类灵魂
- 阿莱克修斯|东罗马帝国的一代雄主,因女儿而出名,他的雄才大略是否真实?
- 马克·加索尔|美记:继马修斯、哈雷尔后,湖人接近一份底薪签下小加索尔
- 新智元微软亚研院副院长周明:从语言智能到代码智能
- 新智元在北京,人工智能也能评职称了!来看你够不够申请资格?
- 新智元 美国开始搞6G了:苹果谷歌等加入“下一代G联盟”,跳过5G
- 新智元|美国开始搞6G了:苹果谷歌等加入“下一代G联盟”,跳过5G
- 新智元 64岁Python之父决定加入微软,将开源进行到底!,退休失败
- 新智元罗马教宗方济各11月祈祷主题:让AI和机器人「永远为人类服务」
