怎样利用强化学习提高文本分类的效果

correct me if I\u0026#39;m wrong,但是这个问题感觉没必要用强化学习。用户的评分直接就指示了分类结果的好坏,是很好的label,没必要当成reward来用RL。此外因为不涉及多轮交互,硬要用RL最后其实会退化成regression。

■网友
谢邀。个人认为没有必要用RL做文本分类。RL强调agent与环境的多次交互,文本方面最接近的应该是广告点击优化提升,但用于文本分类颇为牵强。
■网友
尝试过使用RL(Policy Gradient)来做类似二分类的模型,后面发现效果一直提不高。
个人认为理由可以从优化的角度简单来进行解释:
在监督学习中,我们会使用交叉熵来比较两个分布的差异。进而使用梯度下降法来逼近我们想要的梯度。
怎样利用强化学习提高文本分类的效果
。其中 怎样利用强化学习提高文本分类的效果
为对应的标签, 怎样利用强化学习提高文本分类的效果
则为输出的概率。
然而,在强化学习中,是没有对应的label的。那么我们怎么进行优化呢?这种情况,我们会基于reward来充当我们的label。
我们会使用如下的式子做为损失函数进行计算:
怎样利用强化学习提高文本分类的效果
,其中 怎样利用强化学习提高文本分类的效果
表示采取 怎样利用强化学习提高文本分类的效果
策略的发生概率,N为采样 怎样利用强化学习提高文本分类的效果
的数目。
而题主说反馈为0,1来作为反馈。实际上就相当于为这个文本进行标注,这个时候相当于退化为普通二分类版本的有监督学习了。

【怎样利用强化学习提高文本分类的效果】 个人见解 如有错漏,欢迎指出~


    推荐阅读