怎样利用强化学习提高文本分类的效果
correct me if I\u0026#39;m wrong,但是这个问题感觉没必要用强化学习。用户的评分直接就指示了分类结果的好坏,是很好的label,没必要当成reward来用RL。此外因为不涉及多轮交互,硬要用RL最后其实会退化成regression。
■网友
谢邀。个人认为没有必要用RL做文本分类。RL强调agent与环境的多次交互,文本方面最接近的应该是广告点击优化提升,但用于文本分类颇为牵强。
■网友
尝试过使用RL(Policy Gradient)来做类似二分类的模型,后面发现效果一直提不高。
个人认为理由可以从优化的角度简单来进行解释:
在监督学习中,我们会使用交叉熵来比较两个分布的差异。进而使用梯度下降法来逼近我们想要的梯度。
。其中
为对应的标签,
则为输出的概率。
然而,在强化学习中,是没有对应的label的。那么我们怎么进行优化呢?这种情况,我们会基于reward来充当我们的label。
我们会使用如下的式子做为损失函数进行计算:
,其中
表示采取
策略的发生概率,N为采样
的数目。
而题主说反馈为0,1来作为反馈。实际上就相当于为这个文本进行标注,这个时候相当于退化为普通二分类版本的有监督学习了。
【怎样利用强化学习提高文本分类的效果】 个人见解 如有错漏,欢迎指出~
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 河北承德危险废物综合利用处置率达100%
- 黄金时间■黄金时间丨打造海绵城市:节水从利用雨水开始
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
- 银行it人怎样转型
- |淮阴水政充分利用“双随机”平台 促进执法公平公正
- 汽车|冬天怎样让车内温度快速升高?座椅加热的最佳使用方式二,外循环的作用总结
- 怎样进入通信行业
- 怎样评价扶他柠檬茶的小说《云养汉》的结尾
